本文へ移動

PDFの表をExcelに変換

端末内のPDFから表を抽出し、行と列を確認して編集可能なExcelファイルに保存します。ファイルはブラウザー内で処理されます。

PDFとページ

ブラウザー内で処理します。

端末に保存したPDFを選択してください(25 MBまで)。ウェブリンクには非対応です。テキストPDF専用で、スキャンのOCRは行いません。

サンプルPDFを保存

2ページのサンプルです。結合見出し付きの罫線表と、文字位置が揃った表を含みます。00123、café、Київ、=1+1を確認できます。

空欄で全ページ、または1, 3-5のように指定。最大30ページです。

PDFの数値形式を選択してください。先頭の0と長い数値は文字列で保持します。

抽出した表

PDFを選択して表を抽出してください。保存前にプレビューを確認してください。

PDFの表をExcelに変換する手順

  1. 端末内のPDFを選択するか、2ページのサンプルを読み込みます。サンプルも通常のファイルと同じ抽出・Excel保存処理を使います。元のPDFをダウンロードして結果と並べて比較できます。
  2. 「ページ」を空欄にすると全体を処理します(最大30ページ)。長いPDFでは2-8などの範囲や1, 4, 7-9のようにページを指定してください。重複したページ番号は1回だけ、文書内の順番で処理します。
  3. セル値の保存方式を選びます。識別番号やコード、異なる国の数値形式が混在する場合は「すべて文字列として保持」が安全です。数値形式は元のPDFと一致する場合だけ選んでください。
  4. 「表を抽出」を押し、表の選択欄から各結果を確認します。スクロール領域内の全行とページごとの注意書きを確認してください。不要な表は「この表をExcelに含める」のチェックを外します。
  5. 「Excelを保存 (.xlsx)」を押し、ExcelやLibreOfficeなどで開きます。選択した表はそれぞれ別シートになります。P2_T1はPDFの2ページ目で最初に検出した表を意味します。

復元できる内容

PDFには通常、表計算のセルではなく文字や線を描く位置が記録されています。この位置情報を行と列に組み直します。明確な長方形の罫線がある表に適しています。空のセルは空のまま、複数行の文字は同じセル内に保持し、長方形の結合範囲は実際のExcel結合セルに復元できます。

罫線がない場合は、列の空白が揃った3行以上のテキストを探します。この方式の結果は特に注意して確認してください。間隔だけから結合セルは推定しません。複数の表や別ページの表は分離したまま、繰り返しの見出しも残します。検出した表の外側にある文章は出力しません。

確認できる2つの例

サンプルの1ページ目には4列にまたがる見出しのある罫線表があります。見出しはA1:D1の結合範囲に入ります。識別番号00123の先頭の0、caféとКиївのUnicode文字を保持します。=1+1はExcel数式に変換せず、そのまま文字列として保存します。

2ページ目は罫線のない3列表です。Product、Quantity、Priceが別々の列になっていることを確認してください。小数点形式では12.50を数値12.5として保存し、表示を小数2桁にします。文字列形式では12.50の文字列のままです。どちらも実際に編集できるセルを作ります。

数値・識別番号・数式の扱い

数値の選択肢は1,234.56と1.234,56を区別し、抽出全体に適用します。形式が混在または不明な場合は文字列を選んでください。Excel上の区切り記号はExcel側の言語設定に従う場合があります。日付、通貨記号、パーセント、指数表記は推測して変換せず文字列にします。

先頭に0のある識別番号、有効桁数が15桁を超える値、小数部が15桁を超える値は、Excelの丸めを避けるため文字列にします。=、+、@で始まる文字を数式にはしません。単純な負の数は数値化できますが、-1+2のような式は文字列です。マクロ、外部リンク、計算式による合計は生成しません。

未対応の資料と処理上限

スキャン画像にはOCRが必要ですが、このツールには搭載していません。選択できる文字レイヤー付きのスキャンは、文字位置が正しければ処理できる場合があります。文字のないページ、対応する表がないページ、回転文字や縦書きのページは注意書きで明示します。混在したPDFでは、対応ページの検出できた表だけを保存します。

ファイルは25 MBまで、一度に30ページまでです。出力は合計12,000セル、表ごとに50列、100表、合計500,000文字が上限です。Excelの1セルは32,767文字までです。複雑なPDFでメモリを使いすぎないよう、文字項目数と描画処理数にも上限があります。上限に達した場合はページ数を減らしてください。

パスワード、文字コピー制限、PDFの破損、特殊なフォント符号化は抽出を妨げる場合があります。可能なら元のアプリケーションから、文字を選択できるPDFを書き出し直してください。グラフ、画像、色、フォント、元のページレイアウトはExcelへコピーしません。重要な数値や空白セルは元の資料と照合してください。

よくある質問

PDFはアップロードされますか?

されません。PDFの解析とExcelの作成はブラウザー内で行います。変換サービスへファイルを送信せず、ページを離れた後も保存しません。閉じる前にExcelファイルをダウンロードしてください。

キャンセルやファイルの変更はできますか?

できます。キャンセルは抽出または保存処理を停止します。削除はファイルと結果を消し、設定を残します。クリアは設定も初期化します。ファイル・ページ・値形式を変えると旧結果は無効になるため、保存前に再抽出してください。

表やセルが欠けるのはなぜですか?

明確な罫線または一定の文字間隔が必要です。特殊な線、重なった文字、複雑な結合構造などは認識できない場合があります。横罫線の表ではグループ見出し、複数行の見出し、空白セルを保持できます。上付き・下付き文字は10^(20)やlog_(k)のように区別できる文字列として保存し、数式の計算は行いません。すべてのプレビューと注意書きを確認してください。ファイルを保存できても完全な抽出を保証するものではありません。

複数ページに続く表は1つに結合されますか?

結合しません。各表はページ番号と表番号のシートに分かれます。繰り返しの見出しや列順を確認してから、表計算ソフトで必要な表をまとめてください。

プレビューを編集できますか?

プレビューは表の確認と選択用です。値の編集、セル境界の修正、書式調整は保存したExcelで行ってください。出力は画像の貼り付けや名前を変更したCSVではなく、実際のセルです。