Webサービスを利用しないでPDFを無料でWordやExcelに変換する方法

WebサービスへPDFをアップロードせずにWordやExcel形式へ変換する方法はあります。ただし「完全無料」「レイアウトそのまま」「スキャンも自動認識」を同時に満たす手段ではありません。Word・Excelを既に契約している場合のローカル機能と、無料ソフトだけで行う手作業を分けるのが重要です。まずPDFが文字主体、表主体、画像スキャンのどれかを見分け、原本のコピーで変換し、必ず内容を照合します。

目次

結論:PDFの種類と目的で方法を選ぶ

文章を再編集したいなら、WordのライセンスがあるPCではWordでPDFを開く方法が最も簡単です。無料だけで行うならLibreOffice DrawでPDFを開き、必要なテキストをWriterへ移してDOCX形式で保存します。表をExcelへ移したいなら、ExcelのPower QueryにあるPDFコネクター、無料ならTabulaで表をCSVへ抽出してLibreOffice CalcでXLSXとして保存する方法があります。

スキャナーで取り込んだPDFはページ全体が画像で、文字やセルを直接抽出できません。この場合はOCRが必要です。OCRの認識率は原稿品質、言語、縦書き、罫線で変わり、誤字や桁ずれも起きます。本記事は特定の無料OCR製品を推奨せず、組織で承認されたローカルOCRがある場合だけ利用する前提です。機密PDFを無料オンライン変換へ送る回避策は採りません。

変換前にPDFを3点確認する

文字を選択できるか

PDFビューアーで1文をドラッグしてコピーし、テキストエディターへ貼り付けます。正しい順序で文字になるならテキストPDFです。ページ全体が画像として選ばれる、文字化けする、段組み順が崩れる場合は、単純変換の精度が下がります。コピー制限が設定されている文書は、解除を試みず作成者へ編集可能な原稿を依頼します。

最終目的を決める

文章の再利用、表データの集計、見た目を保った保管では最適な形式が異なります。見た目を保持するだけならPDFのままが適切です。Word化は段落や見出しを編集しやすくする代わりに改ページや図の位置が変わります。Excel化は表データをセルへ戻す作業であり、PDFページ全体を同じ見た目のワークシートへ変えるものではありません。

原本と検証範囲を決める

原本は読み取り専用の場所に残し、作業用コピーを別名で作ります。最初は2~3ページだけで試し、見出し、脚注、ページ番号、表、画像、日本語フォントを確認します。変換前後のページ数、金額、日付、合計、固有名詞を重点照合します。電子署名付きPDFはコピーや保存によって検証状態の扱いが変わるため、署名済み原本へ上書きしません。

Wordを既に使える場合:PDFを直接開く

デスクトップ版Wordで「ファイル」→「開く」からローカルPDFを選ぶと、WordはPDFのコピーを編集可能な文書へ変換します。元のPDF自体は変更されません。Microsoftは、この方法が主に文字で構成されたPDFで最も適し、元のPDFとページ単位で完全には一致しないと説明しています。図表が多いページは画像になり、文字を編集できない場合があります。

変換後は、表示しただけで完了とせず、変更履歴を有効にして修正するか、少なくとも原本と左右に並べて確認します。ヘッダー・フッター、脚注、段組み、表の結合セル、改ページを重点的に見ます。問題なければ「名前を付けて保存」でDOCXとして保存します。この方法を「無料」と呼べるのは、Wordの有効なライセンスを既に持ち、追加の変換料金が不要という意味に限られます。Word自体を無料で提供する手順ではありません。

Excelを既に使える場合:Power Queryで表を読む

対応するデスクトップ版Excelでは「データ」→「データの取得」→「ファイルから」→「PDFから」を選び、ローカルファイルを指定します。Navigatorに検出された表やページが表示されたら、プレビューを確認して「読み込み」または「データの変換」を選びます。Power QueryのPDFコネクターは表データの取り込み用であり、Word文書のような本文全体の変換機能ではありません。

複数行の見出し、ページをまたぐ表、罫線のない表、数値に見える文字列は誤認されることがあります。読み込み後に列型、桁区切り、小数点、日付、マイナス値、合計を原本と照合します。Power Queryの手順は再実行できる利点がありますが、元PDFの構造が変わると結果も変わります。クエリを更新する前に、参照先が意図したローカルファイルかを確認します。Excelも有償製品で、既存ライセンスがある場合の方法です。

無料でWord形式にする:LibreOfficeを使う

LibreOfficeでPDFを開くと、通常はDrawのPDFインポートとして各ページが描画オブジェクトになります。これはPDFを直接きれいなWriter文書へ変換する機能ではありません。ページ上のテキストが小さなテキストボックスに分かれることがあり、そのままDOCXへ保存しても編集しやすい文書にはなりません。必要な範囲を選び、段落構造を作り直す作業を前提にします。

Drawで連続するテキストボックスを選べる場合は「テキストボックスの統合」を使うと、分割された文字列をまとめやすくなります。ただし読み順が自動で正しくなる保証はありません。統合後または選択コピーした文字を新しいWriter文書へ貼り付け、見出し、段落、リスト、表をWriterのスタイルで作り直します。画像は必要なものだけ挿入し、代替テキストや出典も保ちます。

Writerで整形したら「名前を付けて保存」でWord 2007–365形式などのDOCXを選びます。LibreOfficeは別形式へ保存すると一部の書式や機能が失われる可能性を警告します。その警告を無視して原本を上書きせず、ODTの作業版も残し、DOCXを閉じて再度開いてレイアウトを確認します。複雑な文書を大量に自動変換する方法ではなく、重要な文章を無料かつローカルで再構成する現実的な手順です。

無料で表をExcel形式にする:TabulaとCalc

TabulaはテキストベースPDFの表を抽出するオープンソースツールです。ローカルで起動するとブラウザー画面を使いますが、127.0.0.1上のローカルアプリとして処理し、PDFデータを変換サイトへ送る仕組みではありません。公式リポジトリからのみ取得し、組織端末では導入承認と脆弱性確認を受けます。プロジェクト自身がエンドユーザー向けアプリは頻繁には更新されない旨を示しているため、無条件に最新・安全とみなさないでください。

作業用PDFをTabulaへ読み込み、対象ページの表範囲を囲み、プレビューで列が正しく分かれる抽出方式を選びます。CSVとして保存したらLibreOffice Calcで開き、文字コード、区切り文字、引用符、列型を確認します。先頭ゼロのあるコードや長い番号は、数値へ自動変換すると欠落するため文字列として取り込みます。金額、日付、合計を原本と照合後、XLSXで別名保存し、閉じて開き直して確認します。

Tabulaは画像スキャンPDFには使えません。また、アプリは更新確認や利用統計に関する通信機能を持つ版があります。厳密なオフライン環境では、承認済みパッケージ、通信制御、版、ハッシュを管理者と確認します。CSVには元のセル書式、数式、コメント、結合情報がないため、Excelファイルにしただけで元帳として同一になったとは判断できません。

変換後の検証チェック

文章ではページ順、段落順、禁則、脚注、特殊文字、リンク先を確認します。表では行数・列数、見出し、空欄、先頭ゼロ、負数、日付、合計を確認します。数ページなら全件照合し、大量文書なら高リスク項目を全件、その他をサンプル照合します。契約、会計、申請、医療など誤変換の影響が大きい資料は、別の担当者による照合を入れます。

変換ファイルにマクロを追加せず、外部リンクや埋め込みオブジェクトが意図せず入っていないか確認します。作業用一時ファイル、CSV、OCR中間ファイルにも機密情報が残ります。保存期間、アクセス権、削除方法を原本と同じ情報区分で扱ってください。変換が崩れる場合は、設定を重ねるより、発行元へ元のDOCX・XLSXやアクセシブルなPDFを依頼する方が正確です。

公式情報・参考資料

この記事を書いた人

実務の現場で詰まりがちなポイントを地図にするITブログ「IT trip」を運営。Windows/Office(Teams・Excel)からSQL、サーバ運用、ガジェットまで、再現性のある手順と“なぜそうなるか”を丁寧に解説します。読んだらすぐ試せること、そして迷った人の次の一歩が見えることを大切にしています。

コメント

コメントする

目次