コミュニティ
散らかったPDFを、きれいなExcelへ — そして分析レポートまで — Codexで
やりたいことは、そもそも「このPDFを表にして」ではありません。それは目に見える半分にすぎず、本当に欲しいのはその先にある問いです — どの取引先にいちばん使ったのか、ここ数か月の傾向は上がっているのか下がっているのか、明らかに外れている項目はどれか。数字を一行ずつ手で打ち込む作業は、いちばん遅く、間違えやすく、そして人がやる必要のいちばん薄い部分です — そして、まさにその部分を丸ごと任せられます。Codexのようなコーディングエージェントなら、同じセッションの中でドキュメントを読み、きれいなExcelファイルを作り、その上に分析まで書き上げてくれます。最初は20〜30分ほど、プロンプトが手になじめばもっと短くなります。
これが成り立つのは、Codexが単に会話しているだけではなく、ローカルのサンドボックスで実際にコードを動かしているからです(Python、pandas、openpyxl)。ディスク上のファイルを直接読み、本物の.xlsxを指定したフォルダに書き出します。この過程でPythonの知識はいっさい要りません。あなたは欲しい列を伝え、結果を確認するだけです。
何を渡せるか
元ファイルの形式は、思うほど重要ではありません。よくあるのは次のようなものです。
- 表の入ったデジタルPDF — 明細書、請求書、書き出したレポートなど。テキストを選択でき、抽出はほぼ無損失です。
- スキャンしたPDF、または表を撮った写真 — まずOCRを一度かける必要があります。きれいなスキャンなら精度は高く、しわくちゃのレシートは目で確認する回数が増えます。
- ファイルがたくさん — 12か月分の月次明細、CSVがぎっしり入ったフォルダ。Codexが一つずつ回して、結果を一枚のシートに積み上げてくれます。
- 誰かが作った散らかった表 — 結合セル、データに紛れ込んだ合計行、3行の見出し。こういう表をきれいにするほうが、抽出そのものより価値が大きいこともよくあります。
手順
前提: Codex CLI(またはデスクトップ版)をインストールし、元ファイルを指定できる場所に保存しておきます(例:~/Downloads/statement.pdf)。最初は20〜30分ほどです。
ステップ1 — きれいな表に抽出する。 Codexのセッションを開き、ただ「変換して」ではなく、欲しい「形」をはっきり指定します。
~/Downloads/statement.pdf を読んで。すべての取引を表にして、列はこれだけ:日付(YYYY-MM-DD)、摘要、カテゴリ、金額(数値のみ、通貨記号なし)。小計行と見出し行は飛ばして。ファイルに書き出す前に、まず最初の10行を見せて。
まず最初の数行を見せてもらう、これが全体でいちばんの肝です — 読み違えた列やずれた合計が400行に広がる前に捕まえられます。列名を一つずつ指定しておくと、エージェントが勝手にフィールドを作り出すのも防げます。
ステップ2 — 抽出結果を検証する。 ここは飛ばさないこと。ほとんどのミスを拾える手早いチェックをいくつか。
- 行数 — 「何行抽出した?」元ファイルからざっと数えた数と突き合わせます。
- 合計 — 「金額の列を全部足して。PDFに印字された合計と合う?」合わなければ、たいてい合計行がデータに紛れ込んだか、複数ページの表で1ページ抜けたかです。
- 両端を確認 — 最初と最後の数行を元ファイルと目で照合します。日付の形式とマイナスの数字(取消、返金)が常連の犯人です。
ステップ3 — 書式を整えてExcelに保存する。 表が正しく出たら:
この表を ~/Desktop/transactions.xlsx に保存して。見出し行は太字、先頭行を固定、金額の列は小数点2桁の通貨形式、いちばん下に合計行を追加。
手に入るのは本物のスプレッドシートです — Excel、Numbers、Googleスプレッドシートでそのまま開けます — あとから整え直すCSVではありません。
ステップ4 — 表で止めず、分析まで頼む。 ここから先は、ただの変換ツールではなくなります。きれいなデータはすでにセッションの中にあるので、そのまま:
このデータを分析して。カテゴリ別の合計、金額上位5つの取引先、前月比の月次推移、そして中央値の2倍を超える取引はすべてフラグを立てて。それぞれを別々のシートにして、「カテゴリ別支出」には棒グラフを付けて、最初のシートに5項目のやさしい言葉でまとめを書いて。
返ってくるのは、ピボットとグラフ、そして文章でまとめた結論が入ったワークブックです — これまでそのPDFが、あなたと答えのあいだに立ちはだかっていた、まさにそれです。ある切り口が役に立たなければ、別の切り口を頼めばいい。データは動かさず、変えるのは問いだけです。
応用
- 銀行 / カードの明細 → 支出の全体像 — まず取引を分類し、そのうえで月ごとの合計と、いちばん伸びたカテゴリを聞く
- 12か月分のレポート → ひとつの傾向 — Codexにフォルダを指し示し、
month列を付けて積み上げさせ、1年分の傾向をグラフにする - アンケートのCSV → 数字のまとめ — 件数、割合、セグメント別のクロス集計を、きれいなまとめシートとして書き出す
- スキャンした表 → デジタルへ — 先にOCRをかけ、検証はより厳しめに(ここではステップ2が特に重要)、あとはいつもどおり
向かない場面
- 法的に正確でなければならないもの — 確定申告、監査対象の数字:エージェントは速くて優秀な下書きであって、最終判断ではありません。必ず元の資料と突き合わせてください。
- 本当にデータが大きいとき — 数十万行を超えたら、スプレッドシートではなくデータベースとSQLの出番です
- 毎週ずっと作り直すレポート — 本当に定期的な作業なら、毎回会話をやり直すのではなく、Codexに繰り返し実行できる小さなスクリプトを書いてもらいましょう
- レイアウトそのものが意味を持つ文書 — 契約書、条件分岐のあるフォーム。表に抽出した時点で、肝心な部分が抜け落ちます
言葉より、自分で試して
$3 で、Codex / Claude に実際に手を動かしてもらおう——繰り返し作業の自動化、動く小さな Web ページ、ちょっとしたツールづくり。本物のタスク1つには十分。
3日間有効 · 画像2枚つき · 1つのキーで Claude も Codex も
新着記事をメールで受け取る
新しいレシピやフィールドノート、ときどきプロダクトアップデートをお届けします。スパムなし、いつでも配信停止可。