製造・EC/生成AI OCR
生成AI OCRによる商品カタログデータ化PoC
- 対象
- メーカー向けDX PoC
- 期間
- PoC開発
RESULT
- 転記作業 確認だけに縮小
- 確認範囲 迷う項目のみに限定
- 投資判断 自動化の範囲を事前把握
課題
商品カタログPDFに含まれる適合情報を、CMSで扱える構造化データへ変換できるかを検証する必要がありました。単純なOCRではなく、表の読み取り、表記ゆれの整理、既存マスタとの照合まで含めた業務フローのPoCでした。
- カタログPDFから商品と適合情報を読み取りたい
- 表記ゆれや範囲表記を既存マスタと照合したい
- 完全自動化ではなく、曖昧な候補だけ人が確認できる運用にしたい
解決策
Pythonで、PDFからの情報抽出、生成AIによる表構造の整理、既存マスタとの照合、CMS取込CSV生成までを行うPoCパイプラインを構築。抽出結果と候補を人が確認できるレビュー画面も用意し、実運用に近い形で検証しました。
- PDF文字抽出とVisionモデルを使い分け、読み取り対象を効率化
- 抽出結果を既存マスタ候補へ照合し、確信度で振り分け
- レビュー後にCMS取込用CSVを出力する流れを試作
結果
カタログPDFから適合情報を転記する作業が、確認だけで済むかを実データで検証しました。表記ゆれや範囲表記は既存マスタの候補に自動で当たるため、人が目を通すのはレビュー画面に上がった迷うものだけです。本開発に進む前に、どこまで自動化できて残りにどれだけ人手が要るかを把握できます。
Beekleだからできたこと
自動化できる範囲と、人が見るべき範囲をPoCで切り分ける
本開発前にAIで削減できる作業量と残る人手を把握し、投資判断を具体化できます。
PDF抽出、Vision、既存マスタ照合、確信度による振り分け、レビュー、CMS用CSV生成まで実運用に近いパイプラインを試作しました。
Beekleでは、PoCをモデル精度のデモで終わらせず、本番業務に必要な前後工程まで組み込みます。この案件でも、PDF抽出・Vision・既存マスタ照合・確信度による振り分け・人のレビュー・CMS取込CSVまで一連のパイプラインを作ったため、本開発前に『どこまで自動化でき、どこに人手が残るか』まで判断できました。