手書きレシピ抽出

手書きレシピ写真からレシピ名、材料、手順を取得

手書きのレシピカードを手動でデジタルファイルに書き写すと1枚あたり10~15分かかりますが、このツールなら5~10秒で読み取ります。

1枚あたり5~10秒 · 活字手書きで最大95% · 分数・単位解析対応

レシピ名 · 材料 · 手順
筆記体&活字体手書き
家族のアーカイブを一括処理

手書きレシピ写真から抽出できる情報

レシピカードには、筆記体、分数、混在する単位、半構造化レイアウトが混在しています。カスタムカラム抽出を使えば、必要なフィールドを指定するだけで、AIが各項目の意味を理解して特定します。すべての文字をピクセル単位で完璧にOCRする必要はありません。

レシピ名

通常、カード上部に最も大きな字で書かれています。AIは位置とフォントサイズからこれを識別します。筆記体で書かれていても問題ありません。どのテキストがタイトルかを手動で指定する必要はありません。

材料

材料リストから個々の材料名を抽出します。AIはレシピの内部構造を認識することで、材料リストと調理手順を区別します。数量が先頭に付いた短い行のブロックは材料リストであり、調理手順ではありません。

数量(単位付き)

分数を含む分量 — 1½カップ、¼小さじ、200gなど。従来のOCRでは「1½」を個別の文字に分割し、分数としての意味が失われます。ビジュアルモデルは分数グリフを単一の数量トークンとして読み取り、単位と一緒にスプレッドシートに出力します。

調理時間と温度

手順セクションやタイトル付近に記載された時間(30分、2時間)と温度(350°F、中強火)を抽出します。AIは、筆記体の段落内に「350°で30分焼く」と書かれていても、時間と温度のパターンを認識します。

手順

手順セクションの調理ステップ — 通常は段落または番号付きの手順です。AIはレシピ内での位置と構造に基づいてこれらを「手順」カラムに振り分け、上部の材料リストとは別に扱います。

なぜ手書きレシピは従来の抽出ツールでは対応できないのか

レシピカードは構造化されたフォームではありません。そこにあるのは、筆記体、分数グリフ、混在する計量単位、そして半ば有機的なレイアウト(材料→手順→メモ)です。しかも、それらはシミや折れ目、色あせのある紙の上に書かれています。従来のOCRは、きれいな紙に印刷された機械文字を前提に設計されていました。セマンティック抽出は、料理人がレシピを読むように解釈します。

レシピカードが難しい理由

01

筆記体の手書き文字はOCRの精度をほぼゼロにします。 つながった文字は文字単位の分割を阻みます。従来のOCRでは、きれいな筆記体で約50%、崩れた筆記体では20~30%まで精度が低下し、レシピカード全体の読み取りには実用的ではありません。r/Cookingのユーザーも指摘しているように、「手書きの半筆記体スタイルのため、OCRでレシピが読み取れるとは思えません」。

02

分数や複合単位は文字ベースのOCRでは認識できません。 「1½カップ」に含まれる分数グリフ(½)は、OCRによって2つの別々の文字として読み取られます。「tsp」「Tbsp」「g」「oz」「ml」などの単位は標準的な区切りなしに混在しており、OCRは生の文字を出力するものの、どれが単位でどれが材料名かを理解できません。

03

半構造化レイアウトは位置ベースのツールを無効にします。 材料はリスト、手順は段落、メモは余白に散在しており、すべて同じ手書き文字で書かれています。ゾーンOCRでは各領域に矩形を設定する必要がありますが、レシピ作成者がセクションを行き来すると、ゾーンがずれてしまいます。

セマンティック抽出がレシピを読み取る仕組み

01

カラム名を指定するだけで、AIがピクセル位置ではなく意味で値を特定します。「レシピ名、材料、数量、調理時間、手順」と入力してください。ビジュアルモデルがカード全体を読み取り、材料リストの領域と調理方法の領域を識別し、各値を対応するカラムに振り分けます。カードが筆記体、ブロック体、またはその混合であっても問題ありません。

02

分数グリフと単位は、意味のあるペアとして読み取られます。「1½ cups」は3つの別々のトークンではありません。モデルは分数を単一の数量値として認識し、単位「cups」とペアリングして、数量カラムに「1½ cups」と出力します。「350°F」は温度単位として解析され、数字と度記号に分割されることはありません。

03

コンテキストが筆記体の曖昧さを解消します。筆記体の単語が「flour(小麦粉)」か「flourish(繁栄)」か曖昧な場合、モデルは材料リスト内での位置と周囲の数量を手がかりに意味を判断します。同じ文字でも、異なるコンテキスト(調理手順の段落など)では異なる読み取りが行われます。これは、カラム定義がモデルに何を期待すべきかを伝えているからです。

手書きレシピカードの山から、検索可能なスプレッドシートへ。たった3ステップ。

1

レシピカードを撮影する

おばあちゃんの手書きレシピカードの束をお持ちですか? 丁寧な筆記体、色あせたボールペン、あなたより古い油染みのあるものまで様々です。スマートフォンで写真を撮りましょう。カードをテーブルに平らに置き、自然光の下で撮影します。50枚、100枚、200枚のカードをまとめてアップロード。筆跡のスタイルやカードのサイズ、状態で仕分ける必要はありません。

2

フィールド名を指定する — バッチ全体で一度だけ

列名を入力します:レシピ名、材料、数量、調理時間と温度、手順。この5つの列は、インデックスカードのチキンスープのレシピでも、汚れたノートのページのチョコレートケーキのレシピでも、バッチ内のすべてのカードで共通です。AIは各画像を個別に読み取り、材料リスト、調理法、時間と温度のデータを、固定テンプレートではなくレシピ構造を理解することで特定します。

3

1つのスプレッドシートにエクスポート

処理時間は写真1枚あたり5〜10秒。出力は1つのXLSXファイルです。各行が1つのレシピ、各列があなたが指定したフィールドになります。おばあちゃんのチキンスープが1行目、マリアおばさんのチョコレートケーキが2行目、汚れたパスタのカードが3行目 — すべて同じテーブルに。手作業で1枚ずつ書き写すよりも約60倍高速です (手作業ではレシピ1つあたり約10〜15分、こちらは約5〜10秒)。ファイルを家族と共有したり、レシピアプリにインポートしたり、デジタルアーカイブとして保存したりできます。

手書きレシピの精度 — 期待できること

精度は手書きのスタイルや物理的な状態によって異なります。このツールが得意とする点と、結果をより注意深く確認すべき点をご紹介します。

最適なケース

印刷された文字、または平らで明るいカードに書かれたきれいな筆記体。 材料と数量の精度は最大95%。モデルは小麦粉の汚れや軽い折れにも対応します。

標準的なレシピ形式。 材料が最初にリストされ、その後に作り方が続きます。半構造化レイアウトは、まさにセマンティック抽出のために設計されたものです。1つの列セットですべてのカードに対応できます。

家族のアーカイブの一括デジタル化。 1つの列定義で50~200枚のカードを1バッチで処理できます。このツールは、カードごとの設定や手書きスタイルによる手動の仕分けを必要としません。

注意が必要なケース

複雑な筆記体や乱雑な文字。 精度は65~75%に低下します。人間の読者でも個々の文字が判別しにくいような、文字同士が強く連結した筆記体では、抽出が不完全または不正確になります。出力は下書きとして扱い、各行を確認してください。

著しく薄くなったインク、破れた部分、またはテキストが物理的に欠落している場合。 モデルは視覚的に存在するものだけを抽出できます。油のシミや折れ目が材料や数量の一部を隠している場合、その値は不完全または欠落する可能性があります。

手書き文字に重なる装飾要素。 テキストに重なる枠線、落書き、シールは読みやすさを低下させます。視覚的なノイズを最小限に抑えるため、カードはできるだけ平らに、真正面から撮影してください。

よくある質問

AIは、かすれた手書きのレシピカードから「1½ cups」のような分数を含む数量の値を抽出できますか?

はい。数量カラムを定義すると、ビジュアルモデルは分数のグリフと単位を1つの意味的なペアとして読み取ります。「1½ cups」は1つの値として出力され、「1」「½」「cups」に分割されることはありません。従来のOCRは各文字を個別に処理するため、これができません。かすれがひどいと文字の明瞭さが低下する可能性がありますが、このモデルは文字単位のOCRよりも優れた性能を発揮します。これは、数字とその単位を、バラバラのピクセルではなく、関連するペアとして読み取るためです。

同じ筆記体で書かれた材料手順を、AIはどのように区別するのですか?

モデルはカード全体を読み取り、2つの異なる領域を識別します。材料リスト(短い行で、各行が数量と単位で始まる)と、調理方法セクション(それらの材料を参照する段落や番号付きの手順)です。材料と手順のカラムを別々に定義すると、AIはドキュメントの領域と意味的な役割に基づいて、テキストを各カラムに振り分けます。レシピ名、材料、数量、調理時間、手順という1つのカラムセットで、カードごとの設定なしにあらゆるレシピのレイアウトを処理できます。

レシピの余白に小さな筆記体で「350°F」と書かれた調理温度を抽出できますか?

モデルは、時間と温度のパターン(°F、°C、「度」、「分」、「時間」が続く数字)を認識するように訓練されています。これらが段落内に埋め込まれていたり、余白に書かれていたりしても認識します。調理時間と温度カラムを定義すると、AIはカード全体でこれらの値を見つけ出します。余白の書き込みや小さな手書き文字は、カードの本文テキストと比較して精度を低下させますが、パターンベースの認識により、従来の文字OCRでは完全にスキップされてしまうような値も復元できます。

200枚のおばあちゃんのレシピカードを1つのバッチで、1枚ずつ設定することなく処理できますか?

はい。200枚すべての写真を1つのバッチにアップロードしてください。カラムは5つ(レシピ名、材料、数量、調理時間と温度、手順)を一度だけ定義します。AIは、手書きのスタイル、カードのサイズ、物理的な状態に関係なく、同じカラム定義ですべての画像を処理します。出力は、1行に1レシピ、合計200行の単一のXLSXファイルです。特定のカードに存在しないフィールドは空のままになります。テンプレートベースのツールではカードごとの設定が必要ですが、カスタムカラム抽出では不要です。これが、週末のプロジェクトと数ヶ月に及ぶ作業の違いです。

カードの中央に油のシミがあり、材料リストの一部が隠れていますが、欠落したデータは検出されますか?

モデルは視覚的に読み取れるものだけを抽出します。シミ、折れ目、破れなどで材料や数量の一部が隠れている場合、その特定の値は出力で不完全または欠落します。ツールは隠れたテキストを推測したり捏造したりせず、読み取れない値については空のセルを返します。この正直さは意図的なものです。つまり、何が抽出され、何が抽出されなかったかを正確に確認でき、もっともらしいデータを黙って作り出すことはありません。重要なレシピの場合は、均一な光の下でカードを撮影し、カードが大きく損傷している場合は複数の角度から撮影することを検討してください。

手書き文字抽出の詳細解説: AI手書き文字認識の精度ベンチマーク — さまざまな手書きスタイルが抽出の信頼性に与える影響 · AIが従来のOCRと異なる方法で筆記体を読み取る仕組み — 手書き文字抽出を可能にするアーキテクチャの変革

写真ドキュメント抽出の全シナリオは 写真ドキュメントハブページ をご覧ください。名刺、配送ラベル、メーターの読み取り、処方箋ラベルなどに対応しています。

📮 contact email: [email protected]