Extracción de recetas manuscritas

Obtenga títulos de recetas, ingredientes e instrucciones a partir de fotos de recetas manuscritas

Transcribir manualmente una tarjeta de receta manuscrita a un archivo digital toma de 10 a 15 minutos por receta; esto lo lee en 5 a 10 segundos.

5-10 s por receta · Hasta un 95 % en letra impresa · Análisis de fracciones y unidades

Título · Ingredientes · Instrucciones
Letra cursiva e impresa
Procesamiento por lotes de archivos familiares

Qué puede extraer de una foto de una receta manuscrita

Una tarjeta de receta combina escritura cursiva, fracciones, unidades mixtas y un diseño semiestructurado. Con Custom Column Extraction, usted define los campos — la IA localiza cada uno comprendiendo su significado, no intentando un OCR perfecto píxel a píxel de cada carácter.

Título de la receta

Generalmente la escritura más grande en la parte superior de la tarjeta. La IA lo identifica por su posición y escala tipográfica, incluso si está escrito en cursiva — sin necesidad de etiquetar manualmente qué texto es el título.

Ingrediente

Nombres de ingredientes individuales de la lista de ingredientes. La IA distingue la lista del método reconociendo la estructura interna de la receta — un bloque de líneas cortas precedidas por cantidades es una lista de ingredientes, no un paso de cocción.

Cantidad (con unidad)

Las cantidades incluyendo fracciones — 1½ tazas, ¼ cdta, 200 g. El OCR tradicional divide "1½" en caracteres separados y pierde el significado de la fracción. El modelo visual lee el glifo de la fracción como un único token de cantidad y lo entrega junto a la unidad en su hoja de cálculo.

Tiempo de cocción y temperatura

Tiempos (30 min, 2 horas) y temperaturas (350°F, medio-alto) que aparecen en la sección del método o cerca del título. La IA reconoce patrones de tiempo y temperatura incluso cuando están escritos como "hornear a 350° durante 30 min" dentro de un párrafo en cursiva.

Instrucción

Los pasos de cocción de la sección del método — generalmente párrafos o pasos numerados. La IA los dirige a la columna de Instrucción según su posición y estructura en la receta, separados de la lista de ingredientes anterior.

Por qué las recetas manuscritas rompen todas las herramientas de extracción tradicionales

Una ficha de receta no es un formulario estructurado: es escritura cursiva, glifos de fracciones, unidades de medida mixtas y un diseño semiorgánico (ingredientes, luego instrucciones, luego notas) todo en papel que puede estar manchado, doblado o descolorido. El OCR tradicional fue diseñado para texto impreso en papel limpio. La extracción semántica lee la receta como lo haría un cocinero.

Qué hace difíciles las fichas de recetas

01

La escritura cursiva degrada el OCR a una precisión casi nula. Las letras conectadas rompen la segmentación carácter por carácter. El OCR tradicional acierta alrededor del 50% en cursiva clara y cae al 20-30% en escritura suelta, lo que lo vuelve prácticamente inútil para una ficha de receta completa. Como señaló un usuario de Reddit en r/Cooking: "Dudo que las recetas se capturen mediante OCR debido al estilo semicursivo manuscrito".

02

Las fracciones y las unidades mixtas son invisibles para el OCR basado en caracteres. "1½ tazas" contiene un glifo de fracción (½) que el OCR lee como dos caracteres separados. "cdta", "cda", "g", "oz", "ml" se mezclan sin un separador estándar: el OCR genera los caracteres en bruto, pero no entiende cuál es una unidad y cuál es el nombre de un ingrediente.

03

El diseño semiestructurado derrota a las herramientas basadas en posición. Los ingredientes son una lista, las instrucciones son párrafos y las notas están dispersas en los márgenes, todo con la misma caligrafía. El OCR zonal necesita un rectángulo dibujado para cada región. Cuando el autor de la receta salta entre secciones, las zonas ya no coinciden.

Cómo la extracción semántica lee una receta

01

Usted nombra las columnas — la IA encuentra los valores por significado, no por posición de píxel. Escriba "Título de la receta, Ingrediente, Cantidad, Tiempo de cocción y temperatura, Instrucción". El modelo visual lee toda la tarjeta, identifica qué región es la lista de ingredientes y cuál es el método, y dirige cada valor a su columna — sin importar si la tarjeta usa cursiva, mayúsculas o una mezcla.

02

Los glifos de fracciones y las unidades se leen como pares semánticos. "1½ tazas" no son tres tokens separados — el modelo reconoce la fracción como un único valor de cantidad, la empareja con la unidad "tazas" y genera "1½ tazas" en su columna Cantidad. "350°F" se analiza como una unidad de temperatura, no se divide en número y símbolo de grado.

03

El contexto desambigua la ambigüedad de la cursiva. Cuando una palabra en cursiva podría ser "harina" o "florecer", el modelo utiliza su posición en la lista de ingredientes y la cantidad circundante para resolver el significado. La misma letra en un contexto diferente (un párrafo del método) se leería de otra forma — porque la definición de la columna le indica al modelo qué esperar.

De un montón de recetas manuscritas a una hoja de cálculo en tres pasos

1

Fotografíe las tarjetas de recetas

Tiene una caja con las tarjetas manuscritas de su abuela: algunas en una cuidada cursiva, otras en bolígrafo desvaído, algunas con manchas de grasa más viejas que usted. Tome fotos con su teléfono: coloque cada tarjeta plana sobre una mesa con luz natural. Suba todas las fotos en un solo lote: 50, 100 o 200 tarjetas juntas. No es necesario ordenarlas por tipo de letra, tamaño o estado.

2

Nombre los campos — una vez para todo el lote

Escriba los nombres de sus columnas: Título de la receta, Ingrediente, Cantidad, Tiempo de cocción y temperatura, Instrucción. Las mismas cinco columnas sirven para todas las tarjetas del lote, ya sea la receta de sopa de pollo en una ficha o el pastel de chocolate en una página manchada de un cuaderno. La IA lee cada imagen de forma independiente, localizando la lista de ingredientes, el método y los datos de tiempo y temperatura al comprender la estructura de la receta, sin depender de una plantilla fija.

3

Exporte una sola hoja de cálculo

El procesamiento toma de 5 a 10 segundos por foto. El resultado es un archivo XLSX: cada fila es una receta, cada columna es un campo que usted nombró. La sopa de pollo de la abuela en la fila 1, el pastel de chocolate de la tía María en la fila 2, la tarjeta de pasta manchada en la fila 3, todo en la misma tabla. Aproximadamente 60 veces más rápido que transcribir cada tarjeta a mano (~10-15 min manuales por receta frente a ~5-10s aquí). Comparta el archivo con la familia, impórtelo en una aplicación de recetas o consérvelo como su archivo digital.

Precisión en recetas manuscritas — qué esperar

La precisión varía según el estilo de escritura y el estado físico del documento. A continuación, le mostramos lo que la herramienta maneja bien y dónde debe revisar los resultados con más atención.

Cuándo funciona mejor

Letra impresa o cursiva clara en tarjetas planas y bien iluminadas. Hasta un 95% de precisión en ingredientes y cantidades. El modelo tolera manchas de harina y pliegues moderados.

Formato de receta estándar. Ingredientes primero, luego el método. La estructura semiorganizada es exactamente para lo que fue diseñada la extracción semántica: un solo conjunto de columnas se adapta a cada tarjeta.

Digitalización por lotes de archivos familiares. Procese de 50 a 200 tarjetas en un solo lote con una única definición de columnas. La herramienta no requiere configuración por tarjeta ni clasificación manual según el estilo de escritura.

Cuándo tener precaución

Cursiva muy enlazada o garabatos sueltos. La precisión baja al 65-75%. Una escritura muy conectada donde las letras individuales son ambiguas incluso para lectores humanos producirá extracciones parciales o incorrectas. Trate el resultado como un borrador y revise cada fila.

Tinta muy desvaída, secciones rasgadas o texto físicamente ausente. El modelo solo puede extraer lo que está visualmente presente. Si una mancha de grasa o un pliegue oculta parte de un ingrediente o cantidad, ese valor puede estar incompleto o faltar.

Elementos decorativos que se superponen a la escritura. Bordes, dibujos o pegatinas que cruzan el texto reducen la legibilidad. Fotografíe la tarjeta lo más plana y frontal posible para minimizar el ruido visual.

Preguntas Frecuentes

¿Puede la IA extraer valores de Cantidad con fracciones como "1½ tazas" de una tarjeta de recetas manuscrita y descolorida?

Sí. Al definir una columna de Cantidad, el modelo visual lee el glifo de la fracción y la unidad como un par semántico único: "1½ tazas" se genera como un solo valor, no se divide en "1", "½", "tazas". El OCR tradicional no puede hacer esto porque procesa cada carácter de forma independiente. Un desvanecimiento intenso puede reducir la claridad de los caracteres, pero el modelo sigue superando al OCR carácter por carácter porque lee el número y su unidad como un par relacionado, no como píxeles desconectados.

¿Cómo separa la IA el Ingrediente de la Instrucción cuando ambos están escritos a mano en la misma letra cursiva?

El modelo lee toda la tarjeta e identifica dos regiones distintas: una lista de ingredientes (líneas cortas, cada una comenzando con una cantidad y una unidad) y una sección de método (párrafos o pasos numerados que hacen referencia a esos ingredientes). Cuando usted define columnas separadas de Ingrediente e Instrucción, la IA dirige el texto a cada columna según la región del documento y el rol semántico. Un conjunto de columnas — Título de la receta, Ingrediente, Cantidad, Tiempo de cocción, Instrucción — maneja cualquier diseño de receta sin necesidad de configuración por tarjeta.

¿Puedo extraer la temperatura de cocción de una receta donde "350°F" está escrito en los márgenes con una letra cursiva muy pequeña?

El modelo está entrenado para reconocer patrones de tiempo y temperatura — números seguidos de °F, °C, "grados", "minutos" u "horas" — incluso cuando están incrustados dentro de un párrafo o escritos en un margen. Defina una columna de Tiempo de cocción y temperatura y la IA localizará estos valores en toda la tarjeta. Las notas marginales y la letra pequeña reducen la precisión en comparación con el texto principal de la tarjeta, pero el reconocimiento basado en patrones ayuda a recuperar el valor donde el OCR de caracteres tradicional lo omitiría por completo.

Un lote, 200 tarjetas de recetas de la abuela — ¿puedo procesarlas todas sin configurar cada una individualmente?

Sí. Suba las 200 fotos en un solo lote. Defina sus cinco columnas una vez: Título de la receta, Ingrediente, Cantidad, Tiempo de cocción y temperatura, Instrucción. La IA procesa cada imagen con la misma definición de columna, independientemente del estilo de escritura, el tamaño de la tarjeta o su estado físico. La salida es un único archivo XLSX con 200 filas — una por receta. Los campos que no aparecen en una tarjeta en particular se quedan vacíos. Las herramientas basadas en plantillas requieren configuración por tarjeta; Custom Column Extraction no, y esa es la diferencia entre un proyecto de fin de semana y una tarea de varios meses.

Una tarjeta tiene una mancha de grasa en el medio que cubre parte de la lista de ingredientes: ¿se detectarán los datos faltantes?

El modelo extrae solo lo que es visualmente legible. Si una mancha, un pliegue o una sección rasgada cubre parte de un ingrediente o una cantidad, ese valor específico estará incompleto o ausente en el resultado. La herramienta no adivina ni inventa texto oculto: devuelve celdas vacías para los valores que no puede leer. Esta honestidad es intencional: usted ve exactamente lo que se extrajo y lo que no, en lugar de inventar silenciosamente datos que parezcan plausibles. Para recetas importantes, fotografíe la tarjeta bajo una luz uniforme y considere varios ángulos si la tarjeta está muy dañada.

Análisis detallados sobre extracción de escritura a mano: Puntos de referencia de precisión para el reconocimiento de escritura a mano con IA — qué significan los diferentes estilos de escritura para la fiabilidad de la extracción · Cómo la IA lee la cursiva de forma diferente al OCR tradicional — el cambio de arquitectura que hace posible la extracción de escritura a mano

Explore todos los escenarios de extracción de documentos fotográficos en la página central de Documentos Fotográficos — tarjetas de presentación, etiquetas de envío, lecturas de medidores y etiquetas de recetas médicas.

📮 contact email: [email protected]