Chunking
Fase de ingesta que divide un documento en fragmentos más pequeños para que un sistema de recuperación indexe y devuelva el contexto más relevante.
Ejemplo en una empresa
Un manual de personal de 70 páginas se divide por encabezados. Una pregunta sobre permisos recupera la sección aprobada en lugar de enviar el manual completo al modelo.
Cómo funciona
- 1.Analiza la fuente conservando estructura útil como encabezados, páginas, tablas y metadatos.
- 2.Divide el contenido en fragmentos fijos, estructurales, semánticos o jerárquicos.
- 3.Puede solapar fragmentos vecinos para conservar hechos situados en un límite.
- 4.Genera embeddings e indexa cada fragmento manteniendo metadatos de fuente y permisos.
- 5.Prueba la recuperación con preguntas representativas y ajusta la estrategia cuando los fragmentos son demasiado amplios o pierden contexto.
Ideas equivocadas
Conceptos relacionados
Lecturas relacionadas
Fuentes
- https://learn.microsoft.com/en-us/azure/databricks/agents/tutorials/ai-cookbook/quality-data-pipeline-rag
- https://docs.aws.amazon.com/bedrock/latest/userguide/kb-chunking.html
Revisado:
Revisado por: Javier Chulvi Bernad · LLM Engineer · Madrid