Base de datos vectorial

Tambien: Vector database, Embeddings, Busqueda semantica

En una frase

Una base de datos vectorial guarda texto y otros datos como vectores numericos (embeddings) para poder buscar por significado, no por palabras exactas. Es la pieza que hace posible el RAG a escala.

Una base de datos vectorial almacena la informacion convertida en embeddings: listas de numeros que representan el significado de cada fragmento. Al buscar, convierte tambien tu pregunta en un vector y devuelve los fragmentos mas cercanos en significado, aunque no compartan ni una palabra. Esa busqueda semantica es lo que permite a un sistema RAG encontrar el pasaje relevante entre miles de documentos antes de pasarselo al modelo.

¿En que se diferencia de una busqueda normal?

Una busqueda tradicional encuentra coincidencias de palabras; una vectorial encuentra coincidencias de significado. Si preguntas por 'como cancelo mi suscripcion' y el documento dice 'dar de baja tu plan', la busqueda por palabras falla y la vectorial acierta. Por eso es la base de los asistentes que responden sobre tu documentacion.

¿Cual usar y cuando hace falta de verdad?

No siempre: si tu conocimiento cabe en pocas paginas, a veces basta con meterlo en el prompt. La base vectorial empieza a compensar a partir de cientos o miles de documentos. Opciones habituales: pgvector si ya usas Postgres (nuestra opcion por defecto, porque no suma otra pieza de infraestructura), y Pinecone, Qdrant o Weaviate cuando el volumen o la latencia lo exigen. En Evidencia, nuestro buscador clinico, recuperar sobre literatura cientifica es justo este problema a escala.

Datos