Búsqueda interna con IA: cómo dejar de perder el conocimiento de la empresa
La información existe, pero está en un PDF de 2019 que abrió una sola persona. Cómo se construye una búsqueda interna que responde con tus documentos y dice cuándo no sabe.
Read this in EnglishHay una escena que se repite en todas las empresas de más de treinta personas. Alguien pregunta por chat "¿cuál es la política de devoluciones para clientes mayoristas?". Tres personas responden cosas distintas. La cuarta manda un PDF. El PDF es de 2021 y hay uno más nuevo que nadie encuentra.
Eso no es un problema de organización. Es un problema de búsqueda, y hoy tiene solución.
Por qué la búsqueda tradicional no alcanza
El buscador del sistema de archivos, del Drive o de la intranet busca palabras exactas. Si el documento dice "reintegro" y vos escribís "devolución", no aparece. Si la respuesta está en la página 14 de un manual de 60 páginas, el buscador te devuelve el manual entero y te deja el trabajo a vos.
Y sobre todo: no responde. Te da una lista de archivos. La persona que preguntaba quería una respuesta.
Cómo funciona una búsqueda con IA, sin humo
El mecanismo se llama recuperación aumentada (RAG) y tiene tres partes:
1. Indexar. Los documentos se cortan en fragmentos y cada fragmento se convierte en una representación numérica que captura su significado, no sus palabras. Por eso "reintegro" y "devolución" quedan cerca en ese espacio aunque no compartan una letra.
2. Recuperar. Cuando alguien pregunta, el sistema busca los fragmentos más cercanos al significado de la pregunta. No los que comparten palabras: los que hablan de lo mismo.
3. Responder. El modelo redacta una respuesta usando solo esos fragmentos, y cita de dónde salió cada afirmación.
Ese último punto es el que hace la diferencia entre una herramienta usable y un generador de respuestas plausibles. Si no puede citar, no responde.
Las decisiones que definen si sirve
Los permisos, desde el día uno
Es el error más caro y el más fácil de cometer. Si el índice no respeta quién puede ver qué, acabás de construir una máquina que le cuenta a cualquiera los sueldos, los contratos y la carpeta de recursos humanos.
Los permisos se aplican en el momento de la búsqueda, filtrando por lo que ese usuario puede ver, no después sobre la respuesta ya redactada. Un sistema que genera la respuesta y luego intenta censurarla ya perdió: el modelo vio el dato.
Qué se indexa y qué no
La tentación es indexar todo. Es un error: el ruido degrada las respuestas más rápido de lo que la cobertura las mejora.
Fuera del índice deberían quedar los borradores, las versiones viejas de documentos vigentes, los hilos de mail sin conclusión y todo lo que nadie designó como fuente de verdad. Un corpus chico y curado le gana siempre a uno enorme y sucio.
La fecha importa
Un documento vigente y uno derogado se parecen mucho en significado. Sin metadatos de fecha y estado, el sistema puede recuperar con total tranquilidad la política que se dio de baja en 2023.
Cada fragmento necesita saber de qué documento viene, de cuándo es y si sigue vigente. Y la respuesta tiene que mostrarlo: "según el manual de operaciones, versión de marzo 2026".
Poder decir "no sé"
Un sistema que siempre responde algo es un sistema en el que no se puede confiar. Cuando lo recuperado no alcanza, la respuesta correcta es "no encontré esto en la documentación" y, si corresponde, a quién preguntarle.
Esto se configura y se prueba. No sale gratis: por defecto los modelos prefieren inventar algo antes que admitir un vacío.
Por dónde empezar
No por indexar toda la empresa. Por un área y un conjunto de documentos vigentes.
Atención al cliente y soporte suelen ser el mejor primer caso: hay preguntas repetidas, hay documentación escrita, y el impacto se mide fácil en tiempo de respuesta.
Antes de arrancar, alguien tiene que hacer un trabajo poco glamoroso: decidir qué documentos son la verdad y archivar el resto. Ese trabajo hay que hacerlo igual, con IA o sin IA. La diferencia es que ahora tiene un beneficio inmediato.
Cuánto lleva y qué esperar
Una búsqueda interna acotada a un área se pone en producción en tres a seis semanas. La parte técnica no es la lenta: la lenta es reunir y curar el material.
Lo que se puede esperar razonablemente es que el 60–70% de las consultas internas repetidas se resuelvan solas, con cita a la fuente. El resto sigue necesitando a alguien — y está bien, porque suele ser justo donde hace falta criterio.
Si en tu empresa el conocimiento vive en la cabeza de tres personas y en una carpeta compartida, charlemos: es de los proyectos con retorno más rápido que hacemos.
¿Tenés un proceso para automatizar?
Contanos cómo trabaja tu empresa hoy y te decimos qué se puede construir y en cuánto tiempo.