Un corpus de investigación repartido en unidades compartidas
Un instituto de investigación educativa guarda su documentación en unidades compartidas de Google Drive: 215 carpetas en dos unidades, con un volumen equivalente a unas 8.100 páginas y 4,1 millones de palabras.
El material está ahí y es accesible. Pero a ese tamaño la pregunta deja de ser dónde está el documento y pasa a ser qué dice el conjunto.
Indexar, describir y responder citando el origen
Nessie sincroniza las unidades compartidas de forma continua, describe cada documento y cada imagen con IA y responde preguntas en lenguaje natural citando la documentación de la que sale cada respuesta.
El corpus está vectorizado en 20.409 fragmentos, unos 28 por documento. Las 1.447 imágenes extraídas tienen descripción en el 99,5 % de los casos, de modo que también son consultables.
Además de responder, genera entregables a partir del propio corpus: 41 documentos creados hasta la fecha, 35 en PDF, 4 en Word y 2 en PowerPoint.
Lo que muestra el piloto
Los 732 documentos indexados están descritos por IA al 100 %. Los 12 usuarios provisionados han consultado el sistema y el 92 % ha vuelto en días distintos, con una media de 12,8 consultas por usuario.
De las 153 consultas respondidas, ninguna quedó truncada, y el 54 % fueron conversaciones de varios turnos: gente afinando una pregunta en lugar de probar una vez y abandonar.
El coste de IA por consulta ronda los 0,09 dólares, y los logs disponibles no registran errores 5xx.