
20 de agosto de 2026. Estoy comprobando si VALESKA puede encontrar la evidencia que una persona realmente necesita, no si puedo producir una demostración de búsqueda atractiva. VALESKA es el sistema de documentos y memoria organizacional que estoy construyendo. Antes de que un asistente de IA responda desde esa memoria, la recuperación debe aportar el material correcto. Una respuesta fluida no puede reparar la evidencia que nunca le llegó.
Ayer añadí un evaluador de recuperación. Hoy lo hago utilizable mediante distintos clientes y anoto 33 preguntas sobre la colección documental de Guyana. Establezco los documentos esperados leyendo la colección, no aceptando lo que devuelva la búsqueda. De otro modo, dejaría que el sistema redactara su propia clave de respuestas. Son resultados de investigación interna, no un certificado de aceptación por parte de un cliente.
Qué preguntan los números
La precisión en uno pregunta si el primer resultado es pertinente. La cobertura en veinte pregunta si la evidencia esperada aparece entre los primeros veinte resultados. El rango recíproco medio, o MRR, premia encontrarla más arriba y asigna cero a una búsqueda fallida. La latencia mide la espera. Para una empresa que decide si un asistente resulta útil, estas medidas describen costos distintos: revisar un primer documento equivocado, recorrer una lista, perder por completo la evidencia y esperar.
También corrijo el propio evaluador. Había promediado el rango recíproco solo sobre las consultas exitosas, de modo que recuperar una respuesta antes ausente en una posición baja podía empeorar el promedio. Ahora incluye todas las preguntas anotadas. Las cifras anteriores de MRR no son comparables. Necesito una aritmética correcta antes de utilizar la puntuación para elegir un cambio de ingeniería.
Más evidencia, más espera
La medición inicial encuentra el primer resultado correcto para 22 de 33 preguntas y la evidencia esperada entre veinte resultados para 29 de 33. Ampliar el conjunto de candidatos de la búsqueda aproximada eleva esta última cifra a 32 de 33. La puntuación del primer resultado sigue en 22 de 33. El MRR pasa de 0,727 a 0,741. La latencia mediana sube de 151 a 291 milisegundos; el percentil 95, de 186 a 546 milisegundos. Es una mejora de cobertura con un costo de espera, no una victoria en todos los frentes.
Esta mañana el cambio ya está aplicado, y tanto las pruebas directas como las realizadas mediante el servicio reproducen 32 de 33. Queda una pregunta sin resolver. La búsqueda todavía puede omitir evidencia pertinente en colecciones pequeñas. Por tanto, un resultado vacío no demuestra que la respuesta no exista. La búsqueda más amplia mitiga este defecto; no resuelve el problema de diseño subyacente.
Una corrección independiente del reloj
El trabajo de ayer sobre el modelo de costos revela otro fallo de medición, esta vez en la clasificación documental y no en la recuperación. Los tiempos anteriores de 345 y 397 segundos por documento estaban contaminados por mis propios trabajos en segundo plano, que competían por el procesador gráfico. La medición limpia registrada es de 8,2 segundos por documento, con una primera llamada mucho más lenta. El repositorio registra la discrepancia como aproximadamente 48 veces. Esto elimina un error de evaluación; no es una aceleración del modelo recién conseguida.
Mantengo esa corrección junto a los resultados de recuperación porque ambas afectan una decisión empresarial. Un cronometraje incorrecto puede distorsionar una estimación de capacidad; citar selectivamente una puntuación de búsqueda puede ocultar el trabajo de revisión que queda al personal. Ninguno de los experimentos establece el rendimiento en producción, el desempeño con los documentos de otra empresa ni el aislamiento completo de permisos.
Qué necesito después
Necesito probar una corrección del problema de filtrado por colección con las mismas preguntas, conservando en el informe los fallos y las cifras de latencia. También necesito tiempos de clasificación reproducibles que declaren la competencia por recursos y los arranques en frío. La evidencia de hoy basta para rechazar un resumen complaciente. No basta para declarar aceptada la recuperación.
Base histórica: commits de VALESKA fc2f77c, eaa00c1, 45c1449, 1643d91, 6607d62, 19-20 de agosto de 2026 (hora del Pacífico).