# El corpus debe ser higiénico antes de ser inteligente

Notas de investigación del 18 de agosto: las pruebas de procedencia corrigen una suposición sobre almacenamiento y una colección copiada baja de 7.574 fragmentos indexados a 49, sin demostrar mejores respuestas.

Language: es
Canonical: https://avanticomplex.com/es/blog/the-corpus-must-be-hygienic-before-it-is-smart-es/

Published: 2026-08-19T06:59:00.000Z

18 de agosto de 2026. Antes de pedirle a VALESKA que parezca más inteligente, necesito saber qué contiene realmente su colección de documentos. Un corpus es la colección en la que un sistema de IA busca o de la que aprende. La higiene del corpus consiste en revisar esa colección para detectar repeticiones engañosas, material desactualizado y registros que ya no apuntan a una fuente disponible. El trabajo de esta semana produce correcciones y recuentos, no una afirmación de que toda la colección esté limpia.

Para quien dirige el primer proyecto de IA de una empresa, el riesgo práctico es sencillo: una respuesta convincente puede apoyarse en evidencia mal identificada. Cinco copias de un documento no son cinco fuentes independientes. Las copias pueden ocupar posiciones en los resultados y desplazar otra evidencia, según la consulta y la clasificación. Es un riesgo que medir, no una regla según la cual los duplicados ganan todas las búsquedas.

## Primero, corregir la suposición

OTCS significa OpenText Content Server, un sistema de gestión documental. La procedencia del corpus es el registro del origen y del historial de manejo del material. En este trabajo, una categoría adjunta esa información a los documentos depositados. El contrato de la categoría es el acuerdo sobre el significado de sus campos y los valores aceptables. Guardar correctamente no basta si la información acaba en el lugar equivocado.

El 17 de agosto corrijo una mala suposición en las notas operativas: el ancho de columna de un campo de texto multilínea controla la presentación, no la capacidad de almacenamiento. Las pruebas registradas en Content Server 16.2.0 escriben y recuperan valores de hasta 131.000 caracteres sin truncamiento; un valor de 5.000 caracteres también se muestra completo en la interfaz Classic. Son observaciones de la instalación probada, no una promesa sobre todas las versiones o configuraciones.

Medir las longitudes de las rutas de origen sigue ayudando a describir un despliegue y elegir una presentación legible. No es una barrera contra la pérdida de datos causada por el ancho de columna. Por separado, se informa de que el registro de procedencia se escribió y se leyó correctamente en sus 17 campos. La nueva comprobación previa a la ingesta informa de siete verificaciones satisfactorias y rechaza una discrepancia simulada en la correspondencia de campos y los valores permitidos. Ya existe una prueba negativa; no debo escribir como si detectar fallos fuera solo una intención futura.

## Después, contar la limpieza

La colección copiada de hoy comienza con 7.574 fragmentos indexados, es decir, porciones menores de texto disponibles para la recuperación. La primera retirada registrada elimina 6.496 fragmentos duplicados o desactualizados. Una segunda elimina otros 1.029: 183 duplicados recién reconocidos y 846 registros que quedaron huérfanos tras mover documentos. El índice de la copia termina con 49 fragmentos de dos archivos. Son resultados de ejecución registrados en el repositorio, no una medición nueva de una instalación de un cliente.

El registro del mismo día informa de que 20 documentos únicos regresaron a StoryTeller, el proyecto al que pertenecen. Comparar por contenido importa porque distintos nombres de archivo pueden ocultar el mismo texto. Una coincidencia aproximada no es automáticamente un duplicado exacto, y una entrada huérfana del índice no demuestra que su contenido sea prescindible. Retirar esas entradas requiere una elección explícita; confirmar que existe un destino indexado sigue siendo un requisito de seguridad, no algo que demuestre la ausencia de la ruta de origen.

Limpiar el índice y borrar archivos fuente son acciones distintas. La primera retirada deja intactos los archivos en disco; la repatriación separada mueve los 20 documentos. Un lector basado en archivos todavía depende del árbol copiado restante, por lo que eliminar ese árbol sigue sin resolverse. El informe de situación de la noche también deja abiertos tres grupos de cuerpos de texto duplicados. Por tanto, los recuentos describen una intervención acotada, no un certificado de limpieza para todas las colecciones ni todos los lectores.

## La siguiente prueba

Quiero que la siguiente comprobación conecte estos resultados de inventario con lo que ve una persona. Repetir un conjunto pequeño y fijo de preguntas, examinar si los resultados restantes citan la fuente prevista y confirmar que el material trasladado sigue siendo recuperable antes de retirar nada más. Revisar de nuevo los grupos de duplicados abiertos y probar la discrepancia de categoría en el despliegue de destino. Menos copias indexadas y un contrato de procedencia probado son avances útiles. Ninguno demuestra una mejor calidad de respuesta sin esa medición separada. Mi trabajo es mantener visible la distinción.

* * *

**Base histórica:** commits de VALESKA `93b938f`, `7c5e69d` y `985d6a5`, 17 de agosto; `f44d6de`, `4b5f2e3`, `916b56c`, `04adc31` e informe de situación `f90568d`, 18 de agosto de 2026, America/Los\_Angeles. Los resultados se atribuyen al registro fechado del repositorio.


## Translations
- en: https://avanticomplex.com/en/blog/the-corpus-must-be-hygienic-before-it-is-smart/
- es: https://avanticomplex.com/es/blog/the-corpus-must-be-hygienic-before-it-is-smart-es/
- pt: https://avanticomplex.com/pt/blog/the-corpus-must-be-hygienic-before-it-is-smart-pt/
