# Un documento tiene que convertirse en una unidad de conocimiento, no en un bloque indiferenciado

Notas de investigación del 16 de agosto: las unidades por sección y una selección de fuentes restringida al uso interno dan a VALESKA una base más verificable, no una prueba de que esté lista para entrenar.

Language: es
Canonical: https://avanticomplex.com/es/blog/documents-must-become-knowledge-units-es/

Published: 2026-08-17T06:59:00.000Z

16 de agosto de 2026. Quiero que VALESKA devuelva una sección útil, no que me entregue un documento entero y dé el trabajo por terminado. VALESKA es el sistema de documentos y memoria organizacional que estoy construyendo. Los cambios de esta noche en el repositorio añaden unidades de conocimiento por sección, una forma de almacenarlas y una selección de fuentes con etiquetas de derechos para trabajo interno. Es un hito de ingeniería concreto. Todavía no demuestra que un asistente responda mejor.

Si acabas de asumir la iniciativa de IA de tu empresa, conviene conservar esta distinción. Una incrustación, o embedding, es una representación numérica utilizada para encontrar texto relacionado. Por sí sola no establece dónde empieza una instrucción, qué advertencia debe acompañarla ni si se puede reutilizar el material. Encontrar palabras similares y conservar evidencia utilizable son tareas distintas.

## Qué entiendo por unidad

Una unidad de conocimiento es una porción delimitada del material fuente que conserva suficiente identidad y contexto para examinarse por separado. En un manual, puede ser un encabezado y el cuerpo de su sección, con su posición en la jerarquía del documento y un vínculo con la fuente. No es un hecho certificado como verdadero. Una sección bien delimitada puede seguir siendo incorrecta, anticuada o inadecuada para un lector determinado.

El tratamiento de secciones de hoy sigue los encabezados del documento, incluidas las secciones numeradas de los manuales, en lugar de considerar una longitud arbitraria de texto como el límite natural. Las pruebas incorporadas al repositorio cubren mantener junta una sección, conservar el contexto de la sección superior y no confundir una línea que parece un encabezado dentro de un ejemplo de código con un encabezado real. Aquí, manual significa un documento como un libro de instrucciones; no significa que yo haya etiquetado cada sección a mano.

El código de almacenamiento conserva el texto completo de la unidad, pero el texto enviado para generar la incrustación puede acortarse para ajustarse al modelo. Ese límite importa. Conservar la sección entera no garantiza que cada frase influya en cómo la encuentra la búsqueda. Un procedimiento largo cuya advertencia decisiva aparece al final es un caso difícil y útil, no algo que pueda descartar porque la unidad tenga título.

## Una etiqueta no es permiso

Las etiquetas de derechos son metadatos que registran usos previstos y restricciones. El código de selección de fuentes de hoy marca el material para uso interno y excluye su publicación o transferencia a terceros. Esas etiquetas no prueban una licencia legal, no investigan la titularidad ni demuestran que se haya obtenido consentimiento. Una empresa sigue necesitando una base defendible para usar los documentos originales. Llamar interna a una colección no resuelve esa cuestión.

El código de exportación selecciona unidades fuente y filtra material de navegación, entradas cortas y texto repetido. No genera ejemplos de entrenamiento, no llama a un modelo de lenguaje ni entrena uno. La selección de fuentes es un resultado de investigación interna, no un conjunto de datos público. Los manuales de OpenText quedan expresamente fuera de esta selección hasta que tengan auténticas unidades por sección. Aquí trabajo con mi documentación; no estoy informando de un corpus de un cliente convertido y aprobado.

La procedencia del corpus es el registro del origen y del historial de procesamiento de la colección: de dónde vino el material, cómo se seleccionó o dividió y a qué fuente pertenece una unidad recuperada. Las unidades de hoy llevan contexto sobre la fuente y el procesamiento para facilitar ese seguimiento. La procedencia ayuda a examinar una afirmación; no la convierte en correcta ni sustituye la revisión de derechos.

## La siguiente prueba

La evidencia de esta noche consiste en implementación y casos de prueba incorporados al repositorio, no en una mejora medida de recuperación ni en un entrenamiento verificado. Mi siguiente prueba es deliberadamente pequeña: plantear una pregunta cuya respuesta esté en una sección conocida, recuperarla y comparar la sección con el original. Después repetir con una sección larga cuyo detalle importante esté cerca del final. También quiero examinar las restricciones junto al texto fuente seleccionado y comprobar qué quedó excluido. Si no puedo explicar esos resultados a la persona responsable de los documentos de la empresa, añadir más documentos no es avanzar.

* * *

**Base histórica:** commits de VALESKA `2e7ced0`, `e11a9ef` y `43a1f0e`, 16 de agosto de 2026, America/Los\_Angeles. Establecen las implementaciones de secciones, almacenamiento y selección de fuentes; aquí no se afirma una ejecución en vivo.


## Translations
- en: https://avanticomplex.com/en/blog/documents-must-become-knowledge-units/
- es: https://avanticomplex.com/es/blog/documents-must-become-knowledge-units-es/
- pt: https://avanticomplex.com/pt/blog/documents-must-become-knowledge-units-pt/
