
21 de agosto de 2026. Estoy aplicando el método de descubrimiento de VALESKA a nuestra propia organización antes de confiarle los documentos de un cliente. VALESKA es el sistema de documentos y memoria organizacional que estoy construyendo. La ingestión consiste en incorporar material al sistema para procesarlo y recuperarlo. Empezar por ahí implicaría decidir la clasificación y el alcance antes de establecer qué conserva realmente la empresa.
La primera pasada de descubrimiento interno registra catorce defectos en el método y sus herramientas de apoyo. Tres requieren atención antes de continuar: faltan preguntas sobre material personal y médico, faltan preguntas sobre material confidencial de antiguos clientes y falta una herramienta de inventario obligatoria que todavía no existe en ese momento del día. Construyo el inventario más tarde hoy. Encontrar las omisiones en casa es útil; no demuestra que el método esté listo para cualquier cliente.
Mirar antes de recopilar
Documento una secuencia de relevamiento que comienza comprobando la accesibilidad y continúa con recuentos estructurales, nombres y patrones de carpetas, caracterización documental, muestreo de contenido y validación humana del modelo propuesto. El documento la llama de cinco niveles, pero numera la comprobación preliminar como nivel 0, seguido de otras cinco etapas. La distinción práctica es entre aprender de la estructura y abrir documentos. La inspección más costosa debe responder una pregunta que el relevamiento más barato no pueda resolver.
Los nombres de las carpetas importan porque muestran cómo las personas ya organizan su trabajo: por cliente, proyecto, propiedad o asunto. Esos términos son candidatos a un vocabulario controlado, los nombres acordados que un asistente puede utilizar de manera uniforme. Todavía necesitan la confirmación de la empresa. En una colección medida, el 55,4% de 2.019 archivos clasificados cayó en una sola categoría de procesos que era semánticamente incorrecta. No voy a confundir una lista de categorías estándar con entender la empresa.
El recuento es un hallazgo
El nuevo inventario de prueba lee sin depositar documentos ni actualizar una base de datos. Distingue los recuentos brutos de archivos de los recuentos plausibles de documentos y señala contenido duplicado, colisiones de nombres y posibles datos sensibles. El hash crea una huella para comparar; no hace correcto un inventario por sí solo. Comparar texto documental normalizado puede identificar contenido equivalente que una comparación de archivos byte por byte no detecta. Leer ese contenido también exige más trabajo que listar nombres.
La evidencia de hoy muestra por qué necesito esas distinciones. Las uniones de directorios de Windows, que apuntan a otros directorios, inflaron un recuento de 22.281 a 78.679. Contar un directorio entero de dependencias excluidas como un solo elemento invirtió la proporción de ruido informada del 99,1% al 1,9%. En cuatro colecciones relevadas, la nota de alcance registra 405.711 archivos en un recorrido ingenuo, 11.671 archivos reales y 3.700 documentos propiamente dichos. Son poblaciones diferentes, no estimaciones intercambiables de una carga de ingestión.
El alcance necesita un responsable
Una señal de sensibilidad es una pregunta para una persona autorizada, no una instrucción para descartar silenciosamente un archivo. La información médica personal y los registros de antiguos clientes necesitan decisiones explícitas de alcance. El código fuente queda fuera del trabajo documental por defecto, pero la prosa dentro de un repositorio, como un manual operativo o una nota de arquitectura, puede seguir dentro. El límite lo marca el activo, no solamente la carpeta que lo contiene. El código requiere autorización y tratamiento separados, no una recopilación accidental junto con los documentos.
El documento de relevamiento de hoy declara una limitación importante de las herramientas: el caracterizador documental solo se ha ejecutado sobre material estructurado, no sobre Word, Excel, PowerPoint ni PDF. En una carpeta de consultoría relevada, el 74% de los archivos eran documentos binarios de Office. Proponer una etapa de caracterización no demuestra cobertura de esos formatos. Las velocidades de relevamiento local y en red también difieren mucho, por lo que mis tiempos son observaciones en este equipo, no el cronograma de un cliente.
La siguiente evidencia
Quiero un inventario reproducible de una colección acordada, un registro del material sensible y excluido revisado por su responsable y una caracterización probada con los formatos realmente presentes. Solo entonces podré defender el modelo de clasificación propuesto y la estimación de trabajo. El resultado de hoy es un relevamiento mejor y una lista más clara de la evidencia que falta, no una ingestión de cliente terminada.
Base histórica: commits de VALESKA 53e486c, c94515e, e642f5a, 34990fa, 21 de agosto de 2026 (hora del Pacífico).