
21 de agosto de 2026. Estou a aplicar o método de descoberta da VALESKA à nossa própria organização antes de lhe confiar os documentos de um cliente. A VALESKA é o sistema de documentos e memória organizacional que estou a construir. A ingestão consiste em trazer material para esse sistema para processamento e recuperação. Começar por aí implicaria tomar decisões de classificação e âmbito antes de estabelecer o que a empresa realmente guarda.
A primeira passagem de descoberta interna regista catorze defeitos no método e nas ferramentas de apoio. Três exigem atenção antes de avançar: faltam perguntas sobre material pessoal e médico, faltam perguntas sobre material confidencial de antigos clientes e falta uma ferramenta de inventário obrigatória que ainda não existe naquele momento do dia. Construo o inventário mais tarde hoje. Encontrar as omissões em casa é útil; não demonstra que o método esteja pronto para qualquer cliente.
Olhar antes de recolher
Documento uma sequência de levantamento que começa por verificar a acessibilidade e prossegue com contagens estruturais, nomes e padrões de pastas, caracterização documental, amostragem de conteúdo e validação humana do modelo proposto. O documento chama-lhe cinco níveis, mas numera a verificação preliminar como nível 0, seguido de outras cinco etapas. A distinção prática é entre aprender com a estrutura e abrir documentos. A inspeção mais cara deve responder a uma pergunta que o levantamento mais barato não consegue resolver.
Os nomes das pastas importam porque mostram como as pessoas já organizam o trabalho: por cliente, projeto, propriedade ou assunto. Esses termos são candidatos a um vocabulário controlado, os nomes acordados que um assistente pode utilizar de forma consistente. Continuam a precisar de confirmação pela empresa. Numa coleção medida, 55,4% de 2.019 ficheiros classificados caíram numa única categoria de processos que era semanticamente errada. Não vou confundir uma lista de categorias padrão com compreender a empresa.
A contagem é uma descoberta
O novo inventário de ensaio lê sem depositar documentos nem atualizar uma base de dados. Distingue contagens brutas de ficheiros de contagens plausíveis de documentos e assinala conteúdo duplicado, colisões de nomes e possíveis dados sensíveis. O hash cria uma impressão digital para comparação; não torna um inventário correto por si só. Comparar texto documental normalizado pode identificar conteúdo equivalente que uma comparação de ficheiros byte a byte não deteta. Ler esse conteúdo também exige mais trabalho do que listar nomes.
A evidência de hoje mostra por que preciso dessas distinções. As junções de diretórios do Windows, que apontam para outros diretórios, inflacionaram uma contagem de 22.281 para 78.679. Contar um diretório inteiro de dependências excluídas como um único item inverteu a proporção de ruído comunicada de 99,1% para 1,9%. Em quatro coleções levantadas, a nota de âmbito regista 405.711 ficheiros num percurso ingénuo, 11.671 ficheiros reais e 3.700 documentos propriamente ditos. São populações diferentes, não estimativas intercambiáveis de uma carga de ingestão.
O âmbito precisa de um responsável
Um alerta de sensibilidade é uma pergunta para uma pessoa autorizada, não uma instrução para descartar silenciosamente um ficheiro. A informação médica pessoal e os registos de antigos clientes precisam de decisões explícitas de âmbito. O código-fonte fica fora do trabalho documental por defeito, mas a prosa dentro de um repositório, como um manual operacional ou uma nota de arquitetura, pode continuar incluída. O limite é o ativo, não apenas a pasta que o contém. O código exige autorização e tratamento separados, não recolha acidental juntamente com os documentos.
O documento de levantamento de hoje declara uma limitação importante das ferramentas: o caracterizador documental só foi executado sobre material estruturado, não sobre Word, Excel, PowerPoint ou PDF. Numa pasta de consultoria levantada, 74% dos ficheiros eram documentos binários do Office. Propor uma etapa de caracterização não demonstra cobertura desses formatos. As velocidades de levantamento local e em rede também diferem muito, pelo que os meus tempos são observações neste equipamento, não o calendário de um cliente.
A próxima evidência
Quero um inventário reproduzível de uma coleção acordada, um registo do material sensível e excluído revisto pelo responsável e uma caracterização testada nos formatos realmente presentes. Só então poderei defender o modelo de classificação proposto e a estimativa de trabalho. O resultado de hoje é um levantamento melhor e uma lista mais clara da evidência em falta, não uma ingestão de cliente concluída.
Base histórica: commits da VALESKA 53e486c, c94515e, e642f5a, 34990fa, 21 de agosto de 2026 (hora do Pacífico).