# O corpus deve ser higiênico antes de ser inteligente

Notas de pesquisa de 18 de agosto: testes de proveniência corrigem uma suposição sobre armazenamento, enquanto uma coleção copiada cai de 7.574 fragmentos indexados para 49, sem provar respostas melhores.

Language: pt
Canonical: https://avanticomplex.com/pt/blog/the-corpus-must-be-hygienic-before-it-is-smart-pt/

Published: 2026-08-19T06:59:00.000Z

18 de agosto de 2026. Antes de pedir que a VALESKA pareça mais inteligente, preciso saber o que sua coleção de documentos realmente contém. Um corpus é a coleção na qual um sistema de IA busca ou da qual aprende. Higiene do corpus significa verificar essa coleção em busca de repetição enganosa, material desatualizado e registros que já não apontam para uma fonte disponível. O trabalho desta semana produz correções e contagens, não uma afirmação de que toda a coleção está limpa.

Para quem lidera o primeiro projeto de IA de uma empresa, o risco prático é simples: uma resposta convincente pode se apoiar em evidências mal identificadas. Cinco cópias de um documento não são cinco fontes independentes. Cópias podem ocupar posições nos resultados e deixar outras evidências de fora, dependendo da consulta e da classificação. É um risco a medir, não uma regra segundo a qual duplicatas vencem todas as buscas.

## Primeiro, corrigir a suposição

OTCS significa OpenText Content Server, um sistema de gestão documental. A proveniência do corpus é o registro da origem e do histórico de tratamento do material. Neste trabalho, uma categoria anexa essas informações aos documentos depositados. O contrato da categoria é o acordo sobre o significado de seus campos e quais valores são aceitáveis. Salvar com sucesso não basta se a informação vai parar no lugar errado.

Em 17 de agosto, corrijo uma suposição errada nas notas operacionais: a largura da coluna de um campo de texto multilinha controla a exibição, não a capacidade de armazenamento. Os testes registrados no Content Server 16.2.0 gravam e recuperam valores de até 131.000 caracteres sem truncamento; um valor de 5.000 caracteres também aparece completo na interface Classic. São observações da instalação testada, não uma promessa sobre todas as versões ou configurações.

Medir o comprimento dos caminhos de origem continua ajudando a descrever uma implantação e escolher uma exibição legível. Não é uma barreira contra perda de dados causada pela largura da coluna. Separadamente, o registro de proveniência é relatado como gravado e lido corretamente em todos os 17 campos. A nova verificação anterior à ingestão relata sete verificações aprovadas e rejeita uma divergência simulada no mapeamento de campos e nos valores permitidos. Já existe um teste negativo aqui; não devo escrever como se detectar falhas fosse apenas uma intenção futura.

## Depois, contar a limpeza

A coleção copiada de hoje começa com 7.574 fragmentos indexados, ou seja, partes menores de texto disponíveis para recuperação. A primeira retirada registrada remove 6.496 fragmentos duplicados ou desatualizados. Uma segunda remove mais 1.029: 183 duplicatas recém-reconhecidas e 846 registros que ficaram órfãos após a movimentação de documentos. O índice da cópia termina com 49 fragmentos em dois arquivos. São resultados de execução registrados no repositório, não uma nova medição de uma instalação de cliente.

O registro do mesmo dia relata 20 documentos únicos devolvidos ao projeto StoryTeller, ao qual pertencem. Comparar pelo conteúdo importa porque nomes de arquivo diferentes podem esconder o mesmo texto. Uma correspondência aproximada não é automaticamente uma duplicata exata, e uma entrada órfã no índice não prova que seu conteúdo seja descartável. A retirada dessas entradas exige uma escolha explícita; confirmar um destino indexado continua sendo um requisito de segurança, não algo que a ausência do caminho de origem comprove.

Limpar o índice e excluir arquivos de origem são ações diferentes. A primeira retirada deixa os arquivos em disco intactos; a repatriação separada move os 20 documentos. Um leitor baseado em arquivos ainda depende da árvore copiada restante, portanto remover essa árvore continua sendo uma questão não resolvida. O registro de situação da noite também deixa três grupos de corpos de texto duplicados em aberto. Assim, as contagens descrevem uma intervenção delimitada, não um atestado de limpeza para todas as coleções ou todos os leitores.

## O próximo teste

Quero que a próxima verificação conecte esses resultados de inventário ao que uma pessoa vê. Repetir um conjunto pequeno e fixo de perguntas, examinar se os resultados restantes citam a fonte pretendida e confirmar que o material movido continua recuperável antes de qualquer nova retirada. Rever os grupos de duplicatas em aberto e testar a divergência da categoria na implantação de destino. Menos cópias indexadas e um contrato de proveniência testado são avanços úteis. Nenhum dos dois estabelece uma qualidade melhor de resposta sem essa medição separada. Meu trabalho é manter essa distinção visível.

* * *

**Base histórica:** commits da VALESKA `93b938f`, `7c5e69d` e `985d6a5`, 17 de agosto; `f44d6de`, `4b5f2e3`, `916b56c`, `04adc31` e registro de situação `f90568d`, 18 de agosto de 2026, America/Los\_Angeles. Os resultados são atribuídos ao registro datado do repositório.


## Translations
- en: https://avanticomplex.com/en/blog/the-corpus-must-be-hygienic-before-it-is-smart/
- es: https://avanticomplex.com/es/blog/the-corpus-must-be-hygienic-before-it-is-smart-es/
- pt: https://avanticomplex.com/pt/blog/the-corpus-must-be-hygienic-before-it-is-smart-pt/
