
16 de agosto de 2026. Quero que a VALESKA devolva uma seção útil, não que me entregue um documento inteiro e considere o trabalho terminado. A VALESKA é o sistema de documentos e memória organizacional que estou construindo. As alterações desta noite no repositório acrescentam unidades de conhecimento por seção, uma forma de armazená-las e uma seleção de fontes com etiquetas de direitos para trabalho interno. É um marco concreto de engenharia. Ainda não é evidência de que um assistente responde melhor.
Se você acabou de assumir a iniciativa de IA da sua empresa, vale a pena preservar essa distinção. Um embedding é uma representação numérica usada para encontrar texto relacionado. Por si só, ele não estabelece onde uma instrução começa, qual aviso deve acompanhá-la ou se o material pode ser reutilizado. Encontrar palavras semelhantes e preservar evidências utilizáveis são tarefas diferentes.
O que entendo por unidade
Uma unidade de conhecimento é uma parte delimitada do material de origem que conserva identidade e contexto suficientes para ser examinada separadamente. Em um manual, pode ser um título e o corpo de sua seção, com sua posição na hierarquia do documento e uma ligação com a fonte. Não é um fato certificado como verdadeiro. Uma seção bem delimitada ainda pode estar errada, desatualizada ou ser inadequada para determinado leitor.
O tratamento de seções de hoje segue os títulos do documento, incluindo as seções numeradas dos manuais, em vez de considerar um comprimento arbitrário de texto como limite natural. Os testes incorporados ao repositório cobrem manter uma seção inteira, preservar o contexto da seção superior e não confundir uma linha semelhante a um título dentro de um exemplo de código com um título verdadeiro. Aqui, manual significa um documento como um livro de instruções; não significa que eu tenha rotulado cada seção à mão.
O código de armazenamento mantém o texto completo da unidade, mas o texto enviado para gerar o embedding pode ser encurtado para caber no modelo. Esse limite importa. Preservar a seção inteira no armazenamento não garante que cada frase influencie como a busca a encontra. Um procedimento longo com seu aviso decisivo perto do final é um caso difícil e útil, não algo que eu possa ignorar porque a unidade tem um título.
Uma etiqueta não é permissão
Etiquetas de direitos são metadados que registram usos pretendidos e restrições. O código de seleção de fontes de hoje marca o material para uso interno e contra a publicação ou transferência a terceiros. Essas etiquetas não comprovam uma licença legal, não investigam a titularidade nem demonstram que houve consentimento. Uma empresa continua precisando de uma base defensável para usar os documentos originais. Chamar uma coleção de interna não resolve essa questão.
O código de exportação seleciona unidades de origem e filtra material de navegação, entradas curtas e texto repetido. Ele não gera exemplos de treinamento, não chama um modelo de linguagem nem treina um. A seleção de fontes é um artefato de pesquisa interna, não um conjunto de dados público. Os manuais da OpenText ficam explicitamente fora dessa seleção até terem unidades reais por seção. Estou trabalhando com minha documentação, não relatando a conversão e aprovação do corpus de um cliente.
A proveniência do corpus é o registro da origem e do histórico de processamento da coleção: de onde veio o material, como foi selecionado ou dividido e a qual fonte pertence uma unidade recuperada. As unidades de hoje carregam contexto da fonte e do processamento para apoiar esse rastreamento. A proveniência ajuda alguém a examinar uma afirmação; não a torna correta nem substitui a revisão de direitos.
O próximo teste
A evidência desta noite é a implementação e os casos de teste incorporados ao repositório, não uma melhoria medida na recuperação nem um treinamento verificado. Meu próximo teste é deliberadamente pequeno: fazer uma pergunta cuja resposta esteja em uma seção conhecida, recuperá-la e comparar a seção com o original. Depois, repetir com uma seção longa cujo detalhe importante esteja perto do final. Também quero examinar as restrições ao lado do texto de origem selecionado e verificar o que foi excluído. Se eu não conseguir explicar esses resultados à pessoa responsável pelos documentos da empresa, acrescentar mais documentos não é progresso.
Base histórica: commits da VALESKA 2e7ced0, e11a9ef e 43a1f0e, 16 de agosto de 2026, America/Los_Angeles. Eles estabelecem as implementações de seções, armazenamento e seleção de fontes; nenhuma execução ao vivo é afirmada aqui.