Robust unlearning via randomly initialized distillation: a theoretical investigation
Carregando...
Arquivos
Data
2026-03-05
Autores
Orientador(res)
Poco, Jorge
Métricas
Título da Revista
ISSN da Revista
Título de Volume
Resumo
A implementação de grandes modelos de linguagem (LLMs) treinados com dados em escala web tornou necessária a criação de mecanismos robustos para o desaprendizado de máquina — a remoção posterior de capacidades perigosas, material protegido por direitos autorais ou dados pessoais sensíveis. Os paradigmas de desaprendizado existentes, baseados principalmente em otimização ou engenharia de representação, frequentemente falham em alcançar a eliminação completa e podem resultar em mascaramento comportamental, onde o modelo suprime saídas perigosas enquanto retém a capacidade subjacente em seus parâmetros, tornando-o suscetível a ataques de reaprendizagem rápida. Esta dissertação apresenta uma estrutura teórica que estabelece as condições sob as quais a destilação inicializada aleatoriamente permite um desaprendizado robusto. Formalizamos o processo de desaprendizado através da lente da teoria da informação e da geometria de alta dimensão. A principal contribuição é uma prova baseada na desigualdade de processamento de dados, mostrando que inicializar um modelo aluno a partir de uma distribuição aleatória — em vez de ajustar os pesos pré-treinados — rompe a linhagem de parâmetros necessária para manter alta informação mútua com uma variável latente perigosa. Enquanto o ajuste fino permanece preso na perigosa bacia de atração devido à dinâmica de treinamento preguiçoso, a destilação inicializada aleatoriamente não apresenta essa tendência, eliminando assim a persistência da capacidade perigosa sob nossas suposições.
