Robust unlearning via randomly initialized distillation: a theoretical investigation

Carregando...
Imagem de Miniatura
Data
2026-03-05

Orientador(res)

Poco, Jorge

Métricas

Título da Revista

ISSN da Revista

Título de Volume

Resumo
A implementação de grandes modelos de linguagem (LLMs) treinados com dados em escala web tornou necessária a criação de mecanismos robustos para o desaprendizado de máquina — a remoção posterior de capacidades perigosas, material protegido por direitos autorais ou dados pessoais sensíveis. Os paradigmas de desaprendizado existentes, baseados principalmente em otimização ou engenharia de representação, frequentemente falham em alcançar a eliminação completa e podem resultar em mascaramento comportamental, onde o modelo suprime saídas perigosas enquanto retém a capacidade subjacente em seus parâmetros, tornando-o suscetível a ataques de reaprendizagem rápida. Esta dissertação apresenta uma estrutura teórica que estabelece as condições sob as quais a destilação inicializada aleatoriamente permite um desaprendizado robusto. Formalizamos o processo de desaprendizado através da lente da teoria da informação e da geometria de alta dimensão. A principal contribuição é uma prova baseada na desigualdade de processamento de dados, mostrando que inicializar um modelo aluno a partir de uma distribuição aleatória — em vez de ajustar os pesos pré-treinados — rompe a linhagem de parâmetros necessária para manter alta informação mútua com uma variável latente perigosa. Enquanto o ajuste fino permanece preso na perigosa bacia de atração devido à dinâmica de treinamento preguiçoso, a destilação inicializada aleatoriamente não apresenta essa tendência, eliminando assim a persistência da capacidade perigosa sob nossas suposições.

Descrição

Área do Conhecimento

Avaliação

Revisão

Suplementado Por

Referenciado Por