Новый метод устраняет эффект Гидры при поиске схем в LLM
Пятеро исследователей опубликовали на arXiv статью «Slaying the Hydra: Interaction-Aware Circuit Discovery in Language Models», которая формально решает проблему эффекта Гидры в механистической интерпретируемости. Метод WISE и алгоритм JuntaLearner оценивают вклад компонентов модели с учётом компенсаторных реакций, а не по отдельности.
- Эффект Гидры описан в работе Google DeepMind 2023 года: при удалении компонента другие берут его функции на себя
- Метод WISE заимствует понятие «свидетеля» из теории причинного вывода Перла и Халперна
- Алгоритм JuntaLearner ранжирует компоненты по причинному влиянию группами, а не по одному
- Проблема затрагивает инструменты ACDC, EAP и Edge Pruning, оценивающие компоненты изолированно
Читать дальше
Наука