InnerExpert: несогласие экспертов внутри MoE-модели предсказывает галлюцинации
Исследователи предложили метод InnerExpert, который по неопределённости роутера и расхождению внутренних экспертов MoE-модели выдаёт предупреждение о возможной галлюцинации. На пяти датасетах и двух архитектурах MoE лучший результат — 0,91 AUROC на уровне ответа и 0,76 на уровне токена, без дополнительных проходов модели.
- Метод использует неопределённость роутера и расхождение экспертов MoE как сигнал тревоги
- Лучший результат: 0,91 AUROC на уровне ответа и 0,76 на уровне токена
- Тесты прошли на пяти датасетах и двух архитектурах MoE
- Детектор не требует второго прохода модели или дополнительных генераций
Читать дальше
ИИ