Tri-PvP: визуальный перекос в омни-модальных LLM виден уже в первых слоях
Новый бенчмарк Tri-PvP показал, что в большинстве омни-модальных LLM визуальный сигнал доминирует в выборе ответа и превышает 60% перекоса. Перекос линейно считывается уже с первых слоёв трансформера, а контрастивное декодирование снижает его без потери качества: точность OmniBench падает с 38,4% до 37,4%.
- BIAS_IMAGE доминирует в 18 из 20 столбцов на графике 3
- Доля визуального перекоса часто превышает 60%
- Перекос считывается линейным зондом с первых слоёв
- Контрастивное декодирование: OmniBench 38,4% → 37,4%
Читать дальше
ИИ