Принстон научил LLM на 4 млрд параметров играть в шахматы на 2700 Elo с объяснением ходов
Исследователи из Принстона обучили LLM на 4 млрд параметров сочетанием обучения с подкреплением и объяснимости. Модель достигла рейтинга 2700 Elo и объясняет свои ходы, а метод может переноситься на робототехнику и другие игры.
- Модель на 4 млрд параметров достигла рейтинга 2700 Elo в шахматах
- Обучение сочетает reinforcement learning с механизмами объяснимости
- Модель объясняет ходы, опираясь на шахматные принципы
- Метод масштабируется на робототехнику, игры и работу с компьютером
Читать дальше
ИИ