Статистический аудит графика временных горизонтов METR: 10x не всегда 10x
Двое статистиков из Беркли (Nguyen и Fithian, октябрь 2026) перепроверили график METR о росте временных горизонтов ИИ на 228 задачах, 79 семействах и 26 моделях. Они не оспаривают экспоненциальный тренд, но показывают, что связь человеческого времени и сложности для ИИ почти плоская в диапазоне 2–30 минут, поэтому скачок с 3 до 30 минут намного легче, чем с 30 минут до 5 часов.
- Данные: 228 задач, 79 семейств, 26 моделей, 5-кратная кросс-валидация по семействам
- Кривая конверсии почти плоская от 2 до 30 минут человеческого времени
- 83% прогонов модели на задаче единогласны против ожидаемых 60%
- Около 29% задач опираются на экспертную оценку времени, а не на замеры
Читать дальше
ИИ