8 сентября 2026 г.
Главный график прогресса ИИ отстал от моделей: METR не обновляет его с 8 мая
Последняя точка на графике METR поставлена 8 мая: с тех пор Anthropic отчиталась о 38-часовом прогоне без присмотра.

Кривая, по которой индустрия мерит прогресс ИИ, стоит на месте с 8 мая 2026.
METR меряет горизонт задач: сколько часов человеческой работы модель дотягивает до конца сама. Последняя точка на графике осталась за Claude Mythos Preview, замеренной в мае. Моделей свежее на нём нет.
По этой кривой и считали темп: горизонт удваивался каждые 88,6 дня по данным с 2024 года и каждые 130,8 дня по данным с 2023-го. Пока новых точек нет, скорость прогресса каждый оценивает по своим отчётам.
Набор задач кончается. В версии Time Horizon 1.1 METR довела набор со 170 до 228 задач, а задач на 8+ часов стало 31 вместо 14. Человеческие бейслайны замерены только у 5 из этой тридцати одной. На странице замера сказано прямо: выше 16 часов измерения на текущем наборе ненадёжны.
Цифра плывёт от расчёта. У Opus 4.6 горизонт при половине успешных прогонов вышел около 12 часов, после поправки на шум — 7–8. При планке 80% успеха он падает до часа-полутора. Доверительные интервалы METR исторически расходятся вдвое в каждую сторону.
Горизонт METR меряет не то, сколько модель работает без остановки. На задачах, где нужно смотреть на экран, он ниже в 40–100 раз.
Итан Моллик в июньском разборе описал заход, где Opus 4.7 за 14 часов работы без присмотра собрала пакет софта, на который у человека ушло бы от 2 до 17 недель, а токены обошлись в $251. В анонсе Fable 5.1 от 1 сентября Anthropic приводит непрерывный 38-часовой прогон без присмотра. Самая длинная задача в наборе METR — 30 часов.
Новая точка на графике появится, когда METR замерит модель свежее майской и наберёт человеческие бейслайны на длинных задачах.
Первоисточник
