← Все статьи

RESEARCH · 2026-08-21 · ~29 мин

Золото на матолимпиаде и часы наугад

Stanford выпустил AI Index 2026 — 425 страниц независимых данных о том, что на самом деле происходит с AI. Главный вывод года: у способностей моделей нет единого «уровня», у них рельеф. Разбираемся, где проходят зубцы, где впадины и как раскладывать по этому рельефу свою работу.

Две новости одного года

Летом 2025 года Gemini Deep Think сдала Международную математическую олимпиаду. Не «решила задачки по мотивам» и не получила поблажек на формат: тот же контест, те же 4,5 часа, решения от начала до конца на естественном языке. 35 баллов, золотая медаль.

Годом раньше на той же олимпиаде тоже была медаль — серебро, 28 баллов, четыре задачи из шести. Но взяла его другая система DeepMind, AlphaProof в связке с AlphaGeometry 2, и в принципиально других условиях: задачи ей вручную переводили в формальный язык Lean, а считала она днями. Так что прыжок с серебра на золото за год — это ещё и прыжок от специального математического движка к обычной модели, которая работает текстом и укладывается в регламент.

А через несколько страниц того же отчёта — другая цифра. Лучшая модель правильно определяет время по аналоговым часам в 50,6% случаев. Человек, если циферблат оформлен обычным образом, — в 90,1%. Две стрелки и круг.

Золото на олимпиаде, куда каждый год отбираются лучшие школьники планеты. И подбрасывание монетки на задаче, которую решает первоклассник.

Это не курьёз и не придирка журналистов. Stanford выносит это противоречие в свои главные выводы года — как самую честную иллюстрацию того, что происходит с моделями. Исследователи называют такую форму способностей зубчатой границей (jagged frontier, иногда jagged intelligence): у AI нет единого «уровня интеллекта», по которому его можно расположить относительно человека. У него рельеф — с высокими зубцами и глубокими впадинами, причём зубцы и впадины стоят вплотную друг к другу.

РЕЛЬЕФ · AI INDEX 2026, СТР. 96, 100, 104, 117

Один и тот же год, одни и те же модели

Четыре замера из одного отчёта. Слева — то, что принято называть прорывом. Справа — то, что стоит рядом на той же карте.

  • Зубец · вплотную к человеку или выше
  • Впадина · далеко ниже человека

Матолимпиада IMO

35

баллов и золотая медаль у Gemini Deep Think. Годом раньше 28 баллов и серебро взяли AlphaProof с AlphaGeometry 2 — с ручным переводом задач в Lean.

Починка багов, SWE-bench Verified

76,8%

у Claude 4.5 Opus, лидера лидерборда на февраль 2026. Вплотную к человеку-инженеру, но всё ещё ниже его.

Чтение аналоговых часов, ClockBench

50,6%

против 90,1% у человека на корректном циферблате. Практически подбрасывание монетки.

Домашние задачи, BEHAVIOR-1K

12,4%

полного успеха у лучшей команды роботов на тысяче бытовых сценариев в симуляции

Это не разные поколения и не разные лаборатории. Это одна и та же индустрия в одном и том же году. Единого «уровня интеллекта», по которому можно расставить AI и человека, из этих чисел не собирается.

Отсюда следует неприятная вещь. Вопрос «дорос ли уже AI до моей задачи» поставлен неправильно, и любой ответ на него будет враньём. Правильный вопрос звучит иначе: где именно моя задача лежит на этом рельефе — и рядом с каким обрывом.

Что за отчёт

AI Index — ежегодный отчёт Stanford HAI, института человекоцентричного AI при Стэнфордском университете. Издание 2026 года — девятое по счёту, вышло в апреле, объём — 425 страниц. Отчёт независимый: он не продаёт модели, не привлекает раунд и не защищает ничью долю рынка. В поле, где почти все данные производят те, кому выгоден рост, это редкое свойство.

Полезно и то, чего в отчёте нет: обещаний. Авторы честно пишут, где данных не хватает, где методика хромает и где измерения перестали работать. Именно эти места и оказались самыми интересными.

Ниже — весь отчёт через одну оптику: зубчатой границы. Что модели забрали за год, где ломаются стабильно, почему самой карте нельзя верить, отдельно про агентов (там зубец и впадина стоят в одной точке), как рельеф проступает в деньгах и найме и как под него раскладывать работу. Все цифры — из отчёта; ключевые сопровождаются номерами страниц в подписях к графикам, чтобы можно было проверить.

Что такое зубчатая граница

Привычная картинка прогресса AI — лестница. Модель поднимается со ступеньки на ступеньку, и чем выше, тем больше задач ей по силам. Из этой картинки следует простое правило: если модель справилась с чем-то сложным, то с чем-то попроще справится тем более.

Правило не работает. Совсем.

Олимпиадная геометрия — это задача, требующая многошагового рассуждения, построения, проверки гипотез. Определение времени по часам — это посмотреть, куда указывают две стрелки, и перевести это в число. По человеческим меркам разница в сложности примерно как между доказательством теоремы и завязыванием шнурков. У моделей эти две задачи стоят в обратном порядке.

Причина в том, что «сложность» для человека и для модели — разные вещи. Человеку тяжело то, что требует долгой концентрации и редких знаний. Модели тяжело то, чего было мало в обучающих данных, что требует точной пространственной привязки или где ошибка на первом шаге тихо перетекает в следующий. Чтение аналоговых часов попадает сразу во все три категории — почему именно, разберём ниже, когда дойдём до впадин.

Отсюда главное практическое следствие: результат на одной задаче почти ничего не говорит о соседней. Модель, которая блестяще написала тебе SQL-запрос, может рассыпаться на переименовании файлов по дате. И наоборот. Экстраполировать нельзя — можно только проверять.

Второе следствие — про выбор модели. В отчёте есть замер по профессиональным доменам: налоги, обработка ипотечных заявок, корпоративные финансы, юридические рассуждения. Результаты моделей там укладываются в диапазон 60–90%. Но интереснее другое: топ-15 моделей в каждом из этих доменов разделяют считаные процентные пункты. Точная формулировка отчёта — «as little as 3 percentage points»: три пункта — это минимальный разрыв по домену, а не общее правило, в налоговом TaxEval он ровно такой, в юридических тестах чуть шире.

То же самое на общем уровне: четыре компании-лидера умещаются в 25 пунктов Elo. Elo здесь — рейтинг по типу шахматного, который ведёт площадка LMArena: людям вслепую показывают ответы двух моделей на один и тот же запрос и просят выбрать лучший; из сотен тысяч таких сравнений и складывается число.

Тут есть соблазн сделать вывод «раз все примерно равны, то и выбирать нечего». Соблазну лучше не поддаваться — по той же самой причине, по которой мы вообще завели разговор про рельеф. Средние по бенчмаркам сошлись, но две модели, стоящие в трёх пунктах друг от друга в общем зачёте, на твоей конкретной задаче могут разойтись как угодно: у одной там зубец, у другой впадина. Сходимость средних не делает модели взаимозаменяемыми — она лишь означает, что рейтинг перестал быть полезным аргументом в споре.

Что действительно следует из этих чисел: решает не выбор вендора, а то, как ты формулируешь задачу и как проверяешь ответ. По моему опыту разница между двумя постановками одного и того же запроса стабильно больше, чем разница между Claude, GPT и Gemini на этом же запросе — это личное наблюдение, а не замер из отчёта, но проверить его на своих задачах можно за вечер.

Зубцы: что модели забрали за год

Начнём с хорошего — и сразу с самой цитируемой цифры года, потому что её почти всегда пересказывают неправильно.

Программирование: 60% → почти 100%

SWE-bench Verified — бенчмарк, где модели чинят настоящие баги в настоящих открытых репозиториях. Не пишут функцию по описанию, а получают issue из GitHub и должны выдать патч, который пройдёт тесты проекта. Из всех бенчмарков это, пожалуй, самый близкий к реальной работе.

Отчёт сообщает: результат вырос примерно с 60% в 2024 году до почти 100% в 2025-м.

И вот здесь ловушка, на которой ломается половина новостных пересказов. Это не абсолютный балл — это процент от человеческого baseline, то есть от того уровня, который на этом же наборе задач показывает человек-инженер. «Почти 100%» означает «почти сравнялись с человеком», а не «решают почти все задачи».

Это не моя догадка, а объявленная методика AI Index: команда отчёта калибрует каждый бенчмарк так, чтобы результат лучшей модели года выражался в процентах от установленного человеческого уровня для этой задачи. В отчёте прямо поясняют: значение 105% означает, что модель на 5% лучше человека. Шкала удобная — но при пересказе из неё легко выпадает половина смысла.

Абсолютные числа скромнее и полезнее. На февраль 2026 лидерборд SWE-bench Verified возглавляет Claude 4.5 Opus в режиме high reasoning — около 76,8% (стр. 100). Дальше всё стоит вплотную: KimiK2.5, GPT-5.2, Gemini 3 Flash и остальные сидят между 70% и 76%. Отдельно отчёт сравнивает поколения одной линейки: GPT-5.1 даёт около 76,3% против 72,8% у предыдущего GPT-5.

То есть примерно каждая четвёртая задача всё ещё не решается. И отчёт прямым текстом пишет, что в автономной разработке модели всё ещё ниже человеческого baseline (стр. 75) — просто разрыв за год почти закрылся.

Разница между «решает 100% задач» и «решает три четверти задач, вплотную подойдя к человеку» — это разница между «можно не смотреть» и «смотреть обязательно». Дальше по тексту она вылезет ещё не раз.

Экзамены, которые строили против AI

Humanity’s Last Exam — бенчмарк, который специально собирали так, чтобы он был тяжёлым для моделей и удобным для людей-экспертов. За один год модели переднего края (frontier — те, что задают потолок отрасли) прибавили на нём 30 процентных пунктов: с менее чем 10% до 38,3%. Шесть вопросов из десяти по-прежнему не берутся, и отчёт отмечает, что уверенные ошибки на этом бенчмарке всё ещё обычное дело.

Сдались и другие рубежи, которые ещё недавно считались недостижимыми: вопросы уровня PhD по естественным наукам (GPQA Diamond), мультимодальные рассуждения (MMMU), олимпиадная математика (AIME) — везде модели достигли или подошли вплотную к человеческому уровню.

Формулировка авторов отчёта здесь важнее самих цифр: тесты, рассчитанные на годы, насыщаются за месяцы. Окно, в котором бенчмарк вообще способен что-то различать, схлопывается. Мы вернёмся к этому в секции про качество самой линейки — это не техническая деталь: часть зубцов и впадин на карте нарисована именно инструментом измерения, и дальше разберём, какая именно.

Лидеры стоят вплотную

Ещё год назад разрыв между американскими и китайскими моделями был содержательной темой. В феврале 2025-го DeepSeek-R1 ненадолго сравнялась с лучшей американской моделью, и с тех пор лидерство переходило из рук в руки несколько раз. На март 2026 года лучшая модель США впереди на 2,7%, и весь год разрыв держался в пределах однозначных чисел.

А вот со вторым сближением, открытых моделей с закрытыми, всё интереснее — и тут отчёт снова спорит сам с собой. Открытые веса — это когда файлы модели выложены в свободный доступ и запустить её у себя может кто угодно: так устроены Llama, DeepSeek, Qwen, GLM. Закрытые доступны только через API вендора.

Письмо сопредседателей в начале отчёта утверждает: открытые модели конкурентоспособны как никогда. Но во второй главе приведена динамика разрыва на Arena, и она другая. В мае 2023-го лучшая закрытая модель опережала лучшую открытую на 174 очка рейтинга — 15,2%. К августу 2024-го разрыв схлопнулся до 7 очков, то есть до 0,5%: открытые почти догнали. А дальше вышли новые закрытые флагманы, и на март 2026 года Claude Opus 4.6 с 1503 очками опережает лучшую открытую GLM-5 с 1454 на 49 очков — 3,4%.

То есть разрыв сейчас в семь раз шире, чем был полтора года назад. Формулировка «конкурентоспособны как никогда» верна, если сравнивать с 2023 годом, и неверна, если сравнивать с 2024-м. Открытые модели действительно стали намного сильнее — но догоняющими они быть не перестали. В топ-10 Arena шесть моделей из десяти закрытые.

Практический вывод всё равно один, и держится он на обоих числах сразу — 2,7% между лидерами США и Китая, 3,4% между лучшей закрытой и лучшей открытой: ставка на конкретного вендора стала дешевле, чем кажется. Если завтра твой провайдер поднимет цену или закроет доступ, замена найдётся в пределах нескольких процентов качества. Это довод в пользу того, чтобы строить свои процессы поверх сменяемых моделей, а не вокруг одной.

Впадины: где ломается стабильно

Теперь про другую сторону рельефа. Важно, что это не «пока не дотянули, скоро закроют» — это места, где модели проваливаются системно. У большинства впадин причина в устройстве задачи, а не в возрасте модели — но есть и третья ось, где всё решает как раз выбор модели, и до неё мы дойдём в конце секции.

Часы

С них началась статья, разберём подробнее. На бенчмарке ClockBench лучшая модель читает аналоговые часы правильно в 50,6% случаев, человек на корректно оформленном циферблате — в 90,1%. Забавная деталь: в сводке главных выводов того же отчёта стоит цифра 50,1% — Stanford сам себе противоречит на полпроцента. Не то чтобы это меняло вывод, но хорошо иллюстрирует, насколько аккуратно стоит относиться к любой отдельно взятой цифре, даже из хорошего источника.

Есть и третье число. Отдельное исследование на другом наборе данных (ClockQA, 62 изображения циферблатов в шести визуальных стилях) дало лучшей на тот момент модели 22,6% точных попаданий. Три разных числа — 50,6%, 50,1%, 22,6% — про одну и ту же способность. Разные бенчмарки, разные модели, разные даты. Это ровно та ситуация, в которой заголовок «AI не умеет определять время» технически верен при любом из трёх значений и не сообщает ничего полезного.

Полезное в отчёте есть, но не в проценте, а в характере ошибок. Когда человек ошибается со временем, он промахивается в среднем на три минуты. Когда ошибается модель — медианный промах от одного до трёх часов. Это разные виды неправоты: человек не туда посмотрел, модель не поняла картинку.

Почему часы вообще ломаются, объясняют сами исследователи: задача склеивает визуальное восприятие с арифметикой. Надо найти стрелки, определить их положение, перевести углы в часы и минуты. Ошибка на первом шаге тихо перетекает во второй и третий — и ответ разваливается целиком. На календарных вопросах того же исследования лучший результат заметно выше: GPT-o1 берёт 80%. Но и там модели спотыкаются ровно тогда, когда вместо узнавания известного праздника нужно посчитать дату — то есть когда появляется та же арифметическая ступенька.

Запомни этот механизм: длинная цепочка шагов без обратной связи — главный производитель впадин. Он вылезет ещё дважды — в секции про агентов и в правилах работы.

Физический мир

Дальше про роботов — там перепад виден нагляднее всего.

На бенчмарке RLBench — восемнадцать коротких манипуляций в вылизанной программной среде — роботы достигли 89,4% успеха. Почти решённая задача.

На BEHAVIOR-1K — наборе из тысячи бытовых задач, составленном по опросам живых людей о том, чего они хотят от домашнего робота, — лучшая команда взяла 12,4% полного успеха. Даже по мягкой метрике, где засчитывают частично выполненные цели, вышло около 26%. Важно: это тоже симуляция, просто симулированная квартира вместо лабораторного стола.

89,4% и 12,4% — разница в семь раз, и обе цифры получены в симуляторе. Значит, дело не в переезде из симуляции в железо: дело в длине задачи и предсказуемости обстановки. Восемнадцать коротких движений на пустом столе против длинного бытового сценария, где надо перемещаться по квартире, держать в голове цель и справляться с тем, что кружка стоит не там, где вчера. В настоящей квартире к этому добавится ещё и физика — то есть числа будут хуже, а не лучше.

КОРОТКОЕ ПРОТИВ ДЛИННОГО · СТР. 116–117

Стол против квартиры: разница в семь раз

Манипуляция предметами у роботов: короткие задачи в контролируемой среде против длинных бытовых сценариев

  • Короткая задача, предсказуемая обстановка
  • Длинный бытовой сценарий

Доля успешно выполненных задач

Стол, 18 задач, RLBench
89,4%
Квартира, частичный зачёт целей
26,0%
Квартира, полный успех, BEHAVIOR-1K
12,4%

Обе среды — симуляция. Задачи BEHAVIOR-1K составлены по опросам живых людей о том, чего они хотят от домашнего робота.

Тот же перепад ждёт любой процесс, который переезжает из демо в живую работу

Это не только про роботов. Это общая форма: чем менее предсказуема среда, тем глубже впадина. Твой рабочий процесс — тоже среда, и вопрос «насколько у меня предсказуемо» напрямую переводится в вопрос «где здесь можно доверять модели».

Галлюцинации: разброс в четыре раза

Из главы про ответственный AI в работу берётся одна цифра. Бенчмарк AA-Omniscience проверяет фактическую надёжность на 6000 вопросах в шести доменах — от права и медицины до разработки и математики. Устроен он умно: правильный ответ приносит очки, неправильный их отнимает, а отказ отвечать не штрафуется. То есть бенчмарк поощряет модель признать, что она не знает.

Результат по 26 моделям: частота галлюцинаций разошлась от 22% до 94%.

Внизу, то есть лучше всех: Grok 4.20 Beta — 22%, Claude 4.5 Haiku — 26%, MiMo-V2-Pro — 30%. Вверху: gpt-oss-20B в режиме high — 94%, Gemini 3 Flash — 92%.

ФАКТИЧЕСКАЯ НАДЁЖНОСТЬ · СТР. 136

Частота галлюцинаций: разброс в четыре раза

Бенчмарк AA-Omniscience, 6000 вопросов в шести доменах, 26 моделей. Меньше — лучше.

  • Реже врёт
  • Чаще врёт

Доля ответов, содержащих выдумку

Grok 4.20 Beta
22%
Claude 4.5 Haiku
26%
MiMo-V2-Pro
30%
Gemini 3 Flash
92%
gpt-oss-20B, режим high
94%

Показаны три лучшие и две худшие модели из 26 замеренных

Модели в списке отсортированы по надёжности, а не по цене или размеру — и эти два порядка между собой не совпадают

Посмотри на состав списка. В тройке лучших — Claude 4.5 Haiku, младшая и самая дешёвая модель своей линейки. В худших — gpt-oss-20B, тоже маленькая и дешёвая, и Gemini 3 Flash, тоже быстрая и недорогая. То есть цена и размер не работают ни в одну сторону: из прайс-листа фактическая надёжность не выводится вообще. Это отдельная ось рельефа, и мерить её надо отдельно.

Практический вывод простой: если задача про факты, а не про текст, модель надо выбирать не по общему рейтингу, а по замерам галлюцинаций — и всё равно проверять источники.

Почему карте нельзя верить

До сих пор мы считали, что карта верна, и обсуждали её рельеф. Теперь про саму карту — и это самая неприятная часть отчёта.

Часть зубчатости реальна: модель действительно не умеет читать часы, и никакая методика измерения этого не создаёт. Но другая часть зубцов и впадин — артефакт того, чем мы меряем. Причём отделить одно от другого сейчас трудно, и Stanford говорит об этом прямым текстом.

Тесты насыщаются быстрее, чем их успевают придумывать

Мы уже видели: Humanity’s Last Exam — экзамен, специально построенный так, чтобы быть трудным для AI, — сдал 30 процентных пунктов за год. Формулировка авторов: испытания, рассчитанные на годы, насыщаются за месяцы.

Насыщение — это когда все модели набирают на тесте так много, что он перестаёт их различать. Условно: разница между 96% и 97% ничего не говорит о разнице в способностях — она в пределах шума и качества самих вопросов. А раз тест перестал различать, приходится делать новый — и цикл повторяется.

Сколько вопросов в бенчмарках сломано — и что на самом деле померили

Здесь придётся быть особенно аккуратным, и сейчас станет понятно почему.

Стэнфордские исследователи занялись невалидными вопросами в бенчмарках. Невалидный вопрос — это некорректно поставленный, с неправильным эталонным ответом или допускающий несколько верных. Авторы построили метод, который по статистике ответов моделей вылавливает подозрительные вопросы и отправляет их на экспертную проверку.

AI Index описывает результат так: обзор «определил долю невалидных вопросов в девяти широко используемых бенчмарках, с разбросом ошибок от 2% на MMLU Math до 42% на GSM8K».

Прочитанное буквально, это значит, что почти половина одного из самых цитируемых тестов на математические рассуждения сломана. Именно так эту цифру и разносят по пересказам.

Но у графика, на который ссылается эта фраза, вертикальная ось подписана Precision@50. А это совсем другая величина. Метод отбирает 50 самых подозрительных вопросов теста, эксперты их проверяют, и Precision@50 — доля тех, кто оказался действительно бракованным. То есть 42% читается как «из 50 самых подозрительных вопросов GSM8K брак подтвердился у 42%», а не «42% GSM8K — брак».

Разница огромная. В первом прочтении сломана почти половина теста. Во втором — мы знаем только, что детектор, нацеленный на самое подозрительное, в GSM8K попадает в цель почти в половине случаев, а в MMLU Math — в одном случае из пятидесяти.

КАЧЕСТВО ЛИНЕЙКИ · РИС. 2.1.5, СТР. 79

Где детектор находит больше всего брака

Precision@50 по девяти бенчмаркам: какая доля из 50 самых подозрительных вопросов теста подтвердилась экспертами как невалидная

  • Детектор почти не находит брака
  • Детектор находит брак постоянно

Precision@50, доля подтверждённого брака

MMLU Math
2%
OpenBookQA
2%
MMLU Clinical
6%
MMLU Medical
6%
AIR-Bench
9%
MedQA
23%
ThaiExam
26%
MMLU 5Sub
31%
GSM8K
42%

Шкала растянута до максимума 42%, а самые короткие столбцы упираются в минимальную ширину — иначе нижние значения были бы неразличимы

Проза отчёта называет эти числа «долей невалидных вопросов» в бенчмарках. Ось графика говорит другое — Precision@50. Второе прочтение скромнее первого, и именно оно верное.

Так что же на самом деле известно? Известно, что качество вопросов между бенчмарками различается радикально: там, где в MMLU Math детектор почти не находит брака, в GSM8K он подтверждается почти в половине проверок. Сам метод авторы довели до точности 84%. Что доля брака во всём GSM8K тоже высока — правдоподобно, но этим графиком не доказано.

И вот главный вывод, ради которого стоило разбираться. Мы только что видели, как независимый, тщательный, некоммерческий отчёт описал собственный график шире, чем тот показывает. Без злого умысла — просто одной неточной фразой в подписи.

Теперь представь, что происходит с числом, которое прошло через пресс-релиз лаборатории, заголовок издания и три пересказа в телеграм-каналах.

Это не повод не верить данным. Это повод всегда смотреть, что написано на оси.

Лидерборды меряют в том числе умение играть в лидерборды

Отдельная работа показывает: положение модели в рейтинге Arena может частично отражать не общую способность, а адаптацию к самой площадке — к тому, какие вопросы там задают и какие ответы нравятся голосующим.

Плюс контаминация: если тестовые данные попали в обучающую выборку, балл вырастет без всякого роста способностей. В 2025-м Meta критиковали за то, что Llama 4 могла оптимизироваться под лидерборд и обучаться на тестовых данных; компания обвинения оспаривает. Некоторые бенчмарки защищаются от этого — MathArena, например, гоняет модели сразу после реальных соревнований, пока задачи физически не могли попасть в обучение.

Чем сильнее модель, тем меньше о ней известно

Замыкает картину то, что фронтирные лаборатории раскрывают всё меньше: ни архитектуры, ни размеров, ни составов данных. Отчёт отмечает, что самые способные модели сегодня — среди наименее прозрачных, а нестандартные техники промптинга делают сравнение моделей между собой ненадёжным.

И финальный гвоздь: независимые проверки фиксируют случаи, когда модель показывает результат хуже, чем заявил разработчик.

Сложи всё вместе. Тесты насыщаются за месяцы. Качество вопросов в них проверяют редко, а там, где проверяли, детектор брака в одних тестах почти ничего не находит, а в других попадает в цель почти в половине проверок — то есть тесты между собой несопоставимы по качеству. Рейтинги частично меряют адаптацию к рейтингу. Данные могли протечь в обучение. Разработчики раскрывают всё меньше, а их собственные цифры не всегда воспроизводятся.

Вывод не «всё враньё» — данные по-прежнему показывают направление, и направление это вверх. Вывод другой: точную форму рельефа мы не знаем, потому что линейка кривая. Единственный надёжный замер — на твоих собственных задачах.

К слову, отчёт приходит ровно к этому же и предлагает лекарство: centaur evaluations — оценивать не модель в вакууме, а связку «человек + модель», потому что в реальности человек надзирает, направляет и правит. Большинство существующих бенчмарков тестируют AI в изоляции — то есть меряют сценарий, которого в твоей работе не существует.

Агенты: главный зубец и главная впадина

Здесь сразу и самый резкий рывок года, и самый большой разрыв между бенчмарком и реальностью.

OSWorld проверяет агентов на настоящих компьютерных задачах в настоящих операционных системах — Ubuntu, Windows, macOS. В наборе 369 заданий: работа с приложениями и веб-интерфейсами, операции с файлами, сценарии, где надо переключаться между несколькими программами. Студенты-компьютерщики решают около 72% этих задач, тратя в среднем по паре минут на каждую.

Модели на этом бенчмарке долго стояли: исторически лучшие из них брали от 1% до 12%. А сейчас Claude Opus 4.5 показывает 66,3% — это в шести процентных пунктах от человеческого уровня в 72,35%. Отчёт называет OSWorld бенчмарком, где разрыв между моделями и человеком сократился быстрее всего.

Рост в пять с лишним раз. По любым меркам прорыв, и именно он стоит за тем, что 2025-й называют годом, когда агенты научились не отвечать, а делать.

Рядом стоит второй замер, ещё более выразительный. WebArena проверяет агентов на 812 длинных веб-задачах, причём засчитывает не последовательность действий, а фактический результат — что реально изменилось на сайте, в базе, в содержимом страницы. Здесь успех вырос примерно с 15% в 2023 году до 74,3% к началу 2026-го, вплотную к человеческому уровню 78,2%. Из всех агентских бенчмарков отчёта у WebArena самый маленький остаточный разрыв.

А теперь та же цифра с другой стороны. 66% успеха означает, что агент проваливает примерно каждую третью попытку — и отчёт формулирует это именно так, для структурированных бенчмарков в целом.

Здесь может возникнуть законное возражение: человек-то на том же наборе берёт 72%, то есть проваливает почти каждую четвёртую. Чем тогда 66% принципиально хуже?

Тем, как устроен провал. Человеческие 72% замерены при том, что человек видит промежуточный результат: заметил, что открылось не то окно, — вернулся и переделал. Его провал — это «не смог», а не «не заметил». Агент идёт вслепую: он не отличает состояние «получилось» от состояния «кажется, получилось», и уверенно передаёт сломанный результат на следующий шаг. Поэтому 66% против 72% — это не аргумент «почти догнали». Это аргумент за то, чтобы поставить между звеньями проверку, которой у агента нет своей.

Для демо один провал из трёх — прекрасно. Для процесса, который работает без присмотра, — катастрофа, и вот почему.

Настоящие задачи редко состоят из одного шага. Если агент выполняет цепочку из пяти шагов и на каждом ошибается независимо с той же вероятностью, то вся цепочка проходит целиком примерно в 13% случаев. Это грубая арифметика — в жизни шаги не независимы, где-то агент себя поправит, где-то ошибка на первом шаге гарантированно убьёт остальные, — но порядок величины она передаёт верно. Надёжность цепочки падает быстрее, чем растёт надёжность шага.

АРИФМЕТИКА ЦЕПОЧКИ · РАСЧЁТ ПО ДАННЫМ СТР. 113

Почему 66% за шаг — это мало

Вероятность пройти всю цепочку целиком, если на каждом шаге агент справляется с вероятностью 66,3%, как на OSWorld

  • Приемлемо под присмотром
  • Лотерея без присмотра

Шанс, что вся цепочка отработает без ошибки

1 шаг
66,3%
2 шага
44,0%
3 шага
29,1%
4 шага
19,3%
5 шагов
12,8%

Это моя арифметика, а не замер из отчёта: она предполагает, что шаги независимы

Отсюда и правило: резать цепочки и ставить проверку между звеньями

Ровно тот же механизм, что ломал модели на аналоговых часах: длинная цепочка без обратной связи.

И тут отчёт даёт цифру, которая объясняет разрыв между хайпом и твоим личным опытом. Внедрение AI-агентов остаётся на уровне единиц процентов почти во всех бизнес-функциях. Не десятков — единиц. При том, что 88% организаций сообщают, что используют AI хотя бы в одной функции.

Про цифру «88% организаций внедрили AI». Она ходит по всем пересказам, и её стоит понимать правильно. Это доля опрошенных организаций, ответивших, что используют AI хотя бы в одной бизнес-функции (было 78% в 2024-м). Данные из ежегодного опроса McKinsey, и сам AI Index помечает такие числа как self-reported и «directional rather than comprehensive» — то есть показывающие направление, а не точную картину. Никто не проверял, что там внедрено и работает ли оно.

То есть AI внедрён почти везде, а агенты — почти нигде. Разница между «модель помогает человеку» и «агент делает сам» на практике оказалась гораздо больше, чем в презентациях. Причина как раз в той трети проваленных попыток: чтобы отдать процесс агенту целиком, надо либо смириться с провалом каждой третьей попытки, либо построить вокруг него проверку — а это уже инженерия, а не подписка.

Практический вывод, который прямо следует из чисел: агенту стоит отдавать короткие цепочки с быстрой проверкой результата, а не длинные автономные процессы. Пять шагов без присмотра — это лотерея. Пять шагов, где после каждого есть дешёвый способ понять, что всё пошло не так, — это рабочий инструмент.

Где зубцы уже режут: деньги и найм

Пока что мы говорили про способности. Теперь про то, как форма рельефа проступает в деньгах и в найме — потому что она проступает там почти буквально.

Продуктивность растёт ровно на зубцах

В сводке главных выводов отчёта стоит диапазон от 14% до 26%: столько прибавляют поддержка клиентов и разработка ПО. Это большие числа — четверть производительности не находят на дороге.

В самой главе про рынок труда таблица шире, и она интереснее сводки (стр. 220). Операторы поддержки с диалоговым ассистентом закрывают на 14–15% больше обращений в час. Разработчики с GitHub Copilot — на 26% больше pull request’ов. Маркетинговые команды на генерации креативов — плюс 50% выпуска на человека. Бухгалтеры — плюс 55% обработанных клиентов в неделю. Авторы текстов — плюс 200% по объёму выпущенного.

А теперь вторая половина той же таблицы, которую почти никогда не цитируют: эффект слабее или отрицательный в задачах, требующих суждения.

Отрицательный — то есть с AI получается хуже, чем без него. Самый известный пример из отчёта: METR замеряли опытных разработчиков открытого кода и получили минус 19% скорости с AI-ассистентом, причём сами разработчики были уверены, что ускорились. Тут нужна честность: повторить этот результат позже команда METR не смогла — к концу 2025-го разработчики уже с трудом соглашались работать без AI, и сама база сравнения уехала. Ещё одна строка той же таблицы: у инженеров, изучающих новую библиотеку, прирост скорости оказался статистическим нулём.

Посмотри теперь, что объединяет выигравших. Поддержка, код, креативы, проводки — это области с хорошо специфицированным результатом и быстрой обратной связью: тикет закрыт или нет, тесты прошли или нет, макет принят или нет. Ровно та форма задачи, на которой у моделей зубцы. А там, где надо взвесить неполные данные, учесть контекст и принять решение, за которое отвечаешь, — там впадина, и попытка залить её моделью даёт ноль или минус.

Отчёт формулирует это почти теми же словами: выигрыш сильнее всего там, где работу можно разложить на понятные повторяемые задачи с ясным критерием качества. Это и есть определение зубца, только на языке экономики труда.

Экономика просто повторяет рельеф.

ЭКОНОМИКА ПОВТОРЯЕТ РЕЛЬЕФ · СТР. 11, 220–221

Где AI прибавляет, где отнимает

Прирост продуктивности приходится ровно на задачи с проверяемым результатом, а там, где нужно суждение, эффект пропадает или уходит в минус

  • Зубец · результат проверяем
  • Впадина · нужно суждение

Поддержка клиентов и разработка

+14–26%

прирост продуктивности в сводке отчёта. Тикет закрыт или нет, тесты прошли или нет — обратная связь мгновенная.

Задачи, требующие суждения

слабее
или минус

формулировка отчёта. У опытных разработчиков в замере METR вышло минус 19% скорости.

Разработчики США 22–25 лет

−20%

занятости от пика 2022 года к сентябрю 2025, при том что численность разработчиков постарше растёт

Третья карточка — корреляция, а не доказанная причина. Разбор ниже.

Вход в профессию подорожал

Самая тревожная цифра отчёта. В США занятость разработчиков в возрасте 22–25 лет упала почти на 20%, при том что численность разработчиков постарше продолжает расти.

И снова придётся уточнить базу, потому что отчёт называет две разные. В главе про рынок труда написано: к сентябрю 2025-го занятость упала почти на 20% от пика 2022 года (стр. 221). А в сводке главных выводов та же цифра подана как падение относительно 2024-го (стр. 11). Это второе расхождение отчёта с самим собой, которое попалось мне при разборе, — после полупроцента на часах. Дальше я считаю базой 2022-й: так написано в главе, где приведены сами данные.

То есть отрасль не сжимается — сжимается вход в неё.

Здесь нужна честность, которую соблюдает и сам отчёт: это корреляция, а не доказанная причина. Совпало многое — ставки, посткарантинная коррекция найма, общее охлаждение рынка. Но совпадение слишком точное, чтобы его игнорировать: провал именно там, где измеренный прирост продуктивности от AI самый очевидный.

Механизм, если он действительно такой, логично ложится на всё сказанное выше. Junior-задачи — это самые специфицированные задачи в профессии: понятная постановка, проверяемый результат, короткая цепочка. То есть в точности зубец. Работа, которая была входным билетом, оказалась той самой, которую модель делает лучше всего.

Ещё одна цифра рядом: треть опрошенных организаций ожидает сокращения штата в ближайший год. И отдельно отчёт отмечает, что массовых увольнений пока не произошло — ожидания есть, обвала нет.

Ценность, которой не видно в отчётностях

Теперь хорошее, и оно про тебя лично, а не про корпорации.

Оценка потребительского излишка от генеративного AI в США — 172 миллиарда долларов в год к началу 2026-го против 112 миллиардов годом раньше. Рост на 54% за год. Медианная ценность на одного пользователя за тот же период утроилась: с 3,4 доллара в месяц до 11,4.

Потребительский излишек — это разница между тем, сколько человек готов был бы заплатить за инструмент, и тем, сколько платит на самом деле. Меряют его прямым вопросом: сколько тебе надо доплатить, чтобы ты на месяц отказался от всех генеративных AI-инструментов. В исследовании, на которое ссылается отчёт, так опросили 1400 человек в 2025-м и 2000 в начале 2026-го.

Ключевая деталь: большинство этих инструментов бесплатны или почти бесплатны. Эта ценность не проходит через выручку и потому не видна в стандартной экономической статистике. Она оседает прямо у людей.

Отсюда же и скорость распространения: генеративный AI дошёл в США до 53% взрослого населения за три года — быстрее, чем персональный компьютер, и быстрее, чем интернет.

Здесь легко споткнуться, поэтому оговорю явно: страновой рейтинг в том же отчёте считает совсем другую метрику и другой командой. По замеру Microsoft AI Economy Institute во втором полугодии 2025 года впереди ОАЭ с 64% и Сингапур с 60,9%, а США — на 24-м месте с 28,3%. Числа 53% и 28,3% не спорят друг с другом: это две разные линейки, приложенные к разным вопросам. Ровно тот случай, о котором вся эта статья.

Практически из этого следует вот что: доступ к тому же самому рельефу есть у всех и почти бесплатно. Преимущество больше не в доступе к моделям. Оно в том, знаешь ли ты форму рельефа на своём участке.

Как строить работу под зубчатую границу

Всё предыдущее сводится к нескольким правилам. Они не про «промпты, которые взорвут твою продуктивность» — они прямо выводятся из чисел выше.

1. Не спрашивай «умеет ли AI» — замеряй на своих задачах

Мы видели, почему: тесты насыщаются за месяцы, качество их вопросов местами сомнительно, рейтинги частично меряют адаптацию к рейтингу, а независимые проверки не всегда подтверждают заявленное. Публичный бенчмарк говорит о направлении отрасли и почти ничего — о твоей задаче.

Рабочая замена: собери себе десяток типичных задач с известным правильным ответом и прогоняй новые модели через них. Это займёт вечер один раз и будет полезнее любого лидерборда. По сути это и есть те самые centaur evaluations, к которым призывает отчёт, только в масштабе одного человека.

2. Режь длинные цепочки

Главный производитель провалов — цепочка шагов без обратной связи. Так ломались часы, так ломаются агенты, так ломаются роботы на длинном бытовом сценарии.

Значит, задача разработчика процесса — не сделать цепочку длиннее, а поставить дешёвую проверку между звеньями. Вопрос «как я узнаю, что модель ошиблась, до того как ошибка уедет дальше» важнее вопроса «какую модель взять».

3. Отдавай зубцы, держи впадины

Признаки зубца — там, где стоит отдавать: результат проверяем за секунды, постановка формулируется в тексте, ошибка обнаруживается сразу и стоит дёшево, задача массовая и хорошо представлена в обучающих данных.

Признаки впадины — там, где отдавать не стоит: нужно суждение и ответственность, задача завязана на физический мир или на точное пространственное восприятие, проверить результат дороже, чем сделать самому, цена ошибки высокая, а обнаруживается ошибка поздно.

Заметь, что это описание не зависит от того, какая модель вышла на прошлой неделе. Рельеф двигается, но форма его остаётся.

4. Фактическую надёжность проверяй отдельно от «ума»

Разброс частоты галлюцинаций между моделями — от 22% до 94%, и он не совпадает ни с рейтингами способностей, ни с ценой. Claude 4.5 Haiku, младшая модель линейки, врёт в 26% случаев; gpt-oss-20B, тоже маленькая и дешёвая, — в 94%.

Практически: если задача про факты, а не про форму текста, выбирай модель по замерам надёжности, требуй ссылки на источники и цени в модели готовность сказать «не знаю» — бенчмарк AA-Omniscience не зря устроен так, что отказ отвечать не штрафуется.

5. Не привязывайся к вендору

Лидеры стоят вплотную: 2,7% между лучшими моделями США и Китая, 3,4% между лучшей закрытой и лучшей открытой, 25 очков Elo между четырьмя топ-компаниями, считаные пункты между топ-15 моделями в профессиональных доменах.

Это значит, что смена провайдера стоит тебе нескольких процентов качества — а вот процессы, промпты и проверки, построенные вокруг одного вендора, стоят гораздо дороже. Держи их отдельно от модели.

6. Строй кентавра, а не автопилот

Мысль отчёта, которую почти нигде не процитировали: почти все бенчмарки тестируют AI в изоляции, хотя в реальности человек надзирает, направляет и правит. То есть отрасль меряет сценарий, которого в твоей работе нет.

Из этого следует, что искать надо не «задачи, которые AI сделает сам», а точки, где твоё вмешательство стоит дёшево, а его вклад велик. Один провал из трёх — приговор автопилоту, но совершенно рабочий режим для связки, где ты видишь промежуточный результат.

7. Двигайся туда, где нужно суждение

Это уже не про инструменты, а про карьеру, и следует из двух цифр рядом: прирост продуктивности там, где задача специфицирована, и падение занятости у тех, кто такие задачи выполнял.

Дефицитным становится не умение выполнить понятную задачу, а умение решить, какую задачу вообще стоит делать, и отвечать за результат. Ровно то, что отчёт называет впадиной, где эффект AI слабый или отрицательный.

Что с этим делать

Если сжать 425 страниц в одну мысль, получится вот что.

Способности AI выросли за год сильнее, чем ожидало большинство, — и одновременно инструменты, которыми мы эти способности меряем, стали хуже работать. Мы находимся в положении, когда карта отстаёт от местности, и это надолго.

В таком положении выигрывает не тот, у кого лучше модель — модели у всех одинаковые с точностью до нескольких процентов. Выигрывает тот, кто знает форму рельефа на своём участке: где отдать, где придержать, где поставить проверку.

А эта форма не выясняется чтением отчётов, включая этот разбор. Она выясняется только руками — десятком собственных задач, прогнанных через модель, и честным взглядом на то, что получилось.

Хорошая новость в том, что порог входа сюда низкий. Ты уже пользуешься теми же моделями, что и все остальные. Вопрос только в том, построишь ли ты вокруг них процесс — или продолжишь ждать следующую версию, которая всё решит сама.

Если хочешь не читать про AI, а построить вокруг него свой процесс — с Claude Code, агентами и контекстом — раз в месяц я беру 10 человек на поток. Первое, что мы делаем на старте, — собираем твой личный набор задач-замеров, тот самый из первого правила. Дальше — шесть уровней освоения AI и свой продукт к демо-дню.

Занять место

Источники

Все цифры в статье взяты из AI Index Report 2026; ключевые сопровождаются номерами страниц — в подписях к графикам и в тексте там, где это важно для проверки. Там, где отчёт ссылается на первоисточник, ссылка на первоисточник тоже есть — по ним можно проверить методику. Проценты приведены с той же точностью, что в тексте отчёта; подписи графиков в отчёте местами дают два знака после запятой. Отдельно отмечу: часть данных отчёта основана на опросах и помечена самими авторами как self-reported — такие места в тексте оговорены.

  1. The AI Index 2026 Annual Report — Stanford HAI (PDF, 425 стр.)

    Основной источник. Девятое издание, апрель 2026. Все цифры статьи — отсюда. Ключевые страницы: 9–11 (главные выводы), 71 и 75 (методика и сводка по технической производительности), 79 (качество вопросов в бенчмарках), 95 (Humanity’s Last Exam), 96 (часы), 100 (SWE-bench), 104 (олимпиада), 113 (агенты), 116–117 (роботы), 136 (галлюцинации), 192 (потребительский излишек), 201 (распространение по странам), 219–221 (продуктивность и занятость).

  2. Truong et al. (2025). Fantastic bugs and where to find them in AI benchmarks

    Тот самый обзор качества вопросов в девяти популярных бенчмарках. Важно: метрика на графике — Precision@50, доля подтверждённого брака среди 50 самых подозрительных вопросов теста (от 2% на MMLU Math до 42% на GSM8K), а не доля брака во всём тесте. Сам метод доведён до точности 84%.

  3. Singh et al. (2025). The Leaderboard Illusion

    Разбор того, почему положение в рейтинге Arena может отражать адаптацию к площадке, а не общую способность модели.

  4. Safar & Chichigin (2025). ClockBench: Visual time benchmark where humans beat the clock, LLMs don’t

    Бенчмарк, с которого взята цифра 50,6% против 90,1% у человека. Человеческий результат замерен на корректно оформленных циферблатах; отсюда же медианная ошибка — от часа до трёх у модели против трёх минут у человека.

  5. Saxena, Gema & Minervini (2025). Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs

    Второе исследование про часы, на другом наборе данных: 22,6% точных попаданий на циферблатах у лучшей на этом наборе Gemini-2.0 против 80% на календарных вопросах у лучшей там GPT-o1. Пример того, как два корректных бенчмарка дают разные числа про одну способность.

  6. Balunović et al. (2025). MathArena: Evaluating LLMs on uncontaminated math competitions

    Пример защиты от контаминации: модели прогоняют сразу после реальных соревнований, пока задачи физически не могли попасть в обучающие данные.

  7. Can we trust AI benchmarks? An interdisciplinary review of current issues in AI evaluation (2025)

    Обзорная работа о системных проблемах оценки AI — фон для секции про качество карты.