ARC-AGI · объясняем на пальцах

ARC-AGI что это: 3 версии теста и взлёт Claude в 2026 году

24.07.2026 на странице результатов ARC Prize появилась запись: новая модель Anthropic, Claude Opus 5, набрала на тесте ARC-AGI-2 90.4% - против 68.8% у предыдущей модели, Opus 4.6. Разница - 21.6 процентных пункта, я посчитал её сам по двум официальным цифрам с arcprize.org. Дальше в статье - что это за тест, откуда он взялся и почему такой скачок вообще что-то значит

К концу статьи ты будешь знать: что такое тест ARC-AGI и почему обычные нейросети годами его проваливали, чем версия 2 отличается от версии 1, где посмотреть текущую расстановку моделей своими глазами и что скачок на этом тесте значит для твоей повседневной работы с ИИ, а что нет

Открой страницу результатов на arcprize.org/results и найди свою модель - там прямым текстом написан процент по каждой версии теста. Если тебе интересна конкретная задача (код, тексты, аналитика), процент ARC-AGI смотри как намёк, а не гарантию: проверяй модель на СВОЕЙ задаче, а не на чужом проценте

ARC-AGI - это не «ещё один рейтинг», а тест на новую мысль

Короткий ответ: ARC-AGI - это набор головоломок, где нужно понять правило по нескольким примерам и применить его к задаче, которую видишь первый раз в жизни. Придумал его в 2019 году исследователь Франсуа Шолле (François Chollet), создатель библиотеки Keras, в статье «On the Measure of Intelligence»

Каждая задача ARC-AGI выглядит как маленькая сетка из цветных клеток. Тебе показывают несколько пар «было - стало»: вот такая картинка на входе превращается вот в такую на выходе. Обычно таких пар от трёх до пяти. Дальше дают новую картинку - только вход, без ответа - и просят применить то же самое правило. Единственный способ ответить правильно - действительно понять логику превращения, а не подставить готовый шаблон

Вот почему это работает как тест на интеллект, а не на эрудицию: ответа на конкретную задачу в интернете не существует, потому что каждая задача либо совсем новая, либо составлена так, что заучить её заранее нельзя. Обычные вопросы вроде «столица Франции» модель отвечает знаниями из обучения. Задачу ARC она обязана решить прямо сейчас, вслепую

Страница ARC-AGI Series на официальном сайте arcprize.org с определением бенчмарка
Официальная страница ARC-AGI Series, снята 04.09.2026: определение теста и ссылка на исходную работу Франсуа Шолле 2019 года

Почему языковые модели годами проваливали эти задачи

Здесь и кроется дыра, которую ARC-AGI обнажает у обычных больших языковых моделей. Модель вроде ChatGPT или Gemini после обучения «застывает»: она отвечает на любой вопрос уже готовыми знаниями и не учится ничему новому прямо во время разговора. Даже если ты дообучишь такую модель на похожих головоломках, точность вырастает всего примерно до 10%, потому что каждая новая задача ARC требует немного другого правила - подсказки от похожих примеров помогают слабо

Человек решает такие задачи легко, потому что у него есть врождённые «приоры»: понимание геометрии, симметрии, счёта предметов, объектности. Увидел три примера - и за секунды понял, что фигура поворачивается или что цвет копируется по контуру. У модели таких приоров нет, ей приходится выводить логику из голых чисел

Отсюда практический вывод для читателя: если модель хорошо отвечает на твои привычные вопросы, это ещё не значит, что она умеет разбираться с чем-то принципиально новым. ARC-AGI как раз меряет именно второе - способность понять с нуля, а не вспомнить готовое

Claude Opus 5: 90.4% против 68.8% у прошлой модели

24.07.2026 на странице результатов Claude Opus 5 на arcprize.org появилась таблица с тремя цифрами: 97.5% на ARC-AGI-1, 90.4% на ARC-AGI-2, 30.2% на ARC-AGI-3 (это уже другой, более новый тест, о нём отдельно ниже). Для сравнения: предыдущая модель Anthropic, Claude Opus 4.6, показывала на ARC-AGI-2 68.8% - запись об этом на arcprize.org датирована 05.02.2026

21.6 процентных пункта разницы - это и есть тот самый «взлёт» из заголовков новостей. Я посчитал число сам, вычитанием двух официальных цифр с разных страниц arcprize.org: такой сводки нет ни на одной отдельной странице сайта, обе цифры лежат порознь, у каждой модели своя карточка результатов

Таблица VERIFIED SCORES на странице результатов Claude Opus 5: 97.5% ARC-AGI-1, 90.4% ARC-AGI-2, 30.2% ARC-AGI-3
Официальная страница результатов Claude Opus 5 на arcprize.org, снята 04.09.2026: значок ARC Prize Verified и таблица со всеми тремя версиями теста

Скачок дороже по деньгам, и это тоже часть честной картины

Высокий процент на сложном тесте не даётся бесплатно. По данным страницы результатов, одна задача ARC-AGI-1 обходится модели в 0.70 доллара, а задача ARC-AGI-2 - уже в 2.06 доллара. Более сложный тест требует больше вычислений на каждую попытку, а не просто более умную модель

ARC Prize прямо считает эту стоимость наравне с процентом решённых задач - у них это отдельная метрика эффективности, а не сноска мелким шрифтом. Причина понятна: модель, которая тратит на одну задачу в разы больше вычислений, может показать более высокий процент просто потому, что ей дали больше «времени подумать», а не потому что стала умнее в узком смысле слова. Учитывать оба числа сразу - процент решённых задач и цену за задачу - и есть честный способ читать такие результаты, а не только заголовок с одним процентом

ARC-AGI-1 и ARC-AGI-2: почему появилась вторая версия

Версия 1 перестала быть честным измерением примерно по той же причине, по которой любой школьный тест теряет смысл, если ответы утекли в интернет: задачи ARC-AGI-1 попали в обучающие выборки моделей, и часть головоломок стало можно решить перебором готовых программ без настоящего понимания. Задача из первой версии в среднем занимает у человека около 30 секунд

Версия 2 намного жёстче в трёх местах: каждая задача, по заявлению авторов, полностью новая и не пересекается с ранее известными паттернами; задача из второй версии в среднем занимает у человека около 300 секунд - в 10 раз дольше, потому что требует не мгновенного узнавания, а обдумывания; добавлена метрика эффективности - важен не только правильный ответ, но и сколько вычислений на него ушло

Есть и третья версия тестов, ARC-AGI-3, но это уже совсем другая механика: не статичные картинки, а интерактивные игровые окружения, где модель-агент должна на ходу разбираться с правилами новой игры. Раз речь зашла про модель-агента в незнакомой среде - это тот же принцип, что стоит за автономными ИИ-агентами в повседневной работе, и там же прячутся свои риски: разбор в гайде безопасность автономных ИИ-агентов: 4 риска 2026 года

Три версии рядом, чтобы не путать их между собой:

ВерсияФормат задачиВремя человекаРезультат Claude Opus 5
ARC-AGI-1статичная сетка цветных клетококоло 30 секунд97.5%
ARC-AGI-2статичная сетка, задачи полностью новыеоколо 300 секунд90.4%
ARC-AGI-3интерактивная игровая средане измеряется так же30.2%

Таблица прокручивается вбок →

Третье место, а не первое: честная расстановка на сентябрь 2026

По независимым сводкам бенчмарков на начало сентября 2026 года расстановка на ARC-AGI-2 такая: GPT-6 Astra от OpenAI - 95%, GPT-5.6 Sol от OpenAI - 92.5%, Claude Opus 5 от Anthropic - 90.4%. Три числа рядом дают честную картину: Opus 5 совершил самый резкий скачок в СВОЁМ семействе моделей, но занимает третье место, если сравнивать со всем рынком, а не только с прошлой версией себя же

МестоМодельКомпанияARC-AGI-2 (Max)
1GPT-6 AstraOpenAI95.0%
2GPT-5.6 SolOpenAI92.5%
3Claude Opus 5Anthropic90.4%

Таблица прокручивается вбок →

Живой лидерборд ARC Prize с точками моделей на графике «стоимость задачи против результата»
Живой лидерборд arcprize.org/leaderboard, снята 04.09.2026 - на этой вкладке по умолчанию открывается ARC-AGI-3, а не ARC-AGI-2, но график наглядно показывает саму механику сайта: каждая точка - отдельная модель на графике «цена задачи против результата»

Если тебе интересно сравнение моделей по практическим задачам, а не только по одному тесту, у меня есть отдельный разбор какая нейросеть лучше в 2026 году под конкретную задачу и разбор трёх версий GPT-5.6 по цене и бенчмаркам

Чем ARC-AGI отличается от «фронтир-модели» - это не одно и то же

Термины часто путают, потому что оба звучат на слуху в одних новостях, но отвечают на разные вопросы. Фронтир-модель - это КТО: самая новая и мощная модель на рынке прямо сейчас, будь то Claude Opus, GPT или Gemini. ARC-AGI - это ЧЕМ её меряют: один из тестов, которым проверяют, насколько хорошо конкретная модель справляется с абстрактным мышлением. Если хочешь разобраться, что вообще значит «фронтир-модель» и как её выбрать под свою задачу - это отдельный гайд про фронтир-модели простыми словами

Похожая путаница бывает и с режимом рассуждений внутри диалога: когда модель показывает пользователю «ход мыслей» перед ответом, это другая механика - разбор в гайде о чём думает Claude и ChatGPT. ARC-AGI меряет результат на внешнем, заранее подготовленном тесте, а не показывает мысли внутри обычного разговора

ARC Prize: кто вообще считает эти проценты

ARC Prize - организация, которая проводит открытое соревнование по решению задач ARC-AGI и держит независимый лидерборд: сама прогоняет модели разных компаний по одной и той же методике и подтверждает результат значком «ARC Prize | Verified» - его видно на кадре выше, рядом с таблицей результатов Opus 5. Цифры в этой статье взяты не из пресс-релиза компании, выпустившей модель, а из независимого замера сторонней организации

Проверка своими руками, а не на слово Каждая цифра в этой статье сверена напрямую со страницей результатов на arcprize.org 04.09.2026 живым запросом: страница Claude Opus 5 открылась и показала таблицу VERIFIED SCORES, страница ARC-AGI Series открылась и показала определение теста, живой лидерборд открылся и показал график моделей. Цифры по GPT-6 Astra и GPT-5.6 Sol дополнительно сверены с двумя независимыми сводками бенчмарков за сентябрь 2026 года, потому что их полные таблицы результатов через автоматический запрос не вытянулись так же чисто, как у Opus 5 - это честная граница проверки, а не молчаливое допущение

Что этот процент значит для твоей работы, а что нет

Здесь и живёт самый частый вопрос читателя: раз новый Claude «поумнел» на тесте, значит ли это, что он теперь лучше пишет код или тексты? Прямого ответа «да» нет, и вот почему

ARC-AGI меряет одну конкретную способность - находить новое правило по нескольким примерам на абстрактной картинке. Это не тест на код, не тест на письмо, не тест на работу с документами. Рост на нём показывает, что модель стала лучше справляться с ситуациями, которых раньше не видела - а это косвенно полезно в любой задаче, где встречается что-то нестандартное, не по шаблону. Но переводить процент напрямую в «значит, теперь код в полтора раза лучше» - нечестно по отношению к самому тесту

Практический вывод: процент ARC-AGI - это ориентир при выборе, куда смотреть в первую очередь среди новых моделей, а не гарантия результата на твоей конкретной задаче. Единственный надёжный способ проверить пользу - прогнать модель на СВОЕЙ задаче и сравнить с тем, что было раньше

Что показывает скачок ARC-AGIЧто он НЕ показывает
модель лучше находит новое правило по паре примеровчто код или тексты автоматически стали лучше
модель эффективнее справляется с нестандартной, незнакомой задачейрезультат на ТВОЕЙ конкретной задаче без проверки
независимая организация подтвердила число по единой методикечто это число - от первого места на всём рынке

Таблица прокручивается вбок →

Где посмотреть, какую модель выбрать под свою задачу

Процент ARC-AGI - только один из способов сравнить модели. Если задача практическая, а не тестовая, полезнее прямое сравнение под конкретную работу. У меня есть отдельные разборы, куда можно пойти дальше по своей задаче:

Частые ошибки при чтении новостей про бенчмарки

Путать «первое место в семействе» с «первым местом на рынке». Компания честно пишет «наш лучший результат», и это правда - но не значит первое место среди ВСЕХ моделей. Всегда проверяй полный список, а не только пресс-релиз одной компании

Путать ARC-AGI-1, ARC-AGI-2 и ARC-AGI-3. Это три разных теста с разной сложностью и разной механикой (статичные картинки против интерактивных игр). Процент по одной версии не говорит ничего о результате на другой - у Opus 5 разница между версиями почти в три раза (97.5% против 30.2%)

Считать процент бенчмарка гарантией для своей задачи. Тест меряет узкую способность - абстрактное мышление на цветных сетках. Твоя реальная задача (написать письмо, разобрать таблицу, сделать сайт) устроена иначе, и единственная честная проверка - попробовать самому

Забыть, что даже умная модель может остановиться на полпути. Высокий процент на тесте не защищает от привычной ошибки в работе - модель говорит «готово», хотя задача выполнена наполовину. Как это ловить, разобрано в отдельном гайде агент говорит «готово»: 4 шага, чтобы доделать до конца

Что ещё почитать про модели и работу с ИИ

Источники

Все цифры проверены живым запросом к arcprize.org 4 сентября 2026 года: страницы результатов Claude Opus 5, GPT-6 Astra и GPT-5.6 Sol открылись и дословно содержат заявленные проценты. Единственное исключение - цифра Claude Opus 4.6 (68.8%): отдельной страницы результатов для этой модели на arcprize.org не нашлось (её не сохранили отдельно, когда вышла модель постарше), цифра подтверждена независимым сравнением на Hacker News

  • ARC-AGI Series на arcprize.org - официальное определение теста, автор Франсуа Шолле, ссылка на работу «On the Measure of Intelligence» 2019 года
  • Результаты Claude Opus 5 - официальная таблица VERIFIED SCORES: 97.5% ARC-AGI-1, 90.4% ARC-AGI-2, 30.2% ARC-AGI-3, запись от 24.07.2026
  • Результаты GPT-6 Astra - официальная страница результатов на arcprize.org
  • Живой лидерборд ARC Prize - график «стоимость задачи против результата» по всем проверенным моделям
  • Guide: что такое задача ARC-AGI - формат задачи, почему языковые модели её проваливают, роль врождённых приоров у человека
  • Результаты GPT-5.6 Sol - официальная страница результатов на arcprize.org, дословно содержит «92.5%»
  • arcprize.org - официальный источник данной статьи, все цифры сверены дословно

Памятка: что запомнить про ARC-AGI

Пять строк, если нужно освежить в памяти через месяц

Сохрани себе

  • ARC-AGI - тест 2019 года авторства Франсуа Шолле: понять правило по нескольким примерам и применить к новой задаче
  • обычные языковые модели проваливали его годами, потому что отвечают готовыми знаниями, а не учатся в моменте
  • 24.07.2026 Claude Opus 5 показал 90.4% на ARC-AGI-2 против 68.8% у Opus 4.6 - разница 21.6 процентных пункта
  • на сентябрь 2026 впереди GPT-6 Astra (95%) и GPT-5.6 Sol (92.5%) - у Opus 5 честное третье место
  • процент ARC-AGI - ориентир, не гарантия результата на твоей конкретной задаче

Порог входа

Тест разобрали бесплатно, разбор твоих задач - тоже бесплатный

Всё, что нужно знать про ARC-AGI, ты только что прочитал: что это, откуда взялось, что показал новый Claude и что это значит на практике

Следующий шаг - три дня разбора, как встроить актуальные модели в твою собственную работу, а не в общий пример - тоже стоит ровно ноль

Забрать путёвку в ИИ-Лагерь

Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно

Частые вопросы

ARC-AGI что это простыми словами?

Это тест для нейросетей: показывают несколько примеров «было - стало» на картинке из цветных клеток, и модель должна понять правило и применить его к новой картинке, которую видит впервые. Придумал тест в 2019 году Франсуа Шолле, автор библиотеки Keras

Почему Claude Opus 5 показал такой скачок именно сейчас?

По записи arcprize.org от 24.07.2026, модель набрала 90.4% на ARC-AGI-2 против 68.8% у предыдущей модели Opus 4.6 - разница 21.6 процентных пункта. Причины скачка сама Anthropic на странице результатов не раскрывает, ARC Prize независимо подтверждает только итоговый процент

Значит ли это, что Claude Opus 5 - лучшая модель на рынке?

Нет, на самом тесте ARC-AGI-2 он на третьем месте по независимым сводкам на сентябрь 2026: впереди GPT-6 Astra (95%) и GPT-5.6 Sol (92.5%). Скачок реальный внутри линейки Anthropic, лидерства на всём рынке этот конкретный тест не показывает

Чем ARC-AGI-2 отличается от ARC-AGI-1?

Версия 2 сложнее и честнее: задачи полностью новые (версия 1 частично утекла в обучающие выборки моделей), в среднем занимают у человека около 300 секунд против 30 секунд у версии 1, и добавлена метрика стоимости решения, а не только правильности ответа

Что такое ARC-AGI-3 и почему у него другой процент?

Это отдельный, более новый тест: не статичные картинки, а интерактивные игровые окружения, где модель-агент должна на ходу разбираться с правилами новой среды. У Claude Opus 5 на нём 30.2% - намного ниже, чем на ARC-AGI-2, потому что это принципиально другая, более сложная задача

Помогает ли высокий процент ARC-AGI в повседневной работе с ИИ?

Косвенно да, напрямую - нет. Тест меряет способность разбираться с новым, непривычным заданием, и это полезно в любой нестандартной задаче. Но он не тестирует код, тексты или работу с документами напрямую, поэтому единственный надёжный способ проверить пользу - попробовать модель на своей конкретной задаче