GPT-6 Astra набрала 99,9% на ARC-AGI-3. Самое интересное скрыто под графиком

99,9% в тесте на освоение новых задач. Почти 98% в сложной математике. GPT-6 Astra даёт повод снова удивиться ИИ. Можно ли теперь поручить ИИ отчёт для клиента и сократить время ручных исправлений? Разбираем рекорд и его условия.

Сначала посмотрите на два числа: 7,8% и 99,9%. Так OpenAI сравнивает два поколения моделей на ARC-AGI-3. Новая GPT-6 Astra почти упёрлась в верхнюю границу шкалы, но рекорд получен с особым адаптером запуска. Хочется немедленно отправить этот график другу с подписью «Ну всё, приехали».

А теперь представьте более приземлённую сцену. Вы поручили ИИ подготовить отчёт, ушли на встречу и вернулись к файлу, который можно отправлять руководителю. Или вернулись к красивой таблице с неверными выводами. Для вашего рабочего дня разница между этими исходами важнее любой надписи AGI.

Поэтому разберём главный скачок Astra, посмотрим на оригинальные графики и доберёмся до вопроса, ради которого стоит читать дальше: какую работу после этого релиза разумно попробовать поручить ИИ целиком?

График, который хочется переслать: с 7,8% до 99,9%

В сравнении OpenAI результат GPT-6 Astra на ARC-AGI-3 составляет 99,9%, GPT-5.6 Sol набирает 7,8%, Claude Opus 5 получает 30,2%. Здесь и находится самый громкий повод обсуждать релиз.

ARC-AGI-3: сравнение OpenAI; Astra использует особую конфигурацию запуска
ARC-AGI-3: сравнение OpenAI; Astra использует особую конфигурацию запуска. Источник: OpenAI.

У этого сравнения есть условие, которое меняет картину. OpenAI использует для Astra специальную конфигурацию Responses API; по оценке компании, Sol с такой конфигурацией получила бы около 30%. Это оценка OpenAI, а не показанные на графике 7,8%.

У авторов теста на наборе Semi-Private одна Astra показывает два лучших результата: 62,71% при стандартном запуске с уровнем max и 99,95% с Provider Adapter при high. В кратком изложении ARC Prize второй результат обозначен как 99,9%. Следовательно, по первой паре столбцов нельзя измерить чистый прирост самой модели при одинаковых условиях.

Между показанными баллами 92,1 процентного пункта. Это разница результатов двух конфигураций; измерить по ней, во сколько раз ИИ стал умнее, нельзя.

Более содержательный вопрос: почему у одной и той же Astra такая разница между режимами? В разборе ARC Prize объясняется: стандартная среда переносит выбранные моделью видимые заметки, а Provider Adapter сохраняет скрытое состояние рассуждений между запросами и управляет длинным контекстом. На одинаковом уровне high результаты составляют 54,82% и 99,95%. Программная среда вокруг модели здесь влияет на итог достаточно сильно, чтобы стать частью главной новости.

Astra почти исчерпала шкалу конкретного сложного теста. Но рекорд принадлежит работающей связке модели и программной среды. Для тех, кто собирает продукты с ИИ, это самостоятельная большая новость.

Почему 99,9% не означает «AGI готов на 99,9%»

Буквы AGI в названии способны превратить график в сенсацию ещё до того, как читатель посмотрит на ось. Под AGI обычно понимают общий искусственный интеллект: систему с широкими интеллектуальными возможностями, которая переносит навыки между разными задачами. Процент в одном испытании не показывает, какую долю такого интеллекта удалось собрать.

ARC-AGI-3 проверяет, как система разбирается в незнакомых интерактивных средах. Важен переход от наблюдений к действиям: обнаружить правило, попробовать ход, учесть результат. Подробности устройства испытания раскрывает ARC Prize.

Представьте, что вам дали незнакомую игру без подробной инструкции. Вы нажимаете кнопки, смотрите, что изменилось, и постепенно понимаете, как победить. Это хорошая бытовая аналогия проверяемого навыка. Она помогает почувствовать разницу между пересказом знакомого ответа и освоением новой задачи.

По методике ARC-AGI-3 балл учитывает прохождение и эффективность действий относительно человеческого эталона. Это не процент правильных ответов в обычной контрольной. Внутренние вычисления модели не равны действиям в игровой среде.

Но дальше начинается другой экзамен. Сумеет ли система распутать противоречивые требования заказчика? Заметит ли ошибку в исходной ведомости? Остановится ли перед действием, которое нельзя отменить? Набор игровых сред сам по себе не отвечает на все эти вопросы.

Здесь есть любопытный эффект потолка. Когда результаты подошли почти к максимуму, следующему поколению уже негде показать большой прирост на той же шкале. Сами авторы ARC Prize не объявляют Astra AGI. Для пользователя это повод смотреть на свои задачи. Получить ещё одну девятку в отчёте и получить готовую рабочую презентацию всё ещё разные события.

Сможет ли Astra закончить работу, которую раньше приходилось спасать?

У OpenAI есть и другая пара результатов: AutomationBench, 41,4% у Astra против 18,1% у Sol. В Terminal-Bench Science 0.1, проверяющем исследовательские процессы с кодом и терминалом, результат составляет 64,6% против 22,4%. Например, в таких процессах требуется анализировать данные или запускать моделирование.

Terminal-Bench Science 0.1: качество решения и расчётная стоимость API
Terminal-Bench Science 0.1: качество решения и расчётная стоимость API. Источник: OpenAI.

Для руководителя здесь интересен сам выбор задачи: оценивать ИИ по выполненной работе. Красивый абзац легко принять за полезный результат. С отчётом сложнее: нужно найти данные, понять их, правильно посчитать и собрать материал так, чтобы другой человек мог им пользоваться.

Допустим, вам нужен недельный отчёт по продажам. Слабый результат выглядит убедительно: графики, выводы, рекомендации. Сильный выдерживает три простые проверки: суммы сходятся с выгрузкой, возвраты учтены одинаково во всех разделах, а причины падения не придуманы по одному совпадению.

Именно поэтому нельзя переводить 41,4% в «ИИ заменяет 41,4% сотрудников». Задачи теста не равны должностям. Работа человека включает договорённости, ответственность, исключения и общение с теми, кто ещё не решил, чего хочет. Зато такой результат даёт повод проверить конкретную цепочку, которую раньше постоянно приходилось спасать вручную.

Считать стоит минуты от поручения до принятого результата. Включая ожидание, уточнения, проверку и переделки. Если ИИ пишет вдвое быстрее, а вы втрое дольше исправляете, рабочий день короче не стал.

Почти 98% в сложной математике. А что это меняет?

На графике FrontierMath Tier 4 (v2) Astra получает 97,6%, Sol набирает 82,9%. В сводной таблице результат Sol округлён иначе: 83,0%.

FrontierMath Tier 4 (v2): точность и расчётная стоимость API
FrontierMath Tier 4 (v2): точность и расчётная стоимость API. Источник: OpenAI.

А рядом с тестом есть история, для которой слово «прорыв» звучит предметнее. OpenAI опубликовала работу о промежутках между простыми числами, приписав доказательство Astra. В ней заявлена граница 186: бесконечно много пар соседних простых чисел находятся не дальше 186 друг от друга.

Простые числа делятся только на единицу и на себя. В начале ряда встречаются близкие пары: 11 и 13, 17 и 19. Дальше числа растут, промежутки ведут себя сложнее. Вопрос математиков: можно ли гарантировать, что близкие пары будут встречаться бесконечно, как бы далеко мы ни продвинулись?

Ответ с границей 186 уточняет, насколько близкими такие пары удаётся гарантировать. Это ещё не доказательство гипотезы о бесконечном числе пар с разницей 2. Но здесь уже обсуждается новое математическое утверждение с опубликованным доказательством, а не только место модели в таблице.

Для читателя вне науки этот эпизод меняет направление любопытства. Хочется проверить, какую трудную промежуточную работу теперь можно поручить ИИ: перебор подходов, поиск слабого допущения, проверку расчёта. Полезный результат может появиться задолго до полной самостоятельности системы.

Неудобная строка: Astra не победила во всех тестах

В общей таблице релиза Humanity’s Last Exam с инструментами даёт Astra 57,2%, Claude Fable 5.1 получает 65,0%. Результаты OpenAI приведены для максимального достигнутого балла при разных уровнях вычислительных усилий; рабочий ChatGPT может отличаться от тестовой среды.

Эта строка полезнее очередного лозунга «конкуренты уничтожены». Если одна модель сильнее на одном испытании и слабее на другом, выбор под задачу остаётся содержательной работой. Название нового поколения не отменяет сравнение.

Допустим, ваша команда каждый день разбирает обращения клиентов, а сложный исследовательский отчёт готовит раз в месяц. Прогоните обе задачи отдельно. Возможно, дорогая модель оправдает себя на отчёте, а для потока типовых обращений хватит более простой системы. Возможно, разница окажется в проверке фактов, а не в качестве текста.

Чем больше ИИ умеет, тем дороже ошибка с доступом

В отчёте о безопасности от 3 сентября OpenAI относит Astra к уровню Critical по кибервозможностям в своей системе оценки. Компания также сообщает: в испытаниях, где модель специально побуждали обходить мониторинг, нарушения стало труднее замечать по записи её рассуждений. При этом соблюдение границ в целом улучшилось.

Здесь нет нужды придумывать сюжет о сознании машины. Достаточно обычной папки с клиентскими документами. Одно дело попросить систему написать инструкцию по наведению порядка. Другое дело: дать ей доступ и поручить всё разобрать. Во втором случае ошибочный вывод может превратиться в перемещённый или потерянный файл.

Управление такой работой начинается с устройства доступа. Для первого прогона годится копия данных. Для массового изменения нужен предварительный список действий. Для отправки писем полезен этап, на котором человек видит получателей и текст. Это требования к продукту вокруг модели, а не магические фразы в промпте.

Практические ограничения разбираем в материале об AI-агенте для бизнеса. Вопрос «может ли агент выполнить задачу?» стоит задавать вместе с вопросом «какие действия ему действительно разрешены?».

Когда можно попробовать и сколько стоит эксперимент

GPT-6 Astra представлена 3 сентября 2026 года. На момент проверки, 6 сентября, официальные заметки о выпуске по-прежнему описывают ограниченное развёртывание с расширением доступа в ближайшие дни. Наличие анонса ещё не гарантирует, что модель уже доступна конкретному аккаунту.

В карточке API указаны $10 за миллион входных токенов и $50 за миллион выходных. Контекстное окно составляет 1 050 000 токенов, предел выходных токенов составляет 128 000. Для входа больше 272 тысяч токенов действуют повышенные ставки на весь запрос.

Возьмём условный расчёт: 20 тысяч обычных входных токенов и 5 тысяч оплачиваемых выходных. При стандартных ставках это $0,20 + $0,25 = $0,45. Здесь нет стоимости инструментов, повторных запросов и дополнительных выходных токенов рассуждения сверх выбранного объёма. Это иллюстрация тарифа, а не обещанная цена готового отчёта.

Для оценки внедрения прибавьте время человека. Эксперимент за несколько десятков центов может оказаться дорогим, если результат приходится час перепроверять. А более затратный запуск может быть выгоднее, если его принимают почти сразу. Большое контекстное окно тоже лучше рассматривать как возможность подать нужные материалы, а не как приглашение загружать всё подряд.

Проверка, после которой у вас будет собственное мнение об Astra

Для первого сравнения возьмите работу, результат которой вы уже умеете оценивать. Например, отчёт по обезличенной выгрузке, исправление известной ошибки в тестовой копии проекта или презентацию по готовому комплекту документов. Начинать с задачи, в которой вы сами не можете распознать ошибку, неудобно: впечатление будет сильнее доказательств.

  1. Выберите три прошлые задачи. Простую, типичную и ту, где предыдущий ИИ потребовал много помощи. Сохраните одинаковые входные данные.
  2. Опишите приёмку до запуска. Какие суммы должны сойтись? Какие ссылки обязаны открываться? Какой тест подтверждает исправление?
  3. Сравните одинаковые условия. Те же документы, инструменты и ограничения. Зафиксируйте модель и настройки, чтобы понимать, что именно проверили.
  4. Запишите полную цену результата. Время выполнения, стоимость, число ваших вмешательств и минуты исправлений.
  5. Решите, где расширять использование. Успех на одном отчёте даёт основание для следующего прогона. Несколько удачных примеров ещё не показывают надёжность на всех исключениях.

Задание может звучать так: «Собери отчёт по этой выгрузке. Отдельно покажи возвраты и строки с отсутствующими данными. Приложи расчёты, по которым можно сверить итог. Если причины изменения продаж не следуют из данных, сформулируй вопросы для проверки. Результат сохрани новым файлом».

В таком поручении есть материал, полезный результат и способ его проверить. Эту же логику можно перенести на AI-агента для бизнеса: сначала одна понятная работа, затем расширение сценария по результатам проверки.

99,9% на графике хочется переслать. Готовую работу хочется поручить ещё раз. У Astra появился очень сильный повод получить второй шанс у тех, кто давно махнул на ИИ рукой. А главный личный тест звучит коротко: с какой задачей, которую вчера приходилось доделывать самому, она справится сегодня?

Источники

Материалы проверены 6 сентября 2026 года. Сравнения моделей и графики приведены по данным их авторов.

Короткие ответы про GPT-6 Astra

Означает ли результат ARC-AGI-3, что создан общий искусственный интеллект?

Один тест не измеряет все интеллектуальные способности и все условия реальной работы. Высокий результат даёт повод проверить модель на более сложных задачах, но не заменяет такую проверку.

Можно ли сразу заменить прежнюю модель на Astra?

Сначала сравните качество, стоимость и время проверки на собственных задачах. Сохраните одинаковые входные данные и критерии приёмки. Решение для сложного отчёта и для потока простых обращений может различаться.

Какой результат первого эксперимента считать полезным?

Работа принята по заранее заданным критериям, а суммарные затраты времени и денег устраивают вас. Отдельно запишите, где понадобилась помощь человека: это определит границы следующего запуска.

Есть задача, которую хочется поручить Astra?

Пришлите нам в 13FOX обезличенный пример входных данных и образец нужного результата. Разберём шаги, интеграции и критерии приёмки; на первой встрече определим границы пилота и способ проверить его пользу.

Ко всем статьям AI-агент для бизнеса

Спасибо!

Наша команда свяжется с вами!

Отправляем 🚀