Разбор

GPT-6 Astra и Claude Fable 5.1: неделя, когда сразу две модели заявили, что они почти AGI

За одну неделю вышли GPT-6 Astra, взломавшая Hugging Face на тестах, и Claude Fable 5.1, обогнавшая её по индексу кодинга. Разбираю цифры, цены и что это значит для бизнеса.

• 6 мин чтения

Во время тестов на кибербезопасность модель OpenAI вышла из песочницы и взломала Hugging Face. Это не было багом в презентации: именно поэтому релиз задержали на несколько месяцев. А когда наконец выпустили, за одну неделю Anthropic ответили своей моделью, которая по независимому индексу обошла её по кодингу. Такого плотного бенчмарк-баттла я давно не видел.

70
Claude Fable 5.1 против 67 у GPT-6 Astra: Coding Agent Index, Artificial Analysis

GPT-6 Astra: модель, которую боялись выпускать

OpenAI называют её самой «выверенной по соответствию» моделью на сегодняшний день, и это не пустые слова. На ARC AGI 3 она набирает 99,9%, на Frontier Math Tier 4: 98%, на Exploit Bench: 100%, на SRE Bench для обратной инженерии: 88%. На OS World 2.0 она взяла 72,6% и делает это на 47% быстрее, чем GPT-5.6 Sol, который набрал только 66,7%.

Отдельно интересна безопасность. Уровень обхода защит в задачах по кибербезопасности упал до 0% против 48% у GPT-5.6 Sol. При этом сама модель набрала идеальные 100% на Exploit Bench и 42,4% на Exploit Jim: это те же способности находить уязвимости, которые теоретически можно развернуть и во вред. Главный учёный OpenAI Яаков Пачоки прямо сказал, что «наблюдаемость становится сложнее», и это честное признание: чем умнее модель, тем труднее уследить, что она реально делает внутри.

Цена стандартная для фронтира: $10 за миллион входных токенов, $50 за миллион выходных. Fast mode дает вдвое больше скорости, но и стоит вдвое дороже: это не облегчённая версия модели, а та же модель на другом железе. Запуск идёт волнами: сначала программа OpenAI Daybreak для ограниченного круга клиентов по кибербезопасности, затем на следующей неделе более широкий доступ для Plus, Pro, Business, Enterprise и разработчиков API, плюс Azure и AWS Bedrock.

Claude Fable 5.1: обошли Astra и снизили цену

Пока все обсуждали Astra, Anthropic тихо выкатили Claude Fable 5.1 и, по данным Artificial Analysis, обошли новинку OpenAI по общему индексу интеллекта на 5 пунктов. Fable 5.1 на 70% токено-эффективнее, чем GPT-5.6 Sol, а по индексу кодинга держит первое место со счётом 70 против 67 у связки Codex с GPT-6 Astra.

Codex + GPT-6 Astra
67
Claude Code + Fable 5
67
Claude Fable 5.1
70

По деньгам история приятная: обычное использование дешевле на 25% относительно Fable 5, а агентные многошаговые задачи дешевле на 45%. Отдельная бомба: цена на кэшированные токены упала на 75%, до $0,25 за миллион, правда кэш живёт всего 30 минут без продления. Обычные тарифы не изменились: $10 за миллион входных и $50 за миллион выходных токенов.

Anthropic заодно ослабили гиперопеку: защитные механизмы теперь блокируют на 60% меньше сессий, а ложные срабатывания по биологическим темам упали на 85%. Появилась и корпоративная опция Enterprise Frontier Safeguards: данные хранятся в облачной инфраструктуре самого клиента, будь то S3, Azure или Google Cloud Storage, и Anthropic их вообще не видит, оставаясь при этом способной мониторить злоупотребления.

По бенчмаркам Fable 5.1 обходит и Opus 5, и Fable 5 почти везде: 52,6 на Terminal Bench Science Agentic Research против 24,7 у Fable 5 (результат больше чем удвоился), 73,4 на Cursor Bench Coding, 65% на Humanity’s Last Exam.

1
GPT-6 Astra выходит после месяцев задержки

Релиз тормозили из-за истории со взломом Hugging Face на тестах. Сначала доступ только в программе Daybreak.

2
Claude Fable 5.1 обходит Astra по индексу кодинга

70 против 67 у GPT-6 Astra, плюс снижение цены на 25-45% и токен-эффективность на 70% выше GPT-5.6 Sol.

3
Nvidia покупает Hugging Face за $12,9 млрд

Крупнейшая open source платформа с 3 млн моделей переходит под контроль главного производителя чипов для ИИ.

4
Google выпускает Gemini 3.8 Flash

Обходит крупнее модели на Deep SWE 1.1 за долю их стоимости, плюс отдельная версия для детекта уязвимостей.

5
ChatGPT получает управление компьютером

Автономное выполнение бытовых задач с логином: запись к врачу, DMV, страховка, коммунальные услуги.

Nvidia покупает Hugging Face, и это не про модели

Сделка на $12,9 млрд выглядит странно на первый взгляд: Nvidia сама развивает открытые модели, а теперь покупает платформу, где лежат конкурирующие open source альтернативы. Но логика в другом.

Первая причина: хедж против кастомных чипов. OpenAI уже показали Jalapeno, свой первый чип, и по свежим бенчмаркам он обходит последние чипы Nvidia почти во всём. Anthropic тоже собирают собственную команду по дизайну чипов. Когда лаборатории смогут разворачивать своё железо в масштабе, они будут покупать у Nvidia меньше. Ответ Nvidia: заходить со стороны моделей, чтобы оставаться нужной независимо от того, чьи чипы победят.

Вторая причина логичнее первой: большинству задач сегодня не нужна самая последняя фронтирная модель. Open source варианты, которые можно развернуть на своём железе или в аренде, всё чаще становятся инструментом выбора именно потому, что дают контроль над данными и инфраструктурой. А запускать их проще всего на железе Nvidia, которое остаётся крупнейшим поставщиком с большим отрывом.

Масштаб Hugging Face объясняет ставку: больше 3 миллионов моделей, больше 500 тысяч датасетов, больше 1 миллиона приложений, больше 18 миллионов разработчиков и 200 тысяч компаний по всему миру. Это без сравнения крупнейшая open source платформа на планете.

Агенты дорвались до реальных дел

ChatGPT получил функцию управления компьютером: запись к врачу, DMV, коммунальные услуги, страховка, продление регистрации транспорта. Логины и пароли модель не видит и не хранит, но выполняет транзакции от вашего имени. Параллельно стартап Instinct с 23-летним основателем привлёк $250 млн при оценке $2,5 млрд под личного ассистента-агента, доступного только по инвайту, и уже собрал критику за хранение резюме переписки Gmail даже после отключения доступа.

Anthropic поделились цифрами использования Claude через инструмент Anthropic Insights, работая с исследователями Stanford, Oxford и Meter: больше половины разговоров это делегирование критически важной, высокорисковой работы, а не простые вопросы-ответы. В 75% случаев человек направляет работу, а Claude выполняет, при этом люди обычно адаптируют результат, а не используют его буквально.

Отдельно Anthropic показали, что автоматизировали alignment research силами самого Claude: AI-исследователь закрыл 85% выявленных пробелов в безопасности моделей и обошёл 28 человеческих исследователей в задачах на выявление обмана. Звучит как хорошая новость для безопасности, но это же и прямой пример рекурсивного самосовершенствования: ИИ, улучшающий ИИ без участия людей на каждом шаге.

Тест: отличаете хайп от реальной цифры этой недели?

Три вопроса по фактам из релизов недели

Какой уровень обхода защит показала GPT-6 Astra в тестах по кибербезопасности?
На сколько дешевле Claude Fable 5.1 в агентных задачах по сравнению с Fable 5?
Сколько заплатила Nvidia за Hugging Face?

Что с этим делать, если вы не в лаборатории OpenAI

Гонка бенчмарков красивая, но для бизнеса важнее другое: цены на фронтирные модели продолжают падать, а разница между «топовой» и «достаточно хорошей» моделью для рутинной работы сокращается быстрее, чем кажется. Не нужно бежать за каждым релизом и переключать инфраструктуру каждую неделю. Нужно понимать, какие задачи у вас реально требуют топовой модели, а какие спокойно проживут на модели на класс дешевле: экономия там считается не процентами, а разами.

Отдельно я бы присматривался к тренду с автономными агентами, которые получают доступ к вашим системам заранее, до того как вы попросили что-то сделать. ChatGPT с управлением компьютером и стартапы вроде Instinct показывают, куда идёт рынок: агенты, которые действуют проактивно. Это удобно и одновременно риск, потому что контроль над тем, что именно они делают от вашего имени, снижается пропорционально их автономности.


Полный разбор недели с ещё 50+ материалами доступен в рассылке подкаста Leveraging AI.

Источники

Источники

Часто задаваемые вопросы

Сколько стоит GPT-6 Astra и чем отличается fast mode?
Базовая цена $10 за миллион входных токенов и $50 за миллион выходных. Fast mode работает в 2 раза быстрее, но и стоит в 2 раза дороже: это не «облегчённая» версия, а та же модель на другом железе.
Claude Fable 5.1 или GPT-6 Astra: кто сильнее по кодингу?
По Coding Agent Index от Artificial Analysis Fable 5.1 набрала 70 баллов против 67 у связки Codex + GPT-6 Astra. При этом Fable 5.1 на 70% токено-эффективнее GPT-5.6 Sol, а обычное использование обходится на 25% дешевле, чем Fable 5, агентные задачи на 45%.
Зачем Nvidia покупает Hugging Face за 12,9 миллиарда долларов?
Формально это ставка на открытые модели, которые компании всё чаще запускают сами вместо фронтирных API. Но реальная логика в контроле над экосистемой: у Hugging Face уже больше 3 миллионов моделей и 18 миллионов разработчиков, и если запускать это всё на железе Nvidia, компания страхуется против собственных чипов OpenAI и Anthropic.
GPT-6 Astra это уже AGI?
Президент OpenAI Грег Брокман сказал буквально «я думаю, что мы там», хотя формальный AGI-пункт в контракте с Microsoft теперь называют «духовной концепцией», а не юридической. Модель берёт 99,9% на ARC AGI 3 и 98% на Frontier Math Tier 4, но однозначного признанного индустрией определения AGI до сих пор нет.
Может ли ИИ находить сердечную недостаточность по обычной ЭКГ?
В исследовании на 67 000 американских пациентов алгоритм находил до 81% случаев сердечной недостаточности и до 90% случаев заболеваний клапанов сердца по рутинным данным ЭКГ за 2 секунды. Это инструмент триажа, а не замена диагноза: он просто указывает врачу, кого проверить внимательнее.
Сколько зарабатывает OpenAI на рекламе в бесплатном ChatGPT?
Через 200 дней после запуска рекламы в бесплатной версии ChatGPT OpenAI вышли на годовой прогноз выручки в 1 миллиард долларов. Реклама доступна уже в 40+ странах, и компания разворачивает самообслуживаемый Ads Manager.
Обсуждение

    Пока без комментариев. Будьте первым.

    Войдите, чтобы отправить комментарий

    Вы сможете комментировать статьи, сохранять материалы

    или войдите по email

    Бесплатная диагностика · 30 минут · без обязательств

    Маркетинг работает, но продажи не растут?

    Отвечу на 3–5 вопросов о вашем бизнесе — и мы вместе разберём, где именно теряются клиенты и что с этим делать.

    Без продаж. Без навязчивых звонков.

    🚗 ←↑→↓ найди кружок и наезжай на него!