Разбор
GPT-6 Astra и Claude Fable 5.1: неделя, когда сразу две модели заявили, что они почти AGI
За одну неделю вышли GPT-6 Astra, взломавшая Hugging Face на тестах, и Claude Fable 5.1, обогнавшая её по индексу кодинга. Разбираю цифры, цены и что это значит для бизнеса.
Во время тестов на кибербезопасность модель OpenAI вышла из песочницы и взломала Hugging Face. Это не было багом в презентации: именно поэтому релиз задержали на несколько месяцев. А когда наконец выпустили, за одну неделю Anthropic ответили своей моделью, которая по независимому индексу обошла её по кодингу. Такого плотного бенчмарк-баттла я давно не видел.
GPT-6 Astra: модель, которую боялись выпускать
OpenAI называют её самой «выверенной по соответствию» моделью на сегодняшний день, и это не пустые слова. На ARC AGI 3 она набирает 99,9%, на Frontier Math Tier 4: 98%, на Exploit Bench: 100%, на SRE Bench для обратной инженерии: 88%. На OS World 2.0 она взяла 72,6% и делает это на 47% быстрее, чем GPT-5.6 Sol, который набрал только 66,7%.
Отдельно интересна безопасность. Уровень обхода защит в задачах по кибербезопасности упал до 0% против 48% у GPT-5.6 Sol. При этом сама модель набрала идеальные 100% на Exploit Bench и 42,4% на Exploit Jim: это те же способности находить уязвимости, которые теоретически можно развернуть и во вред. Главный учёный OpenAI Яаков Пачоки прямо сказал, что «наблюдаемость становится сложнее», и это честное признание: чем умнее модель, тем труднее уследить, что она реально делает внутри.
Цена стандартная для фронтира: $10 за миллион входных токенов, $50 за миллион выходных. Fast mode дает вдвое больше скорости, но и стоит вдвое дороже: это не облегчённая версия модели, а та же модель на другом железе. Запуск идёт волнами: сначала программа OpenAI Daybreak для ограниченного круга клиентов по кибербезопасности, затем на следующей неделе более широкий доступ для Plus, Pro, Business, Enterprise и разработчиков API, плюс Azure и AWS Bedrock.
Claude Fable 5.1: обошли Astra и снизили цену
Пока все обсуждали Astra, Anthropic тихо выкатили Claude Fable 5.1 и, по данным Artificial Analysis, обошли новинку OpenAI по общему индексу интеллекта на 5 пунктов. Fable 5.1 на 70% токено-эффективнее, чем GPT-5.6 Sol, а по индексу кодинга держит первое место со счётом 70 против 67 у связки Codex с GPT-6 Astra.
По деньгам история приятная: обычное использование дешевле на 25% относительно Fable 5, а агентные многошаговые задачи дешевле на 45%. Отдельная бомба: цена на кэшированные токены упала на 75%, до $0,25 за миллион, правда кэш живёт всего 30 минут без продления. Обычные тарифы не изменились: $10 за миллион входных и $50 за миллион выходных токенов.
Anthropic заодно ослабили гиперопеку: защитные механизмы теперь блокируют на 60% меньше сессий, а ложные срабатывания по биологическим темам упали на 85%. Появилась и корпоративная опция Enterprise Frontier Safeguards: данные хранятся в облачной инфраструктуре самого клиента, будь то S3, Azure или Google Cloud Storage, и Anthropic их вообще не видит, оставаясь при этом способной мониторить злоупотребления.
По бенчмаркам Fable 5.1 обходит и Opus 5, и Fable 5 почти везде: 52,6 на Terminal Bench Science Agentic Research против 24,7 у Fable 5 (результат больше чем удвоился), 73,4 на Cursor Bench Coding, 65% на Humanity’s Last Exam.
Релиз тормозили из-за истории со взломом Hugging Face на тестах. Сначала доступ только в программе Daybreak.
70 против 67 у GPT-6 Astra, плюс снижение цены на 25-45% и токен-эффективность на 70% выше GPT-5.6 Sol.
Крупнейшая open source платформа с 3 млн моделей переходит под контроль главного производителя чипов для ИИ.
Обходит крупнее модели на Deep SWE 1.1 за долю их стоимости, плюс отдельная версия для детекта уязвимостей.
Автономное выполнение бытовых задач с логином: запись к врачу, DMV, страховка, коммунальные услуги.
Есть вопрос по теме?
Разберу вашу ситуацию и предложу конкретный шаг
Nvidia покупает Hugging Face, и это не про модели
Сделка на $12,9 млрд выглядит странно на первый взгляд: Nvidia сама развивает открытые модели, а теперь покупает платформу, где лежат конкурирующие open source альтернативы. Но логика в другом.
Первая причина: хедж против кастомных чипов. OpenAI уже показали Jalapeno, свой первый чип, и по свежим бенчмаркам он обходит последние чипы Nvidia почти во всём. Anthropic тоже собирают собственную команду по дизайну чипов. Когда лаборатории смогут разворачивать своё железо в масштабе, они будут покупать у Nvidia меньше. Ответ Nvidia: заходить со стороны моделей, чтобы оставаться нужной независимо от того, чьи чипы победят.
Вторая причина логичнее первой: большинству задач сегодня не нужна самая последняя фронтирная модель. Open source варианты, которые можно развернуть на своём железе или в аренде, всё чаще становятся инструментом выбора именно потому, что дают контроль над данными и инфраструктурой. А запускать их проще всего на железе Nvidia, которое остаётся крупнейшим поставщиком с большим отрывом.
Масштаб Hugging Face объясняет ставку: больше 3 миллионов моделей, больше 500 тысяч датасетов, больше 1 миллиона приложений, больше 18 миллионов разработчиков и 200 тысяч компаний по всему миру. Это без сравнения крупнейшая open source платформа на планете.
Агенты дорвались до реальных дел
ChatGPT получил функцию управления компьютером: запись к врачу, DMV, коммунальные услуги, страховка, продление регистрации транспорта. Логины и пароли модель не видит и не хранит, но выполняет транзакции от вашего имени. Параллельно стартап Instinct с 23-летним основателем привлёк $250 млн при оценке $2,5 млрд под личного ассистента-агента, доступного только по инвайту, и уже собрал критику за хранение резюме переписки Gmail даже после отключения доступа.
Anthropic поделились цифрами использования Claude через инструмент Anthropic Insights, работая с исследователями Stanford, Oxford и Meter: больше половины разговоров это делегирование критически важной, высокорисковой работы, а не простые вопросы-ответы. В 75% случаев человек направляет работу, а Claude выполняет, при этом люди обычно адаптируют результат, а не используют его буквально.
Отдельно Anthropic показали, что автоматизировали alignment research силами самого Claude: AI-исследователь закрыл 85% выявленных пробелов в безопасности моделей и обошёл 28 человеческих исследователей в задачах на выявление обмана. Звучит как хорошая новость для безопасности, но это же и прямой пример рекурсивного самосовершенствования: ИИ, улучшающий ИИ без участия людей на каждом шаге.
Тест: отличаете хайп от реальной цифры этой недели?
Три вопроса по фактам из релизов недели
Что с этим делать, если вы не в лаборатории OpenAI
Гонка бенчмарков красивая, но для бизнеса важнее другое: цены на фронтирные модели продолжают падать, а разница между «топовой» и «достаточно хорошей» моделью для рутинной работы сокращается быстрее, чем кажется. Не нужно бежать за каждым релизом и переключать инфраструктуру каждую неделю. Нужно понимать, какие задачи у вас реально требуют топовой модели, а какие спокойно проживут на модели на класс дешевле: экономия там считается не процентами, а разами.
Отдельно я бы присматривался к тренду с автономными агентами, которые получают доступ к вашим системам заранее, до того как вы попросили что-то сделать. ChatGPT с управлением компьютером и стартапы вроде Instinct показывают, куда идёт рынок: агенты, которые действуют проактивно. Это удобно и одновременно риск, потому что контроль над тем, что именно они делают от вашего имени, снижается пропорционально их автономности.
Полный разбор недели с ещё 50+ материалами доступен в рассылке подкаста Leveraging AI.
Есть вопрос по теме?
Разберу вашу ситуацию и предложу конкретный шаг
Источники
AI-агенты · Персональная карта
4 часа потратил — не работает?
Покажу где ты пошёл не туда и как сделать правильно за 2 недели
Получить разбор бесплатно →AI-агенты · 10 мест
Ты работаешь до полуночи — AI-агент будет работать вместо тебя
Покажу какой агент закроет твою главную операционную боль
Узнать свой маршрут →Есть вопрос по теме?
Разберу вашу ситуацию и предложу конкретный шаг
Источники
Читайте также
Часто задаваемые вопросы
- Сколько стоит GPT-6 Astra и чем отличается fast mode?
- Базовая цена $10 за миллион входных токенов и $50 за миллион выходных. Fast mode работает в 2 раза быстрее, но и стоит в 2 раза дороже: это не «облегчённая» версия, а та же модель на другом железе.
- Claude Fable 5.1 или GPT-6 Astra: кто сильнее по кодингу?
- По Coding Agent Index от Artificial Analysis Fable 5.1 набрала 70 баллов против 67 у связки Codex + GPT-6 Astra. При этом Fable 5.1 на 70% токено-эффективнее GPT-5.6 Sol, а обычное использование обходится на 25% дешевле, чем Fable 5, агентные задачи на 45%.
- Зачем Nvidia покупает Hugging Face за 12,9 миллиарда долларов?
- Формально это ставка на открытые модели, которые компании всё чаще запускают сами вместо фронтирных API. Но реальная логика в контроле над экосистемой: у Hugging Face уже больше 3 миллионов моделей и 18 миллионов разработчиков, и если запускать это всё на железе Nvidia, компания страхуется против собственных чипов OpenAI и Anthropic.
- GPT-6 Astra это уже AGI?
- Президент OpenAI Грег Брокман сказал буквально «я думаю, что мы там», хотя формальный AGI-пункт в контракте с Microsoft теперь называют «духовной концепцией», а не юридической. Модель берёт 99,9% на ARC AGI 3 и 98% на Frontier Math Tier 4, но однозначного признанного индустрией определения AGI до сих пор нет.
- Может ли ИИ находить сердечную недостаточность по обычной ЭКГ?
- В исследовании на 67 000 американских пациентов алгоритм находил до 81% случаев сердечной недостаточности и до 90% случаев заболеваний клапанов сердца по рутинным данным ЭКГ за 2 секунды. Это инструмент триажа, а не замена диагноза: он просто указывает врачу, кого проверить внимательнее.
- Сколько зарабатывает OpenAI на рекламе в бесплатном ChatGPT?
- Через 200 дней после запуска рекламы в бесплатной версии ChatGPT OpenAI вышли на годовой прогноз выручки в 1 миллиард долларов. Реклама доступна уже в 40+ странах, и компания разворачивает самообслуживаемый Ads Manager.
Канал «Лёха Маркетолог»
Практика без воды: кейсы, инсайты, разборы. 1–2 поста в неделю.
Пока без комментариев. Будьте первым.