Anthropic раскрывает внутреннюю модель 2: общие возможности незначительно превосходят Claude Mythos 5

Anthropic в своем отчете о рисках за август 2026 года незаметно раскрыла неопубликованную внутреннюю модель ИИ под названием Model 2. Эта модель не является публичной версией Claude, и Anthropic не объявляла...

发布于 2026年8月19日generalGEO 评分: 09 次阅读
Anthropic раскрывает внутреннюю модель 2: общие возможности незначительно превосходят Claude Mythos 5

Anthropic раскрывает внутреннюю модель 2: общая производительность несколько выше, чем у Claude Mythos 5

Введение

Anthropic в своём отчёте о рисках за август 2026 года тихо раскрыла неопубликованную внутреннюю ИИ-модель под названием Model 2.

Эта модель не является публичной версией Claude, и Anthropic не выпускала её как продукт. Она появилась в отчёте, потому что компания включила внутренние передовые и околопередовые системы в оценку рисков продвинутого ИИ.

По словам Anthropic, Model 2 в целом немного сильнее, чем Claude Mythos 5.

Улучшение реально, но компания осторожно не описывает его как значительный скачок между поколениями.

Собственное резюме Anthropic отмечает, что Model 2 заметно превосходит Mythos 5 по многим задачам, связанным с внутренним использованием, но всё ещё далека от того скачка возможностей, который компания наблюдала при переходе с Claude Opus 4.6 на Claude Mythos Preview.

Это делает Model 2 значимой с другой точки зрения.

Скорее, чем знаменовать приход нового поколения, это больше похоже на продолжение постоянного совершенствования возможностей передовых моделей Anthropic.

В отчёте также приведён конкретный показатель: во внутренней оценке Anthropic CoBench Model 2 набрала 62,8%, опередив Claude Mythos 5 с 50,3% и Claude Mythos Preview с 54,8%.

В том же отчёте упоминается ещё одна внутренняя система — Model 1, что вызвало внешние предположения: не разрабатывает ли Anthropic серию внутренних моделей, которым затем присваиваются публичные названия продуктов Claude.

Официальный отчёт лишь частично поддерживает такую интерпретацию.

Anthropic подтверждает, что Model 1 и Model 2 — внутренние модели, но не заявляет, что Model 2 является официальным преемником Model 1, и не говорит, что какая-либо из них станет будущей версией Claude.

Model 2 в целом немного сильнее, чем Claude Mythos 5

Основной вывод репортажа AIBase точен: Anthropic заявляет, что Model 2 в целом сильнее Claude Mythos 5.

Августовский отчёт о рисках описывает Model 2 следующим образом:

  • В некоторых областях превосходит Mythos 5.
  • В других областях уступает Mythos 5.
  • В целом немного сильнее.

Anthropic также сообщает, что её предварительная качественная оценка заключается в том, что Model 2 обеспечивает заметные улучшения по многим задачам, связанным с внутренним использованием.

Эта формулировка важна.

Model 2 не следует описывать как модель, превосходящую Mythos 5 по всем без исключения бенчмаркам или во всех сферах, связанных с рисками.

Сам отчёт показывает, что результаты сравнения различаются в зависимости от задачи.

Например, в некоторых оценках химических и биологических рисков Anthropic сообщает, что ограниченные результаты Model 2 сопоставимы с Claude Mythos 5 или слабее.

В другой оценке скрытого поведения Model 2 немного сильнее Mythos 5, но всё ещё заметно слабее Mythos Preview.

Таким образом, наиболее справедливое резюме:

Model 2
= в целом немного сильнее
≠ превосходит по каждой оценке

Улучшение не является значительным скачком между поколениями

Оригинальная статья подчёркивает, что улучшение относительно ограничено.

Anthropic заявляет, что по сравнению с...

та же ситуация.

Компания особо сравнивает Model 2 с предыдущим скачком — переходом с Claude Opus 4.6 на Claude Mythos Preview.

Тот апгрейд представлял собой гораздо более значительный рост возможностей.

Model 2 — нет.

Anthropic сообщает, что эта более новая внутренняя модель демонстрирует заметные улучшения по многим внутренним задачам, но это не разрушительное изменение того же масштаба.

Это также отражается в другом внутреннем показателе возможностей.

Anthropic ведёт внутреннюю версию индекса Epoch под названием AECI, объединяющую результаты множества внутренних бенчмарков.

Согласно ограниченным данным, оценка Model 2 примерно на:

1,5 пункта AECI

выше, чем у Claude Mythos 5.

Anthropic прямо указывает, что эта оценка имеет большую погрешность.

Она также сообщает, что этот прирост меньше, чем улучшение от Mythos Preview к Mythos 5.

Это подтверждает основную характеристику статьи: Model 2 выглядит как постепенное усовершенствование передовых моделей, а не как явно новый этап возможностей.

CoBench даёт наиболее чёткое публичное сравнение

Наиболее конкретные доказательства в отчёте — из CoBench.

Anthropic описывает CoBench как внутреннюю оценку, предназначенную для проверки способности модели решать реальные инженерные задачи компании, а не для использования общих бенчмарков в качестве замены.

Оценка помещает модель в определённый момент времени в истории инфраструктуры Anthropic.

Модель получает снимок ресурсов, включающий:

  • Код.
  • Журналы.
  • Внутренние документы.
  • Исторические внутренние сообщения.

Затем она должна диагностировать первопричины технических проблем, которые ранее решали инженеры Anthropic.

Текущая версия, описанная в августовском отчёте, содержит:

449 проблем

в основном из проблем, решённых в период с февраля по апрель 2026 года.

Эти проблемы поступили из отделов технической организации Anthropic, занимающихся:

  • Обучением моделей.
  • Эксплуатацией инфраструктуры моделей.
  • Отладкой технических систем.
  • Исследовательской инженерией.

Это делает CoBench особенно актуальным для внимания Anthropic к автоматизации ИИ-исследований с помощью ИИ.

Model 2 набирает 62,8% в CoBench

Сравнительные оценки, представленные в отчёте:

Модель Оценка CoBench
Claude Sonnet 4.6 12,0%
Claude Opus 4.6 15,6%
Claude Opus 4.7 27,4%
Claude Mythos 5 50,3%
Claude Mythos Preview 54,8%
Model 2 62,8%

Таким образом, Model 2 лидирует среди моделей, показанных на графике.

Её преимущество над Mythos 5 составляет:

62,8% - 50,3% = 12,5 процентных пункта

На этом конкретном внутреннем бенчмарке это значительный разрыв.

Но это всё ещё намного ниже того уровня, который Anthropic считает достаточным для полной замены своих технических специалистов.

Anthropic оценивает, что для полной замены исследователей требуется около 85%

Anthropic сообщает, что на основе ручного анализа задач и процесса оценки система, способная по-настоящему полностью заменить исследователей и инженеров Anthropic, должна набирать в CoBench не менее примерно:

85%

Model 2 с её 62,8% по-прежнему далека от этого.

Anthropic также предупреждает, что этот бенчмарк не является идеальным показателем эквивалентности человеку.

Набор данных

намеренно отобран по принципу сложности.

Большинство задач были выбраны потому, что Mythos Preview провалила их хотя бы один раз из трёх попыток.

Anthropic сообщает, что без такой фильтрации набор данных был бы примерно вдвое больше.

Есть и другие ограничения:

  • Некоторые исторические выводы людей могут быть несовершенными.
  • Некоторые ответы могут быть неоднозначными.
  • Автоматическая оценка может ошибаться.

Модель не получает всех привилегий или инфраструктурной поддержки, которыми может располагать настоящий инженер Anthropic.

Поэтому CoBench лучше рассматривать как полезный внутренний сигнал, а не как универсальный критерий, определяющий, может ли ИИ-модель заменить исследователя.

Предоставление Mythos 5 большего количества токенов не полностью устраняет разрыв

Anthropic также проверила, отражают ли результаты CoBench лишь недостаточный бюджет на логический вывод.

Используемый в этой диаграмме бюджет токенов составляет примерно:

300 000 токенов

для оцениваемых конфигураций.

Когда Anthropic увеличила бюджет для Mythos 5 до:

900 000 токенов

её результат улучшился лишь примерно на:

3 процентных пункта

Это указывает на то, что по крайней мере часть преимущества Model 2 нельзя объяснить простым предоставлением Mythos 5 большего количества токенов.

Anthropic по-прежнему считает, что более совершенные средства организации процессов и структуры оценки могут улучшить результаты, поэтому данный бенчмарк не измеряет исключительно веса самой модели.

Архитектура агента имеет значение.

Model 2 уже активно используется внутри Anthropic

Model 2 ещё не выпущена, но это не просто лабораторная контрольная точка, которую никто не использует.

Anthropic сообщает, что Model 2 и Claude Mythos 5 являются одними из самых мощных и наиболее часто используемых внутренних моделей компании.

Они активно применяются для:

  • программирования;
  • генерации данных;
  • других агентных рабочих процессов;
  • исследований;
  • инженерных задач.

Anthropic также отмечает, что обе модели используются через постоянные агентные развертывания, а не только в интерактивных чат-сессиях.

Это важно, поскольку раздел отчёта о рисках компании частично посвящён тому, насколько ИИ-системы могут автоматизировать всё большую часть собственной исследовательской и разработочной деятельности Anthropic.

В отчёте говорится, что Claude теперь пишет подавляющее большинство кода, попадающего в производственный репозиторий Anthropic.

Тем не менее Anthropic не делает вывода, что её модели в настоящее время способны полностью заменить её исследователей.

Компания считает, что ИИ существенно ускоряет внутреннюю работу, однако её августовские оценки всё ещё ниже пороговых значений, установленных в Политике ответственного масштабирования для значительного ускорения ИИ-ориентированных исследований и разработок.

Model 2 ещё не прошла полный набор предварительных оценок Anthropic перед развертыванием

В отчёте содержится ещё одно важное предостережение.

Model 2 прошла внутренний процесс проверки развертывания Anthropic, но ещё не прошла полный набор оценок, которые компания обычно проводит перед внешним развертыванием.

Поэтому Anthropic заявляет, что её уверенность в понимании Model 2 несколько ниже, чем в отношении полностью оценённых выпущенных моделей.

Это важно при интерпретации сравнительных бенчмарков.

Отдельный результат CoBench может указывать на то, что Model 2 показывает высокие результаты во внутренних исследовательских и разработочных задачах.

Но он не создаёт полной картины производительности, охватывающей:

  • общие рассуждения;
  • программирование;
  • кибербезопасность;
  • биологию;
  • безопасность;
  • выравнивание;
  • длительную автономную работу;
  • потребительское использование;
  • корпоративные среды.

Объём работы.

Текущий вывод Anthropic намеренно сформулирован широко: Model 2 в целом, по-видимому, несколько превосходит Mythos 5.

Anthropic в настоящее время не планирует публичный выпуск Model 2

В той краткой статье AIBase наиболее важная практическая деталь легко упускается из виду.

Anthropic прямо заявляет:

В настоящее время мы не планируем
публичный выпуск этой модели.

Поэтому Model 2 не следует рассматривать как готовящуюся к выпуску модель Claude с подразумеваемой датой релиза.

На данный момент нет официальных:

  • дат выпуска;
  • публичных названий моделей;
  • идентификаторов моделей Claude API;
  • цен;
  • спецификаций контекстного окна;
  • планов доступности для потребителей;
  • планов корпоративного развертывания.

Любые утверждения о том, что Model 2 станет «Claude Mythos 6», «Claude Opus 6» или другим именованным продуктом, являются лишь предположениями.

Anthropic раскрывает информацию об этой модели, поскольку она связана с оценкой рисков компании.

Это отличается от выпуска продукта.

Claude Mythos 5 на самом деле не является широко доступной публичной моделью

Оригинальный заголовок AIBase называл Claude Mythos 5 самой мощной публично доступной моделью Anthropic.

Это утверждение нуждается в небольшой корректировке.

Claude Mythos 5 не является широко доступной.

В настоящее время Anthropic предоставляет эту модель лишь ограниченной группе одобренных клиентов через Project Glasswing и связанные с ним программы доверенного доступа.

Широко доступным аналогом является Claude Fable 5.

Anthropic утверждает, что Fable 5 и Mythos 5 используют одну и ту же базовую модель.

Разница заключается в том, что Fable 5 включает более строгие меры безопасности в чувствительных областях, таких как кибербезопасность и биология, тогда как Mythos 5 предоставляется проверенным пользователям, которым для санкционированной работы требуется меньше ограничений.

Текущее соотношение продуктов таково:

Claude Mythos 5
= ограниченный доверенный доступ

Claude Fable 5
= та же базовая модель
  + более строгие меры безопасности
  + широкая доступность

Таким образом, для обычного читателя более точным будет следующее утверждение: Mythos 5 — это самая мощная модель с ограниченным доступом Anthropic, а Fable 5 — её самая мощная широко выпущенная модель.

Model 1 реальна, но история продукта «Model 1 → Model 2» — чистые спекуляции

В отчёте также упоминается Model 1.

Этого вполне достаточно, чтобы породить предположения:

Model 1
→ Model 2
→ будущие версии Claude?

Однако Anthropic не делает таких заявлений.

Более того, компания даёт довольно сдержанное описание Model 1.

Она сообщает, что Model 1 по возможностям примерно эквивалентна:

  • Claude Mythos Preview;
  • Claude Mythos 5.

Её внутреннее развертывание было относительно ограниченным.

Anthropic отмечает, что подавляющее большинство внутренних пользователей предпочитали Mythos 5, а использование Model 1 уже на дату охвата отчёта (15 июля) было низким и продолжало снижаться.

Компания также заявляет:

Ожидается, что Model 1 в будущем
не будет развернута внешне
или широко использоваться внутри

Таким образом, Model 1 выглядит скорее как внутренняя ветвь разработки или контрольная точка, а не как чётко определённый предшественник, ожидающий публичного выпуска.

Model 2 отличается от Model 1 в одном важном аспекте

Anthropic подходит к Model 2 заметно более осторожно.

Model 1 лишь кратко упоминается и в дальнейшем в значительной степени исключается из анализа рисков, поскольку Anthropic

считает Mythos 5 разумной верхней границей своего риска.

Напротив, Model 2 используется в большей части отчёта, поскольку она:

  • обладает более высокими общими возможностями;
  • чаще используется внутри компании;
  • имеет отношение к анализу передовых рисков Anthropic.

Согласно отчёту, внутреннее использование Model 2 аналогично использованию Mythos 5.

Это не доказывает неизбежность публичного выпуска.

Но это действительно указывает на то, что Model 2 занимает важное операционное положение внутри Anthropic.

Отчёт о рисках — причина, по которой модель стала известна общественности

Model 2 не была представлена через традиционный анонс о выпуске.

Она появилась потому, что Политика ответственного масштабирования Anthropic требует от компании проведения анализа рисков для систем, которые фактически разрабатываются и развертываются внутри компании.

Отчёт о рисках за август 2026 года охватывает деятельность Anthropic по состоянию на 15 июля 2026 года.

Anthropic перечисляет внутренние модели, когда они имеют отношение к таким вопросам, как:

  • риск рассогласования в средах с высокими ставками;
  • автоматизированные ИИ-исследования и разработки;
  • биологические и химические риски;
  • безопасность моделей;
  • внутренний мониторинг.

Именно поэтому в отчёте упоминается Model 2.

её больше информации, чем получил бы обычный неопубликованный модель.

Это раскрытие является прежде всего продуктом политики безопасности, а уже потом утечкой продукта.

Что нам рассказал отчёт, а что нет

Утверждение Статус
У Anthropic есть внутренняя модель под названием Модель 2 Подтверждено
Модель 2 ещё не выпущена Подтверждено
Модель 2 в целом немного сильнее Mythos 5 Подтверждено Anthropic
Модель 2 лучше Mythos 5 во всех областях Нет
Модель 2 набрала 62,8% в сравнении CoBench, показанном в отчёте Подтверждено данными отчёта
Mythos 5 набрала 50,3% в том же сравнении Подтверждено данными отчёта
Anthropic оценивает полное замещение технических сотрудников на CoBench примерно в 85% Подтверждено
Модель 2 активно используется внутри компании Подтверждено
Модель 2 прошла полный стандартный набор внешних оценочных тестов для релиза Нет
Anthropic в настоящее время планирует публичный запуск Модели 2 Нет
У Модели 2 есть официальное продуктовое название Claude Нет
Модель 1 — реальная внутренняя модель Подтверждено
Модель 1 точно является прямым предшественником Модели 2 Не установлено
Модель 1 планируется к публичному запуску Нет
Claude Mythos 5 открыта для всех Нет
Claude Fable 5 — это широко доступная версия, соответствующая Mythos 5 Подтверждено

Часто задаваемые вопросы

Что такое Модель 2 от Anthropic?

Модель 2 — это неопубликованная внутренняя передовая модель, раскрытая в отчёте о рисках Anthropic за август 2026 года. Anthropic заявляет, что она в целом немного сильнее Claude Mythos 5 и уже широко используется внутри компании для кодинга, генерации данных, исследований, инженерии и других агентных задач.

Лучше ли Модель 2, чем Claude Mythos 5?

В целом Anthropic говорит — да, но лишь немного. Компания также отмечает, что Модель 2 сильнее в одних областях и слабее в других, поэтому её не следует описывать как превосходящую во всём.

Каков результат Модели 2 в CoBench?

Сравнение, показанное в отчёте, демонстрирует, что Модель 2 набрала 62,8%, опередив Mythos Preview с 54,8% и Mythos 5 с 50,3%. Anthropic оценивает, что полностью способная модель

должна достигать как минимум примерно 85% для замещения технических специалистов по текущим оценкам.

Что оценивает CoBench?

CoBench — это внутренняя оценка Anthropic, основанная на исторических исследовательских и инженерных задачах, которые ранее решали технические специалисты компании. Модель получает исторические снимки, включая код, логи, внутренние сообщения и документацию, и должна диагностировать лежащую в основе техническую проблему.

Выпустит ли Anthropic Модель 2?

Anthropic заявляет, что в настоящее время не планирует публичный выпуск Модели 2. Компания не раскрыла продуктовое название, дату выхода, идентификатор API, цены или планы публичного доступа.

Является ли Модель 2 следующей моделью Claude Mythos?

Anthropic этого не утверждает. Модель 2 — это внутренний идентификатор, использованный в отчёте о рисках, и сопоставление его с будущим продуктовым названием Claude — чистое предположение.

Что такое Модель 1 от Anthropic?

Модель 1 — ещё одна внутренняя модель, раскрытая в том же отчёте. Anthropic заявляет, что она примерно аналогична Mythos Preview и Mythos 5, её внутреннее использование относительно низкое и снижается, и её не планируется разворачивать для внешних пользователей.

Была ли Claude Mythos 5 публично выпущена?

Не в общем доступе. Mythos 5 доступна через ограниченные доверенные программы доступа, такие как Project Glasswing, тогда как Claude Fable 5 использует ту же базовую модель, но с более строгими мерами безопасности и широко доступна.

Связанные инструменты

  • Claude:Универсальный ИИ-ассистент Anthropic для потребителей и профессионалов.
  • Claude API:Платформа разработчика Anthropic для общедоступных моделей Claude.
  • Anthropic Console:Официальное рабочее пространство для тестирования моделей Claude API и управления доступом разработчиков.
  • Project Glasswing:Программа доверенного доступа Anthropic для продвинутых кибербезопасных возможностей уровня Mythos.
  • Anthropic Transparency Hub:Центральный ресурс по оценкам безопасности моделей, системным карточкам и информации о рисках.

Связанные ссылки

Резюме

Отчёт о рисках Anthropic за август 2026 года раскрыл внутреннюю модель под названием Модель 2, которая уже

активно используется в исследованиях, инженерии, кодинге, генерации данных и постоянных агентных рабочих процессах.

Эта модель сильнее Claude Mythos 5 во внутренней оценке CoBench Anthropic, набрав 62,8% против 50,3%. Anthropic также заявляет, что Модель 2 в целом кажется немного сильнее, хотя в некоторых областях она уступает Mythos 5, и улучшение значительно меньше предыдущих крупных скачков возможностей.

В отчёте также упоминается Модель 1, но доказательств недостаточно, чтобы считать Модель 1 и Модель 2 подтверждённой публичной продуктовой линейкой. Внутреннее использование Модели 1 снижается, а Anthropic прямо заявляет, что сейчас не планирует публичный выпуск Модели 2.

Самый чёткий вывод — внутренний передовой уровень Anthropic уже слегка превзошёл Mythos 5 — но Модель 2 является внутренней исследовательской системой, а не выпущенным следующим поколением продуктов Claude.