ByteDance, по сообщениям, планирует запустить модель ИИ с более чем 5 триллионами параметров, последующие сообщения указывают на до 10 триллионов

Гонка передовых моделей в Китае вступает в эру триллионов параметров. Модель Qwen3.8-Max от Alibaba уже достигла 2,4 триллиона параметров, а Kimi K3 от Moonshot AI уже поднялась до

发布于 2026年8月7日generalGEO 评分: 03 次阅读
Это обложка статьи, заголовок которой показан на изображении. Фон выполнен в тёмных глубоких сине-чёрных тонах, украшен синими линиями и светящимися точками в технологическом стиле. В центре изображения чётко представлен основной заголовок, а на заднем плане сверху едва заметен логотип ByteDance. Содержание заголовка полностью соответствует теме статьи, наглядно подчёркивая ключевую информацию о планах ByteDance выпустить модель с 5 триллионами параметров.

Сообщается, что ByteDance планирует обучить ИИ-модель с более чем 5 триллионами параметров, позднее сообщения указывают на максимум 10 триллионов

Введение

Гонка передовых моделей Китая вступает в эру триллионов параметров.

Модель Qwen3.8-Max от Alibaba уже достигла 2,4 триллиона параметров, а Kimi K3 от Moonshot AI увеличила публично раскрытый масштаб до 2,8 триллиона параметров.

ByteDance, возможно, готовится к следующему скачку.

AIBase со ссылкой на LatePost сообщает, что ByteDance по состоянию на 7 августа 2026 года обсуждает обучение базовой модели с более чем 5 триллионами параметров. Согласно этому сообщению, проект всё ещё находится на ранней стадии, и нет гарантий, что итоговая модель будет выпущена.

Изображение — публикация LatePost с заголовком «#ByteDance обсуждает обучение модели с более чем 5 трлн параметров#». В тексте упоминается, что ByteDance обсуждает обучение модели с параметрами свыше 5 триллионов, что превышает Qwen 3.8-Max от Alibaba (2,4 трлн параметров) и K3 от Moonshot AI (2,8 трлн параметров), что делает её крупнейшей известной моделью в Китае. Новую модель возглавляет Сян Лян, руководитель Seed Foundation, в сотрудничестве с Шэнь Кэ, ответственным за данные предобучения больших языковых моделей. Seed перестраивает организационную структуру, распределяет обязанности и ресурсы. Изображение связано с содержанием документа об обсуждении ByteDance обучения модели с более чем 5 трлн параметров и является скриншотом репортажа LatePost.

Только по масштабу этот проект станет одним из крупнейших проектов ИИ-моделей в публичных сообщениях Китая.

Однако в тот же день появилось ещё одно важное обновление.

Вечером 7 августа Reuters со ссылкой на британскую Financial Times и осведомлённые источники сообщило, что ByteDance обучает модель с до 10 триллионов параметров, и модель уже находится на этапе предобучения. На тот момент ByteDance не дала публичных комментариев по этому сообщению.

Эти два сообщения не обязательно противоречат друг другу. Проект, изначально обсуждавшийся как «более 5 триллионов», в итоге может быть нацелен на более крупную конфигурацию. Но поскольку ByteDance официально не раскрыла архитектуру модели или количество параметров, все цифры в этой статье следует рассматривать как планы из сообщений, а не как подтверждённые характеристики модели.

Сообщается, что ByteDance движется к рубежу в 5 триллионов параметров

В оригинальном репортаже LatePost говорится, что ByteDance обсуждает модель с более чем 5 триллионами параметров.

Это значительно превысит масштабы, уже раскрытые несколькими передовыми китайскими моделями.

Модель Публично раскрытые суммарные параметры Статус
Qwen3.8-Max 2,4 триллиона Выпущена Alibaba
Kimi K3 2,8 триллиона Выпущена Moonshot AI
Сообщаемая модель ByteDance Более 5 триллионов Сообщаемый план
Последующие данные FT/Reuters До 10 триллионов Сообщается, официально не подтверждено

Moonshot AI официально описывает Kimi K3 как модель смеси экспертов с 2,8 триллиона параметров, с активацией 104 миллиардов параметров на каждый токен.

Reuters сообщало 3 августа, что Qwen3.8-Max от Alibaba содержит 2,4 триллиона суммарных параметров.

Если ByteDance в итоге обучит и развернёт модель с 5–10 триллионами параметров, это будет означать значительное увеличение общего масштаба моделей.

Но это не автоматически означает, что возможности модели будут в два-три раза выше.

Количество параметров не равно уровню интеллекта

Источники AIBase описывают модель с 5 триллионами параметров как находящуюся в том же классе величин, что и ведущие американские передовые системы, такие как GPT-5.6 или новейшие высококлассные модели Anthropic.

Это сравнение требует важной оговорки.

OpenAI и Anthropic не раскрывают публично точное количество параметров GPT-5.6, Claude Fable 5 или Claude Mythos 5.

Reuters в своём сообщении от 7 августа также высказала эту точку зрения: прямое сравнение масштабов с ведущими американскими системами затруднено, поскольку эти лаборатории не публикуют количество параметров своих моделей.

Количество параметров — лишь одно из измерений возможностей модели.

Производительность также зависит от:

  • Архитектуры модели
  • Количества активируемых параметров на токен
  • Качества обучающих данных
  • Количества токенов обучения
  • Фильтрации данных
  • Дизайна оптимизатора
  • Обучения с подкреплением
  • Постобучения
  • Использования инструментов
  • Вычислений во время тестирования
  • Архитектуры длинного контекста
  • Эффективности инференса

Это особенно важно для моделей смеси экспертов.

Разрежённая модель MoE может содержать триллионы суммарных параметров, но активировать лишь небольшую их часть на каждый токен.

Kimi K3 — хороший пример.

В её официальных спецификациях указано:

  • 2,8 триллиона суммарных параметров
  • 104 миллиарда активируемых параметров
  • 896 маршрутизируемых экспертов
  • 16 экспертов выбираются для каждого токена

Таким образом, общее количество весов — не то же самое, что объём вычислений, используемых на каждом шаге инференса.

ByteDance публично не раскрывала, использует ли сообщаемая модель аналогичную разрежённую архитектуру, а также сколько параметров будет активироваться на каждый токен.

Модель с 5 триллионами параметров потребует огромных вычислительных мощностей для обучения

В оригинальном репортаже в качестве примера масштаба использовались GPU NVIDIA H100.

Согласно оценкам, для обучения модели с 5 триллионами параметров потребуется примерно:

  • 100 000 GPU уровня H100, работающих 347 дней, или
  • 1 000 000 GPU, работающих около 35 дней

Оба сценария дают примерно одинаковый порядок величины суммарного времени ускорителей:

Сценарий Количество GPU Длительность Примерно GPU-дней
Долгосрочный кластер 100 000 347 дней 34,7 миллиона
Крупномасштабный краткосрочный кластер 1 000 000 35 дней 35 миллионов

Эти цифры следует понимать как приблизительные сценарные оценки от источников, а не как универсальную инженерную формулу.

Фактические потребности в обучении в значительной степени зависят от:

  • Архитектуры
  • Разрежённой или плотной активации
  • Количества токенов
  • Точности
  • Коэффициента использования FLOPs модели
  • Сохранения контрольных точек
  • Эффективности сети
  • Поколения аппаратного обеспечения
  • Стабильности обучения
  • Производительности конвейера данных
  • Неудачных запусков и перезапусков

Официальные спецификации NVIDIA H100 показывают, что TDP версии SXM может достигать 700 Вт и поддерживает крупномасштабное обучение трансформеров благодаря Transformer Engine архитектуры Hopper и инфраструктуре NVLink.

В масштабе сотен тысяч ускорителей только GPU-кластер достигает уровня, где электроэнергия, сеть, охлаждение и ёмкость центров обработки данных становятся первостепенными ограничениями.

Почему «1 миллион GPU» не означает, что ByteDance будет обучать именно так

Источники AIBase справедливо отмечают, что одновременный запуск 1 миллиона ускорителей уровня H100 был бы экстремальной инфраструктурной конфигурацией.

Более реалистичный проект, вероятно, распределит обучение на меньший, но всё равно огромный кластер.

Источники предполагают более близкий вариант:

  • 200 000–300 000 ускорителей
  • Работающих примерно три-четыре месяца

Это всё равно будет один из крупнейших тренировочных кластеров.

Один из самых амбициозных инженерных проектов по обучению моделей в истории человечества.

А предобучение — лишь один из этапов.

Передовой модели также потребуется время и вычислительные мощности для следующих шагов:

  1. Подготовка данных
  2. Эксперименты с архитектурой
  3. Исследования масштабирования
  4. Предобучение
  5. Оценка контрольных точек
  6. Контролируемое постобучение
  7. Обучение с подкреплением
  8. Тестирование безопасности
  9. Обучение инструментам и агентам
  10. Оптимизация обслуживания

Поэтому в оригинальной статье AIBase оценивается, что весь процесс займёт не менее полугода, а до появления зрелой модели общее время может приблизиться к году.

Позднее сообщение Financial Times (в изложении Reuters) сообщило, что модель уже находится на этапе предобучения, и отметило, что этот этап обычно занимает около трёх-шести месяцев, прежде чем последуют этапы тонкой настройки и выпуска.

Оба описания приводят к одному практическому выводу: проект такого масштаба — это долгосрочная инфраструктурная работа, а не модель, которая появится сразу после запуска первого тренировочного кластера.

У ByteDance есть ресурсы для такой попытки

Обучение такого масштаба — не только исследовательская задача.

Это также задача инфраструктуры и капитала.

ByteDance — одна из немногих китайских технологических компаний, обладающих достаточными финансовыми ресурсами, потребительскими каналами распространения, облачной инфраструктурой, ёмкостью центров обработки данных и командой ИИ-инженеров, чтобы серьёзно попытаться реализовать проект такого масштаба.

Официальная организация Seed этой компании охватывает следующие направления:

  • Предобучение базовых моделей
  • Пост-обучение
  • Обучение с подкреплением
  • Высокопроизводительный инференс
  • Распределённое обучение
  • Компиляция для гетерогенного оборудования
  • Мультимодальные модели
  • Агентные системы

Инфраструктурная команда ByteDance прямо описывает свою работу как охватывающую распределённое обучение, системы обучения с подкреплением, высокопроизводительный инференс и компиляторные технологии для базовых моделей.

В их рекрутинговых материалах также прямо упоминаются следующие направления работы:

  • Обучение сверхбольших масштабов
  • Стабильность обучения
  • Коэффициент использования FLOPs модели
  • Совместное проектирование программного и аппаратного обеспечения
  • Инференс на нескольких узлах
  • Параллелизация
  • Оптимизация планирования

Именно эти проблемы системной инженерии становятся критически важными при обучении моделей с триллионами параметров.

Количество GPU из источника — лишь оценочная величина, а не публично раскрытые данные

AIBase также приводит сторонние оценки масштабов доступных AI-вычислительных мощностей нескольких ведущих лабораторий.

Приблизительные цифры, упомянутые в статье:

  • OpenAI — около 2 миллионов GPU
  • Anthropic — около 620 тысяч
  • DeepSeek — около 60 тысяч

Эти числа не следует воспринимать как проверенные данные о запасах оборудования.

OpenAI и Anthropic не публикуют в открытом доступе актуальное количество всех доступных ускорителей в собственных мощностях, у облачных партнёров и в резервных мощностях.

Оценка DeepSeek примерно в 60 тысяч ускорителей изначально появилась в расчётах SemiAnalysis и с тех пор широко цитировалась в различных отчётах. Эти оценки включают смесь различных ускорителей — A100, H100, H800 и H20, а не однородный парк оборудования.

Более надёжным, чем любые точные цифры запасов, является более общий ключевой момент:

Разработка передовых моделей всё больше зависит от доступа к сверхмасштабным вычислительным мощностям, и по мере роста масштабов моделей разрыв между компаниями, обладающими сверхмасштабной инфраструктурой, и более мелкими лабораториями может стать очень значительным.

Речь идёт о росте до триллионов параметров.

Сравнение с H100 — лишь базовый ориентир

Использование эквивалента H100 упрощает обсуждение вычислений, но ByteDance вовсе не обязана полагаться на один тип ускорителей.

Крупные AI-компании могут использовать комбинацию:

  • H100
  • H200
  • Системы Nvidia поколения Blackwell
  • Чипы Nvidia для китайского рынка
  • Отечественные AI-ускорители
  • Кастомное оборудование
  • Несколько облачных и дата-центровых регионов

Более новые ускорители могут изменить количество физических GPU, необходимое для выполнения того же объёма обучающих вычислений.

Программное обеспечение не менее важно.

Улучшения в следующих областях:

  • Эффективность ядер
  • Степень параллелизма
  • Маршрутизация экспертов
  • Управление памятью
  • Коммуникация
  • Сохранение контрольных точек
  • Квантизация
  • Загрузка данных

Могут существенно изменить соотношение между общим масштабом модели и затратами на обучение.

Поэтому утверждение «модели X требуется ровно Y GPU» всегда следует рассматривать как сценарное допущение, а не как неизменное правило.

Почему ByteDance может нуждаться в столь крупной модели

Источник в основном описывает этот проект как попытку вывести уровень интеллекта Doubao на мировые передовые позиции.

Вероятно, это лишь часть мотивации.

Более крупная базовая модель может обеспечивать работу нескольких частей AI-экосистемы ByteDance.

Doubao

Doubao — один из основных потребительских AI-продуктов ByteDance на китайском рынке.

Более сильная базовая модель может улучшить:

  • Общие рассуждения
  • Работу со знаниями
  • Программирование
  • Поиск
  • Задачи с длинным контекстом
  • Агентное поведение
  • Мультимодальное взаимодействие

Исследования Seed

Сверхмасштабная модель также предоставит команде Seed новую исследовательскую платформу для изучения:

  • Законов масштабирования
  • Разрежённых архитектур
  • Обучения с подкреплением
  • Обучения агентов
  • Эффективности моделей
  • Памяти
  • Рассуждений на длинных временных горизонтах

Volcano Engine

ByteDance также может монетизировать возможности модели через корпоративные и облачные сервисы.

Таким образом, передовая модель имеет потенциальную ценность и помимо потребительского чат-бота.

Более крупная модель всё равно должна приносить экономическую отдачу

Последний вопрос в статье AIBase — самый важный.

Сможет ли модель с крайне высокой стоимостью обучения обеспечить соответствующую отдачу?

Ведущие лаборатории должны оплачивать не только финальный обучающий прогон.

Общие расходы могут включать:

  • GPU
  • Дата-центры
  • Электроэнергию
  • Сети
  • Хранилища
  • Зарплаты исследователей
  • Подготовку данных
  • Неудачные эксперименты
  • Пост-обучение
  • Инференс
  • Работу по безопасности
  • Интеграцию в продукты

Затем модель должна создавать ценность через некоторую комбинацию:

  • Потребительских подписок
  • Рекламы
  • Электронной коммерции
  • Корпоративных API
  • Облачных сервисов
  • Инструментов для повышения эффективности
  • Инструментов программирования
  • Агентов
  • Внутреннего повышения эффективности

Количество параметров имеет экономический смысл только тогда, когда оно преобразуется в полезные возможности при приемлемой стоимости инференса.

Вот почему в текущем поколении передовых моделей всё больше внимания уделяется эффективности масштабирования, а не просто общему числу параметров.

Например, общее число параметров Kimi K3 составляет 2,8 триллиона, но на каждый токен активируется лишь 104 миллиарда параметров. Moonshot AI заявляет, что их архитектура демонстрирует улучшенную эффективность масштабирования по сравнению с предыдущим поколением.

Таким образом, настоящая конкуренция — это не:

У кого больше параметров?

А скорее:

Кто сможет преобразовать наибольшую силу при наименьших ресурсах?

Преобразовать в наиболее полезный интеллект при устойчивых затратах на обучение и инференс?

Что подтверждено, а что остаётся на уровне сообщений

Подтверждено

  • Согласно информации от Moonshot AI, общее число параметров Kimi K3 составляет 2,8 триллиона.
  • Согласно сообщениям Alibaba и Reuters, общее число параметров Qwen3.8-Max составляет 2,4 триллиона.
  • Команда Seed от ByteDance занимается масштабным предобучением, пост-обучением, инференсом и модельной инфраструктурой.
  • Doubao — потребительский AI-продукт ByteDance.
  • NVIDIA H100 спроектирован для масштабного обучения трансформеров и рабочих нагрузок с триллионами параметров.

Сообщается, но не подтверждено официально ByteDance

  • ByteDance строит модель с более чем 5 триллионами параметров.
  • Конечная цель может достигать 10 триллионов параметров.
  • Точный масштаб обучающего кластера.
  • Общий объём требуемой вычислительной мощности в эквиваленте H100.
  • Финальная дата выпуска.
  • Будет ли модель в конечном итоге публично доступна.
  • Архитектура модели и количество активируемых параметров.

Невозможно проверить на основе публичных спецификаций моделей

  • Модель с 5 триллионами параметров автоматически относится к «уровню GPT-5.6».
  • Только количество параметров позволяет предсказать уровень интеллекта модели.
  • Точное количество параметров моделей уровня GPT-5.6 или Fable/Mythos от Anthropic.
  • Точный текущий запас GPU у OpenAI или Anthropic.

Часто задаваемые вопросы

Действительно ли ByteDance обучает модель с 5 триллионами параметров?

AIBase ссылается на сообщение LatePost о том, что ByteDance обсуждает модель с более чем 5 триллионами параметров. Позже в тот же день Reuters со ссылкой на Financial Times сообщило, что ByteDance уже предобучает модель, которая может достигать 10 триллионов параметров. ByteDance официально не подтвердила точные цифры.

Будет ли эта модель обеспечивать работу Doubao?

Источник предполагает, что модель усилит экосистему Doubao от ByteDance, но ByteDance официально не объявляла, как будет развёрнута модель из сообщения. Передовая модель также может поддерживать корпоративные API, агентов, исследования и другие продукты ByteDance.

Обязательно ли модель с 5 триллионами параметров лучше Kimi K3 или Qwen3.8-Max?

Не обязательно. Общее количество параметров напрямую не определяет качество модели. Архитектура, активируемые параметры, обучающие данные, пост-обучение, обучение с подкреплением, рассуждения во время инференса и использование инструментов могут быть не менее важны.

Сколько параметров у Kimi K3?

Moonshot AI официально объявила, что общее число параметров Kimi K3 составляет 2,8 триллиона, а активируемых параметров — 104 миллиарда. Она использует разрежённую архитектуру смеси экспертов (MoE).

Сколько параметров у Qwen3.8-Max?

Согласно сообщениям Alibaba и Reuters, общее число параметров Qwen3.8-Max составляет 2,4 триллиона. Она также основана на разрежённой модели, а не на активации всех параметров для каждого токена.

Сколько GPU H100 потребуется для обучения модели с 5 триллионами параметров?

Источник приводит приблизительный сценарий, эквивалентный примерно 35 миллионам GPU-дней H100, например, 100 тысяч H100 в течение 347 дней или 1 миллион H100 примерно за 35 дней. Фактические потребности могут сильно различаться в зависимости от архитектуры, точности, коэффициента использования, количества токенов, оборудования и эффективности обучения.

Есть ли у GPT-5.6 5 триллионов параметров?

OpenAI не раскрывает публично количество параметров GPT-5.6. Любое утверждение о параметрах GPT-5.6

Прямое числовое сравнение с той или иной моделью

По сообщениям, модель компании ByteDance пока остаётся предметом предположений.

Когда ByteDance может выпустить эту модель?

На данный момент официальная дата выпуска не объявлена. Reuters, ссылаясь на публикацию Financial Times, сообщает, что модель находится на этапе предварительного обучения, который может занять несколько месяцев, после чего потребуются дополнительная настройка, оценка и развёртывание.

Связанные инструменты

  • ByteDance Seed: официальный исследовательский институт ByteDance и центр моделей для фундаментальных моделей, мультимодальных систем и исследований в области ИИ.
  • ByteDance Seed LLM: официальный обзор работы ByteDance в области предварительного обучения, постобучения,推理, памяти, обучения и исследований фундаментальных моделей.
  • 豆包: потребительский ИИ-ассистент ByteDance, один из основных продуктов, которые могут выиграть от более мощной фундаментальной модели.
  • Kimi: официальная продуктовая платформа Moonshot AI и точка доступа к семейству моделей Kimi.
  • 通义千问: официальный портал моделей Qwen и продуктов Alibaba.
  • NVIDIA H100: официальные характеристики ускорителя H100 и информация о производительности для обучения от NVIDIA.

Связанные ссылки

Резюме

По сообщениям, ByteDance готовит сверхмасштабную фундаментальную модель, которая превысит по масштабу все публично раскрытые китайские модели. AIBase и 晚点LatePost первоначально описывали этот проект как модель с более чем 5 триллионами параметров, а более поздние сообщения Reuters/Financial Times в тот же день указывали, что модель может достичь 10 триллионов параметров и уже находится на стадии предварительного обучения.

Проект такого масштаба потребует огромных вычислительных ресурсов. Приведённый в источниках пример с H100 соответствует примерно 35 миллионам GPU-дней, однако фактические потребности в обучении зависят от архитектуры, активных параметров, поколения оборудования, коэффициента использования и эффективности обучения.

Более важный вопрос не в том, сможет ли ByteDance построить самую большую модель. Общее количество параметров — неполный показатель интеллекта, особенно для разреженных систем смеси экспертов.

Настоящее испытание заключается в том,

сможет ли ByteDance превратить вычислительные мощности триллионного масштаба в модель, которая будет значительно лучше по производительности, достаточно эффективна для обслуживания и достаточно ценна, чтобы оправдать стоящую за ней инфраструктуру.

字节跳动据报计划推出5万亿以上参数AI模型,后续报道指向最高达10万亿