Kimi K3 теперь с открытыми весами: исследуем передовую модель Moonshot AI с 2,8 трлн параметров

Moonshot AI выполнила своё обещание, выпустив полные веса модели Kimi K3 — своей самой крупной и амбициозной на сегодняшний день. Модель уже доступна в официальных репозиториях Moonshot AI на Hugging Face и GitHub, в сопровождении подробного технического отчёта и сопутствующих инфраструктурных проектов. Kimi K3 — это нативная мультимодальная модель-смесь экспертов с общим числом параметров 2,8 трлн, активирующая примерно 104 млрд параметров на каждый токен и обладающая контекстным окном в 1 млн токенов. Moonshot

发布于 2026年7月30日generalGEO 评分: 08 次阅读
Это рекламное визуальное изображение от Moonshot AI, посвящённое запуску большой модели Kimi K3, выполненное в тёмном чёрном фоне с фиолетово-синим технологическим дизайном. В центре выделяется белый текст «Kimi K3 Is Now Open-Weight», сверху расположен полупрозрачный логотип «Kimi», а снизу — брендовое название «moonshot AI». Справа находится светящаяся фиолетовая технологическая иконка замка с геометрическими узорами соединений, парящая на платформе с ореолом, окружённая точечными следами. Слева изображена карточка модели с символами кода, подчёркивающая характеристику открытых весов этой передовой модели с 2,8 трлн параметров.

Kimi K3 теперь с открытыми весами: исследование前沿ной модели Moonshot AI с 2,8 триллиона параметров

Введение

Moonshot AI выполнила свое обещание, официально выпустив полные веса своей самой масштабной и амбициозной модели — Kimi K3.

Модель уже доступна для загрузки через официальные страницы Moonshot AI на Hugging Face и GitHub, вместе с подробным техническим отчетом и сопутствующим инфраструктурным проектом.

Kimi K3 — это native мультимодальная модель смеси экспертов, обладающая 2,8 триллионами общих параметров, активируя около 104 миллиардов параметров на токен и имея контекстное окно в 1 миллион токенов.

Moonshot позиционирует её как frontier-модель с открытыми весами, предназначенную для долгосрочного программирования, исследований, мультимодального понимания, агентной работы со знаниями и задач рассуждения, которые могут включать сотни или тысячи шагов.

Значимость этого релиза двойственна.

Во-первых, сама модель выводит масштаб открытых весов на уровень в 3 триллиона параметров.

Во-вторых, Moonshot раскрыла гораздо больше, чем просто контрольные точки модели. Публичные материалы детально описывают её архитектуру, стратегию пост-тренировки, инфраструктуру обучения с подкреплением на длинных контекстах, систему обучения с экспертной параллелизацией, оптимизацию вывода, результаты бенчмарков и несколько долгосрочных инженерных кейсов.

Это изображение показывает страницу проекта GitHub, где Moonshot AI опубликовала открытую модель Kimi K3. Ветка проекта — main, всего 1 ветка, 0 тегов, последний коммит сделан 7 минут назад. На странице видны папка assets, файлы LICENSE, README.md, а также файл технического отчета k3_tech_report.pdf. Это те сопутствующие материалы, которые упоминаются в документе как опубликованные вместе с Kimi K3. Пользователи могут просмотреть содержимое кода проекта с помощью кнопки "Code".

Полные веса Kimi K3 теперь доступны

Ранее Moonshot объявила о запуске Kimi K3 и пообещала выпустить полные веса до 27 июля 2026 года.

Этот релиз состоялся.

Официальную модель можно получить по следующим каналам:

Репозиторий на GitHub содержит файл README, лицензию Kimi K3, полный технический отчет, ресурсы по архитектуре и бенчмаркам, руководство по развертыванию и инструкции по использованию модели.

Карточка модели на Hugging Face предоставляет конфигурацию модели и доступ к опубликованным весам.

Это означает, что модель превратилась из управляемой фронт-системы с планами открытого выпуска в модель, которую исследователи и квалифицированные инфраструктурные команды могут фактически загружать, проверять, развертывать, дообучать и адаптировать в соответствии с условиями лицензии Kimi K3.

Изображение показывает информацию о Kimi K3. Kimi K3 доступна сегодня на Kimi.com, Kimi Work, Kimi Code и Kimi API. При запуске Kimi K3 будет по умолчанию использовать максимальное усилие рассуждения, в будущих обновлениях будут внедрены режимы низкого и высокого усилия. В настоящее время ведется тесное сотрудничество с партнерами по рассуждению и мейнтейнерами открытого исходного кода для обеспечения согласованности технических деталей и надежного развертывания экосистемы. Полные веса модели будут опубликованы 27 июля 2026 года, подробности архитектуры, обучения и оценки будут опубликованы вместе с техническим отчетом Kimi K3.

Что означает "открытость" Kimi K3

Kimi K3 лучше всего описать как модель с открытыми весами и публичным кодом и документацией.

Лицензия предоставляет широкие права, позволяя пользователям использовать, копировать, модифицировать, дообучать, развертывать, создавать производные работы, распространять, сублицензировать и продавать копии в соответствии с условиями лицензии.

Однако,

лицензия содержит дополнительные коммерческие требования.

Например, компания, управляющая бизнесом Model-as-a-Service, общий доход которой за любые 12 последовательных месяцев превышает 20 миллионов долларов США, должна сначала заключить отдельное соглашение с Moonshot AI перед использованием Kimi K3 или её производных в коммерческих целях.

Лицензия также содержит требования к отображению для определенных очень крупных коммерческих продуктов или услуг, превышающих указанные лимиты пользователей или дохода.

Внутреннее использование и использование через официальные продукты Moonshot или сертифицированных партнеров по выводу регулируется отдельно.

Поэтому любой, кто намерен использовать Kimi K3 в коммерческих целях, должен внимательно прочитать фактическую лицензию, а не предполагать, что она эквивалентна Apache 2.0, MIT или другим стандартным разрешительным лицензиям.

Модель с 2,8 триллионами параметров и 104 миллиардами активированных параметров

Общий объем Kimi K3 чрезвычайно велик, но её архитектура смеси экспертов (MoE) означает, что не каждый токен активирует все 2,8 триллиона параметров.

Официальная карточка модели приводит следующую информацию:

Спецификация Kimi K3
Архитектура Смесь экспертов (MoE)
Общее количество параметров 2,8T
Количество активированных параметров 104B
Количество слоев 93
Количество плотных слоев 1
Количество маршрутизированных экспертов 896
Количество экспертов, выбираемых на токен 16
Количество общих экспертов 2
Размер словаря 160K
Длина контекста 1 048 576 токенов
Визуальный энкодер MoonViT-V2
Количество параметров визуального энкодера 401M
Метод квантования MXFP4 веса / MXFP8 активации
Модальности Текст и изображения

Технический отчет дает более точное сравнение архитектуры с Kimi K2.

Изображение представляет собой таблицу сравнения архитектур Kimi K2 и Kimi K3, показывающую различия в количестве слоев, общих параметрах, активированных параметрах, скрытых размерностях, размерностях экспертов и т.д. У Kimi K3 количество слоев, общих параметров, активированных параметров и размерностей экспертов увеличено, например, количество слоев увеличилось на 52%, общие параметры — на 167%, активированные параметры — на 220% и т.д. Также Kimi K3 представила новые механизмы внимания и residual, а также изменения в длине контекста обучения, механизмах внимания и функциях активации. Эта таблица напрямую связана с контекстом, наглядно демонстрируя архитектурные улучшения Kimi K3 по сравнению с Kimi K2.

По сравнению с Kimi K2, K3 увеличила глубину модели и разреженность экспертов, одновременно внедрив новые механизмы внимания и residual.

Moonshot заявляет, что общая эффективность масштабирования улучшена примерно в 2,5 раза благодаря комплексным улучшениям архитектуры и методов обучения на основе Kimi K2.

Это утверждение относится к эффективности, с которой дополнительные вычислительные мощности преобразуются в возможности модели, а не к общему 2,5-кратному увеличению скорости вывода.

Native мультимодальность и контекстное окно в миллион токенов

Kimi K3 спроектирована как native мультимодальная модель, а не как языковая модель, к которой в конце обучения был подключен визуальный модуль.

Её визуальный энкодер MoonViT-V2 имеет около 401 миллиона параметров.

Технический отчет указывает, что MoonViT-V2 был обучен с нуля с использованием цели предсказания следующего токена модели, а не инициализирован из контрастно предобученной визуальной модели, такой как SigLIP.

Moonshot сообщает, что этот подход оставался стабильным в процессе обучения и достиг конкурентоспособной визуальной производительности.

![Изображение показывает

В экспериментах по аблированию предварительного обучения ИИ показано изменение нормы градиента визуальной башни в зависимости от количества шагов обучения для разных моделей. Рисунок (a) показывает полную траекторию обучения, рисунок (b) — увеличенный фрагмент шагов с 14k по 16k. Синяя линия представляет MoonViT-3D, инициализированную из SigLIP, красная линия — MoonViT-V2, обученную с нуля. По сравнению с моделью, инициализированной из SigLIP, MoonViT-V2, обученная с нуля, поддерживает более низкую норму градиента и имеет меньше колебаний, что указывает на более стабильную оптимизацию. Этот график тесно связан с контекстом и наглядно демонстрирует стабильность MoonViT-V2 в процессе обучения.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/63b386e9-0be5-4813-a254-4665269d9469-a3cea91a-babc-4ab7-9d22-af510c0efa46.jpeg)

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/b6691c45-6229-4970-8a27-4e5a6deb00e1-dc511091-a635-4fc2-a80b-ab2e008b1415.png)

Длина контекста, поддерживаемая этой моделью:

1 048 576 токенов

Этот масштаб особенно важен для систем агентов, поскольку длительная задача кодирования или исследования может накапливать содержимое репозитория, выводы инструментов, журналы, скриншоты, исследовательские материалы, промежуточные планы, записи о неудачных тестах, предыдущие результаты рассуждений и многораундовые исправления.

Контекст из миллиона токенов не устраняет необходимость управления контекстом, но он позволяет K3 сохранять гораздо больший объем истории работы, чем традиционные системы с коротким контекстом.

Три основных архитектурных изменения

В техническом отчете масштабируемость и стабильность K3 объясняются несколькими архитектурными изменениями.

Наиболее значимыми из них являются три:

  1. Гибридный механизм внимания KDA + гейтированный MLA.
  2. Остаточное внимание.
  3. Стабильная латентная модель смеси экспертов.

Изображение показывает архитектуру Kimi K3, разделенную на три части. Слева — модули Stable Normalized LatentMoE и KDA, включающие Shared Expert, Routed Expert, Router, Linear, Norm и другие компоненты. Справа вверху — операция AttnRes с Output, Stable LatentMoE, Gated MLA, Stable LatentMoE, KDA и др. Справа — магистраль Block Attention Residuals с Block n-1, Block n-2, Block n-3 и др. Этот рисунок тесно связан с контекстом и наглядно показывает модульную структуру трех основных изменений в архитектуре Kimi K3.

1. Гибридный механизм внимания: KDA + гейтированный MLA

Kimi K3 использует гибридную конструкцию внимания.

В официальной карточке модели указано:

69 слоев KDA + 24 слоя гейтированного MLA

Эта архитектура следует повторяющемуся шаблону, в котором несколько слоев внимания Kimi Delta чередуются с периодическими слоями гейтированного многоголового латентного внимания.

Внимание Kimi Delta

KDA — это механизм линейного внимания, предназначенный для снижения нагрузки на память и вычисления, связанные с очень длинным контекстом.

Вместо традиционного KV-кеша, который растет с каждым токеном, как в стандартном полном внимании, KDA поддерживает рекуррентное состояние.

Это делает его привлекательным для последовательностей из миллиона токенов.

Ранее Moonshot представила KDA через серию исследований линейного внимания Kimi, и команда сообщила, что по сравнению с полным вниманием KDA снижает потребности в KV-кеше и увеличивает пропускную способность декодирования длинного контекста в условиях их оценки.

Гейтированный MLA

K3 не полностью заменяет глобальное внимание.

Периодические слои гейтированного MLA сохраняют способность модели глобально извлекать информацию в контексте.

Таким образом, эта гибридная конструкция пытается сбалансировать две цели:

  • Эффективная обработка длинных последовательностей.
  • Мощное глобальное извлечение.

Идея заключается не в том, что линейное внимание всегда лучше глобального, а в том, что каждый механизм обрабатывает разные части проблемы длинного контекста.

2. Остаточное внимание

Глубокие нейронные сети должны передавать информацию через множество уровней, избегая постепенной потери полезных представлений.

Kimi K3 вводит остаточное внимание (AttnRes), чтобы изменить способ передачи информации в глубине.

Этот механизм не полагается на единый последовательный остаточный поток, а позволяет последующим модулям выборочно извлекать представления, созданные предыдущими модулями.

Концептуально это дает сети механизм обучения, позволяющий ей решать, какая ранняя информация должна оставаться непосредственно доступной.

Цель — улучшить поток информации в модели из 93 слоев, не заставляя каждый признак строго проходить через один и тот же остаточный путь.

3. Стабильная LatentMoE

Kimi K3 значительно увеличивает разреженность MoE.

Модель содержит:

896 маршрутизируемых экспертов

Но каждый токен активирует только:

16 маршрутизируемых экспертов

Кроме того, модель включает двух общих экспертов.

Это приводит к очень большому общему количеству параметров модели, но активные вычисления значительно меньше общего количества параметров.

При такой разреженности стабильность обучения и баланс экспертов становятся сложными проблемами.

Конструкция стабильной LatentMoE от Moonshot включает несколько механизмов, предназначенных для решения этих проблем.

SiTU-GLU

Kimi K3 заменяет SwiGLU на SiTU-GLU — функцию активации, предназначенную для предотвращения неограниченного роста при экстремальном масштабировании.

Изображение показывает структуру Gate branch и Up branch для GLU, SwiGLU и SiTU-GLU, а также их скалярные отклики. Все ветви получают скалярный вход x, кривые имеют общую область определения x ∈ [−10, 100], в правом нижнем углу показана увеличенная область вблизи нуля. При β1 = 4, β2 = 25 кривая SiTU-GLU близка к SwiGLU вблизи нуля, и при больших положительных x функция |f(x)| ≤ β1β2 = 100, в то время как SwiGLU по-прежнему неограничен. Этот рисунок связан с контекстом, в котором описывается замена SwiGLU на SiTU-GLU в Kimi K3 для предотвращения неограниченного роста при экстремальном масштабировании.

Квантильное выравнивание

Система также использует метод балансировки нагрузки на основе динамического смещения маршрутизации, а не полагается исключительно на традиционные вспомогательные функции потерь для выравнивания.

Цель — сделать распределение токенов по экспертам после маршрутизации более равномерным, не внося чрезмерных помех в обучение.

Обучение агентов с миллионом токенов

В техническом отчете Kimi K3 особое внимание уделяется пост-обучению для длительных агентов.

Модель обучалась в трех областях:

  • Общие рассуждения.
  • Общие задачи агентов.
  • Агенты программирования.

Она также поддерживает несколько уровней детализации рассуждений:

  • Низкий.
  • Высокий.
  • Максимальный.

Окончательная модель комбинирует несколько специализированных стратегий с помощью многоэкспертной онлайн-дистилляции политик (MOPD).

Moonshot не обучает отдельные постоянные модели для каждой области и уровня детализации, а обучает специализированные модели-учителя и интегрирует их поведение в единую политику K3.

AgentENV: Длительная песочница для обучения

В техническом отчете описана AgentENV — инфраструктурный уровень, созданный для развертывания постоянных агентов.

Система использует Firecracker

Микро-виртуальная среда, позволяющая агенту выполнять длительные последовательности операций в воспроизводимой песочнице.

Обучающая задача может включать:

  1. Чтение файлов.
  2. Написание кода.
  3. Запуск команд.
  4. Открытие приложений.
  5. Снятие скриншотов.
  6. Использование симулированных рабочих инструментов.
  7. Отладку ошибок.
  8. Возврат после длительной задержки.
  9. Продолжение выполнения из предыдущего состояния среды.

Это отличается от обучения с подкреплением, основанного на коротких раундах вопросов и ответов.

Агент может выполнять сотни вызовов инструментов и поддерживать состояние в симулированной среде в течение нескольких виртуальных дней.

Исходная статья описывает симулированную среду, включающую такие приложения, как Slack, Notion и Gmail.

Основная сложность обучения — устойчивость: состояние как среды, так и длинного контекста модели должно оставаться доступным.

В ходе длительного развёртывания.

Синтез задач на основе графа знаний

Длительное циклическое обучение также требует большого количества сложных задач.

Moonshot описывает конвейер генерации задач, организованный вокруг иерархического графа знаний.

Этот граф охватывает компьютерные науки, искусственный интеллект, программирование, математику, физику, химию, биомедицину и гуманитарные науки.

Связанные концепции могут быть выбраны вместе, извлечены соответствующие открытые материалы, а затем из них синтезированы новые задачи для оценки или обучения.

Цель графа — создание задач, требующих фактического использования инструментов и многошаговых рассуждений, а не простого запоминания ответов.

Инфраструктура для MoE-модели уровня 3T

Модель с 2,8 трлн параметров и контекстным окном в миллион токенов невозможно эффективно обучить и обслуживать только за счёт архитектуры.

Технический отчёт Moonshot описывает системную работу, охватывающую ядра KDA, контекстный параллелизм, параллелизм экспертов, управление памятью, планирование длительных циклов RL, кэширование префиксов, спекулятивное декодирование и контроль допуска обслуживания.

Часть из этого уже опубликована.

MoonEP: сбалансированный параллелизм экспертов

MoonEP — открытая библиотека связи для параллелизма экспертов от Moonshot.

В обучении MoE маршрутизация может быть крайне несбалансированной.

Из-за предпочтений маршрутизатора к определённым экспертам один ранг может получить значительно больше токенов, чем другой. В этом случае самое быстрое устройство вынуждено ждать самое медленное.

MoonEP использует динамических избыточных экспертов для решения этой проблемы.

Он может создавать временные копии экспертов в зависимости от текущей схемы маршрутизации, поддерживая баланс рабочей нагрузки токенов между рангами.

Проект описывает свою цель как поддержание точной загрузки токенов на каждом ранге при сокращении накладных расходов на связь.

Это критически важно в масштабе K3, поскольку распределение 896 экспертов по крупному кластеру создаёт огромные проблемы синхронизации.

FlashKDA: высокопроизводительное ядро KDA

FlashKDA предоставляет высокопроизводительные ядра внимания Kimi Delta на основе CUTLASS.

Текущие требования открытого репозитория включают:

SM90 или новее
CUDA 12.9 или новее
PyTorch 2.4 или новее

Репозиторий содержит тесты корректности и эталонные данные для поддерживаемого оборудования.

FlashKDA призван ускорить механизм внимания, делающий архитектуру длинного контекста K3 практичной.

Родная квантизация MXFP4

Kimi K3 использует обучение с учётом квантизации, начиная с этапа контролируемой тонкой настройки.

Официальная конфигурация указывает:

Веса MXFP4
Активации MXFP8

Это отличается от обучения полноценной высокоточной модели с последующей квантизацией после обучения.

Модель обучается работать непосредственно с этими форматами пониженной точности в процессе конвейера.

Это помогает снизить затраты памяти и связи.

Требования, но это не превращает модель в 2,8T в обычную настольную модель.

Можно ли запустить Kimi K3 локально?

Веса открыты, но "можно скачать" не означает "можно легко запустить на ноутбуке".

Общее количество параметров Kimi K3 составляет 2,8 триллиона.

Даже с разреженной активацией и форматами низкой разрядности для запуска полной модели требуется значительная агрегированная память ускорителей, высокоскоростное межсоединение устройств, параллелизм экспертов, совместимый движок вывода и эффективная поддержка KDA, MLA и MoE.

Официальный репозиторий Moonshot рекомендует:

  • vLLM
  • SGLang
  • TokenSpeed, используемый в схеме развёртывания Moonshot

Экосистема всё ещё быстро развивается. Поддержка может зависеть от конкретных схем, ядер, режимов квантизации и оборудования.

Перед созданием самостоятельной среды убедитесь в актуальности документации по развёртыванию Kimi K3; не предполагайте, что стандартные настройки обслуживания Transformer будут работать.

Для большинства частных лиц и небольших команд использование размещённого API может быть значительно проще, чем запуск полной модели.

API Kimi K3 и уровень усилий при рассуждении

Moonshot также предоставляет Kimi K3 через свою официальную API-платформу:

https://platform.kimi.ai/

Идентификатор модели:

kimi-k3

Kimi K3 использует возможность рассуждения и возвращает поле reasoning_content.

Официальная карточка модели описывает три уровня усилий при рассуждении:

low
high
max

Важная деталь реализации — сохранённая история размышлений.

Для многораундовых рабочих процессов агента Moonshot указывает, что разработчики должны передавать полное предыдущее сообщение ассистента (включая reasoning_content, content и tool_calls) в следующий запрос.

Отбрасывание части этого состояния может нарушить непрерывность, поскольку обучение K3 требует сохранения истории рассуждений.

Производительность в тестах

Технический отчёт Moonshot оценивает Kimi K3 в области рассуждений и знаний, программирования, рабочих процессов агента и зрения.

Собственный набор тестов компании ставит K3 в ряд сильнейших доступных моделей, опережая многие системы с открытыми весами и проприетарные системы по определённым задачам.

В то же время в отчёте прямо указано, что модель в целом всё ещё отстаёт от сильнейших проприетарных систем, в частности Claude Fable 5 и GPT-5.6 Sol.

Это уточнение важно.

Утверждение не в том, что K3 побеждает во всех тестах.

Более обоснованный вывод заключается в том, что Kimi K3 выводит открытые веса на уровень производительности, который до недавнего времени был в основном связан с передовыми проприетарными системами.

Изображение представляет собой таблицу, сравнивающую производительность Kimi K3 с Claude Fable 5, GPT-5.6 Sol, GLM-5.2 и другими моделями в таких областях, как рассуждения и знания, программирование, рабочие процессы агента и зрение. В таблице лучший результат выделен жирным шрифтом, второй лучший — подчёркиванием. Например, в области рассуждений и знаний Kimi K3 показывает выдающиеся результаты в задачах GQA OpenWorld, Critiq, ACLRC, в некоторых задачах превосходя Claude Fable 5 и другие модели. Эта таблица тесно связана с контекстом и наглядно демонстрирует производительность Kimi K3 в различных задачах.

Множество сравнительных тестов также зависят от различных инструментов агента, включая Kimi Code, Claude Code, Codex и официальные инструменты тестирования.

Поэтому оценки в тестах агента не следует интерпретировать как чистую меру способностей модели.

На результаты существенно влияют окружающие инструменты, подсказки, управление контекстом, механизмы отката и оценщики.

Практический пример длительного цикла программирования

В отчёте приводится несколько примеров, призванных продемонстрировать, что K3 способна выполнять сложные инженерные задачи, далеко выходящие за рамки короткого дополнения кода.

Эти примеры предоставлены разработчиками модели и должны рассматриваться как демонстрация, а не как общая гарантия производительности.

MiniTriton: создание системы GPU-программирования

Moonshot сообщает, что Kimi K3 разработал MiniTriton — компактную систему GPU-программирования, подобную Triton.

Этот проект включает промежуточное представление, конвейер компилятора, генерацию PTX, языки фронтенда, компоненты среды выполнения, оптимизацию ядер GPU и примитивы для распределённого обучения.

Изображение демонстрирует пример вычислений на GPU с использованием компилятора MiniTriton на NVIDIA L20 GPU для Kimi K3. Графики производительности ядер CUDA и тензорных ядер, а также кривые сходимости MiniTriton и torch eager, распределённых примитивов MiniTriton (NCCL) и обучения на одном GPU. График ядер CUDA сравнивает производительность компиляторов train, gpt, torch eager и других; график тензорных ядер сравнивает производительность train, gpt и других; кривые сходимости показывают изменение потерь при обучении для MiniTriton и torch eager, а также для распределённых примитивов MiniTriton и обучения на одном GPU.

Moonshot сообщает, что K3 также оптимизирует сложные ядра, связанные с его собственной архитектурой, и достигает значительного ускорения на выбранных ядрах.

Это демонстрирует ожидаемое поведение модели: проверка сложной кодовой базы, анализ производительности, написание низкоуровневого кода, бенчмаркинг результатов и итеративное улучшение.

Однако это не означает, что каждый созданный моделью компилятор или ядро можно полностью доверять без проверки и тестирования человеком.

48-часовой эксперимент по проектированию чипа

В другом исследовании Kimi K3 был помещён в изолированную среду на 48 часов и получил задание создать прототип чипа для вывода небольшой модели, чья концепция проектирования схожа с описанной выше архитектурой.

Модель использовала инструменты автоматизации проектирования электроники с открытым исходным кодом и библиотеку стандартных ячеек Nangate 45 нм.

Moonshot сообщает, что финальный дизайн симуляции был выполнен в рамках бюджета площади анализа в 4 квадратных миллиметра, достигнуто замыкание временных характеристик на частоте 100 МГц, проект содержит около 1,46 миллиона стандартных ячеек, использует 0,277 МиБ SRAM и достигает пропускной способности декодирования более 8700 токенов в секунду в RTL-симуляции.

Изображение представляет прототип чипа для вывода, спроектированный Kimi K3. Как раннее концептуальное доказательство, Kimi K3 следует той же архитектуре, включая гибридный KDA и механизм внимания NoPE-MLA, Block AttnRes, маршрутизацию MoE на основе сигмоида и т.д. В рамках бюджета площади анализа 4 мм² дизайн замыкает временные характеристики на частоте 100 МГц, содержит около 1,46 миллиона стандартных ячеек, 0,277 МиБ SRAM, массив MAC INT4 с интегрированным деквантизатором, пропускная способность декодирования в RTL-симуляции превышает 8700 токенов/с. Дизайн был создан, оптимизирован и проверен с помощью Kimi Code в рамках 48-часового автономного запуска, код доступен на GitHub.

Это основанное на симуляции концептуальное доказательство, а не серийный чип.

Научное кодирование и астрофизика

K3 также был оценён в задаче воспроизведения результатов в вычислительной астрофизике.

Moonshot сообщает, что модель прочитала и перекрёстно проверила более 20 научных статей, реализовала полный численный пайплайн, оценила более 300 уравнений состояния, выявила несоответствия в опубликованных формулах, написала более 3000 строк кода на Python и создала интерактивную HTML-панель.

![Изображение демонстрирует достижения Kimi K3 в научном кодировании. Для воспроизведения универсального соотношения I-Love-Q в вычислительной астрофизике Kimi K3 проанализировал более 20 статей, перекрёстно проверил результаты, реализовал полный численный пайплайн, оценил более 300 наборов уравнений состояния, обнаружил несоответствия в общедоступных формулах, написал более 3000 строк кода на Python и создал интерактивную HTML-панель примерно за 2 часа, в то время как опытному исследователю обычно требуется 1-2 недели. Это изображение тесно связано с контекстом и наглядно показывает конкретные результаты Kimi K3 в задаче научного кодирования.]

Сообщается, что вышеуказанная автономная работа заняла около двух часов, в то время как опытному исследователю обычно требуется от одной до двух недель.

Для научной работы независимая проверка остаётся критически важной. Модель может сгенерировать полный пайплайн, но всё ещё может содержать тонкие ошибки в предположениях, единицах измерения, численных методах, цитировании или интерпретации.

Оценка кибербезопасности

В техническом отчёте также обсуждается оценка в сфере кибербезопасности.

Moonshot сообщает, что Kimi K3 обнаружил ранее неизвестную уязвимость в ядре Linux в ходе контролируемого тестирования безопасности, и соответствующие находки были проверены экспертами-людьми.

Смысл не в том, что K3 следует использовать для неконтролируемых наступательных операций в сфере безопасности.

Скорее, это указывает на то, что модели кодирования с длинным циклом всё лучше читают большие кодовые базы, отслеживают низкоуровневое поведение, формулируют гипотезы, проверяют их, корректируют методы и продолжают продвигаться после неудачных попыток.

Эти возможности могут поддерживать оборонительный аудит и проверку безопасности кода, но также делают более важными авторизацию, изоляцию в песочнице, контроль доступа и надзор человека.

Стоимость и эффективность

Ценность модели определяется не только оценками в бенчмарках.

Длинноцикловые агентные системы могут генерировать миллионы токенов для одной задачи.

Таким образом, стоимость зависит от длины ввода, длины вывода, сложности вывода, коэффициента попадания в кэш, количества вызовов инструментов, количества повторов, управления контекстом и провайдера вывода.

Технический отчёт Moonshot содержит сравнение оценок и затрат для нескольких агентных бенчмарков.

Эти диаграммы показывают, что K3 обладает относительной экономической эффективностью на некоторых тестовых нагрузках.

Не следует интерпретировать это как общее утверждение, что K3 дешевле всех альтернатив в любых условиях.

При планировании производства следует измерять общую стоимость успешного выполнения задачи, а не только цену за миллион токенов.

Значение публикации весов с открытым исходным кодом

Значение публикации Kimi K3 выходит за рамки рейтинга одной модели.

Она открывает множество областей исследований и разработок, которые трудно изучать в системах, доступных только через API.

Исследователи могут проверять или изменять веса модели, поведение MoE, механизм внимания на основе KDA, механизм длинного контекста, компоненты зрения, поведение квантования, систему обслуживания и стратегии пост-тренировки агентов.

Команды инфраструктуры могут тестировать различные схемы обслуживания.

Предприятия могут оценивать развёртывание в частном порядке, если это экономически оправдано с точки зрения аппаратного обеспечения.

Сообщество может создавать:

  • Новые схемы вывода.
  • Варианты квантования.
  • Производные модели с дообучением.
  • Доменные системы.
  • Фреймворки для оценки.
  • Инструменты маршрутизации моделей.
  • Оптимизации под конкретное оборудование.

Сформируется ли на этой основе экосистема, сопоставимая с ранними важными релизами моделей с открытым исходным кодом, будет зависеть от стоимости вывода, доступного оборудования, условий лицензирования, инструментария сообщества и качества производных малых моделей.

Практический контрольный список перед развёртыванием Kimi K3

1. Ознакомьтесь с лицензионным соглашением

Убедитесь, что ваш сценарий использования относится к: внутренним исследованиям, корпоративному использованию, дообучению, встраиваемым приложениям, публичному выводу или модели как услуге.

2. Подтвердите совместимость оборудования

Проверьте архитектуру ускорителя, объём HBM, способ соединения, версию CUDA, требования к ядрам, поддержку квантования, количество устройств и топологию параллелизма экспертов.

3. Выберите поддерживаемый движок вывода

Используйте текущие специфические для K3 решения для vLLM, SGLang или других официально поддерживаемых путей обслуживания.

4. Протестируйте полный контекст в 1 миллион токенов отдельно

Измерьте задержку префилла, задержку декодирования, поведение кэширования префикса, потребление памяти, параллелизм, пропускную способность и восстановление после сбоев.

5. Сохраняйте историю вывода

Для агентных многошаговых рабочих процессов следуйте руководству Moonshot и возвращайте полные сообщения ассистента (включая состояние вывода и вызовов инструментов).

6. Проверьте на реальных задачах

Проведите бенчмаркинг на ваших собственных репозиториях, рабочих процессах исследований, документации, задачах зрения, использовании инструментов и агентных сценариях.

7. Измерьте стоимость выполнения каждой задачи

Сосредоточение исключительно на цене токенов может ввести в заблуждение. Учитывайте количество повторов, вызовов инструментов, длину вывода и затраты на вмешательство человека.

Часто задаваемые вопросы

Является ли Kimi K3 открытым исходным кодом?

Полные веса, кодовая база, документация и технический отчёт Kimi K3 были опубликованы. MoonShot описывает модель как модель с открытыми весами. Модель использует собственную лицензию Kimi K3, а не Apache 2.0.

стандартные протоколы, коммерческим пользователям необходимо тщательно ознакомиться с конкретными условиями.

Где скачать Kimi K3?

Официальные веса можно получить на Hugging Face от Moonshot AI. Основной репозиторий исходного кода и технический отчёт доступны на GitHub.

Сколько параметров у Kimi K3?

Общее количество параметров Kimi K3 составляет около 2,8 триллиона. Благодаря разреженной архитектуре смеси экспертов, каждый токен активирует около 104 миллиардов параметров.

Каков размер контекстного окна Kimi K3?

Официальная модель поддерживает контекст до 1 048 576 токенов. Развёртывание с длинным контекстом по-прежнему требует значительного объёма памяти и инфраструктуры для инференса, особенно в сценариях с параллельной обработкой.

Можно ли запустить Kimi K3 на потребительских GPU?

Полную модель на 2,8T фактически невозможно запустить на обычных потребительских GPU. Даже при использовании разреженной активации и низкоразрядного квантования, полные веса и сервисный стек требуют крупной инфраструктуры с несколькими ускорителями.

Какие движки инференса поддерживают Kimi K3?

Официальный репозиторий Moonshot рекомендует использовать vLLM, SGLang и TokenSpeed в соответствии с руководством по развёртыванию K3. Поскольку модель использует оптимизации KDA, MLA, MoE и MXFP4, перед развёртыванием необходимо проверить поддерживаемые версии.

Что такое MoonEP и FlashKDA?

MoonEP — это библиотека связи для параллельной работы экспертов с открытым исходным кодом от Moonshot, используемая для балансировки нагрузки токенов MoE между GPU. FlashKDA — это высокопроизводительное ядро внимания Kimi Delta, построенное на базе CUTLASS.

Превосходит ли Kimi K3 GPT-5.6 Sol и Claude Fable 5?

Не во всём. Технический отчёт Moonshot указывает, что Kimi K3 достиг производительности на передовом уровне и лидирует в определённых задачах, но в целом всё ещё уступает самым мощным проприетарным системам. Результаты бенчмарков также зависят от фреймворков агентов, инструментов, настроек инференса и методов оценки.

Связанные инструменты

  • Kimi K3 на Hugging Face: официальная карточка модели и полные веса Kimi K3.
  • Kimi K3 на GitHub: официальный репозиторий с README, лицензией, активами и техническим отчётом.
  • MoonEP: библиотека связи для параллельной работы экспертов от Moonshot для динамической балансировки нагрузки MoE.
  • FlashKDA: высокопроизводительное ядро внимания Kimi Delta на базе CUTLASS.
  • vLLM: движок инференса с открытым исходным кодом, рекомендованный в руководстве по развёртыванию Kimi K3.
  • SGLang: фреймворк с открытым исходным кодом для обслуживания LLM и мультимодальных моделей, указанный Moonshot для развёртывания K3.
  • Kimi API: хостинговая платформа API от Moonshot AI, предоставляющая доступ к модели kimi-k3.

Связанные ссылки

  • Официальный репозиторий Kimi K3 на GitHub: основной репозиторий с деталями архитектуры, инструкциями по развёртыванию, использованию модели, лицензии и техническими активами.
  • Карточка модели Kimi K3 на Hugging Face: официальное описание модели и загружаемые полные веса.
  • Технический отчёт Kimi K3: полный исследовательский отчёт, охватывающий архитектуру, обучение, инфраструктуру, оценку и тематические исследования.
  • Лицензия Kimi K3: официальная лицензия, регулирующая использование весов модели, кода, производных работ, развёртывание и конкретные коммерческие цели.
  • Репозиторий MoonEP: реализация с открытым исходным кодом системы балансировки параллельной работы экспертов от Moonshot.
  • Репозиторий FlashKDA: ресурсы с реализацией ядра KDA с открытым исходным кодом и бенчмарками.
  • Организация Kimi K3 на ModelScope: модели Moonshot AI, распространяемые через ModelScope.

Резюме

Moonshot AI выпустила полные веса Kimi K3, превратив свою передовую модель с 2,8T параметров в систему, которую исследователи и команды, занимающиеся инфраструктурой, могут изучать, развёртывать, дообучать и расширять в соответствии с лицензией Kimi K3.

Модель объединяет 104B активированных параметров, контекстное окно в 1M токенов, нативную мультимодальность, гибридный механизм внимания KDA/Gated-MLA, остаточное внимание, стабильные латентные MoE, обучение с учётом квантования и посттренинг агентов с долгосрочным планированием.

Не менее важно то, что этот релиз раскрывает часть системной инженерии, стоящей за моделью, через такие проекты, как MoonEP и FlashKDA. K3 остаётся моделью с чрезвычайно высокими требованиями к самостоятельному хостингу, и её лучшие результаты следует интерпретировать в контексте выбора фреймворка и опыта разработчика.

Оценка.
Настоящая веха заключается не просто в существовании модели размером 2,8T, а в том, что модель такого масштаба теперь доступна для изучения, запуска и создания на её основе более широкому сообществу.