Kimi K3 теперь с открытыми весами: исследуем передовую модель Moonshot AI с 2,8 трлн параметров
Moonshot AI выполнила своё обещание, выпустив полные веса модели Kimi K3 — своей самой крупной и амбициозной на сегодняшний день. Модель уже доступна в официальных репозиториях Moonshot AI на Hugging Face и GitHub, в сопровождении подробного технического отчёта и сопутствующих инфраструктурных проектов. Kimi K3 — это нативная мультимодальная модель-смесь экспертов с общим числом параметров 2,8 трлн, активирующая примерно 104 млрд параметров на каждый токен и обладающая контекстным окном в 1 млн токенов. Moonshot

Kimi K3 теперь с открытыми весами: исследование前沿ной модели Moonshot AI с 2,8 триллиона параметров
Введение
Moonshot AI выполнила свое обещание, официально выпустив полные веса своей самой масштабной и амбициозной модели — Kimi K3.
Модель уже доступна для загрузки через официальные страницы Moonshot AI на Hugging Face и GitHub, вместе с подробным техническим отчетом и сопутствующим инфраструктурным проектом.
Kimi K3 — это native мультимодальная модель смеси экспертов, обладающая 2,8 триллионами общих параметров, активируя около 104 миллиардов параметров на токен и имея контекстное окно в 1 миллион токенов.
Moonshot позиционирует её как frontier-модель с открытыми весами, предназначенную для долгосрочного программирования, исследований, мультимодального понимания, агентной работы со знаниями и задач рассуждения, которые могут включать сотни или тысячи шагов.
Значимость этого релиза двойственна.
Во-первых, сама модель выводит масштаб открытых весов на уровень в 3 триллиона параметров.
Во-вторых, Moonshot раскрыла гораздо больше, чем просто контрольные точки модели. Публичные материалы детально описывают её архитектуру, стратегию пост-тренировки, инфраструктуру обучения с подкреплением на длинных контекстах, систему обучения с экспертной параллелизацией, оптимизацию вывода, результаты бенчмарков и несколько долгосрочных инженерных кейсов.

Полные веса Kimi K3 теперь доступны
Ранее Moonshot объявила о запуске Kimi K3 и пообещала выпустить полные веса до 27 июля 2026 года.
Этот релиз состоялся.
Официальную модель можно получить по следующим каналам:
Репозиторий на GitHub содержит файл README, лицензию Kimi K3, полный технический отчет, ресурсы по архитектуре и бенчмаркам, руководство по развертыванию и инструкции по использованию модели.
Карточка модели на Hugging Face предоставляет конфигурацию модели и доступ к опубликованным весам.
Это означает, что модель превратилась из управляемой фронт-системы с планами открытого выпуска в модель, которую исследователи и квалифицированные инфраструктурные команды могут фактически загружать, проверять, развертывать, дообучать и адаптировать в соответствии с условиями лицензии Kimi K3.

Что означает "открытость" Kimi K3
Kimi K3 лучше всего описать как модель с открытыми весами и публичным кодом и документацией.
Лицензия предоставляет широкие права, позволяя пользователям использовать, копировать, модифицировать, дообучать, развертывать, создавать производные работы, распространять, сублицензировать и продавать копии в соответствии с условиями лицензии.
Однако,
лицензия содержит дополнительные коммерческие требования.
Например, компания, управляющая бизнесом Model-as-a-Service, общий доход которой за любые 12 последовательных месяцев превышает 20 миллионов долларов США, должна сначала заключить отдельное соглашение с Moonshot AI перед использованием Kimi K3 или её производных в коммерческих целях.
Лицензия также содержит требования к отображению для определенных очень крупных коммерческих продуктов или услуг, превышающих указанные лимиты пользователей или дохода.
Внутреннее использование и использование через официальные продукты Moonshot или сертифицированных партнеров по выводу регулируется отдельно.
Поэтому любой, кто намерен использовать Kimi K3 в коммерческих целях, должен внимательно прочитать фактическую лицензию, а не предполагать, что она эквивалентна Apache 2.0, MIT или другим стандартным разрешительным лицензиям.
Модель с 2,8 триллионами параметров и 104 миллиардами активированных параметров
Общий объем Kimi K3 чрезвычайно велик, но её архитектура смеси экспертов (MoE) означает, что не каждый токен активирует все 2,8 триллиона параметров.
Официальная карточка модели приводит следующую информацию:
| Спецификация | Kimi K3 |
|---|---|
| Архитектура | Смесь экспертов (MoE) |
| Общее количество параметров | 2,8T |
| Количество активированных параметров | 104B |
| Количество слоев | 93 |
| Количество плотных слоев | 1 |
| Количество маршрутизированных экспертов | 896 |
| Количество экспертов, выбираемых на токен | 16 |
| Количество общих экспертов | 2 |
| Размер словаря | 160K |
| Длина контекста | 1 048 576 токенов |
| Визуальный энкодер | MoonViT-V2 |
| Количество параметров визуального энкодера | 401M |
| Метод квантования | MXFP4 веса / MXFP8 активации |
| Модальности | Текст и изображения |
Технический отчет дает более точное сравнение архитектуры с Kimi K2.

По сравнению с Kimi K2, K3 увеличила глубину модели и разреженность экспертов, одновременно внедрив новые механизмы внимания и residual.
Moonshot заявляет, что общая эффективность масштабирования улучшена примерно в 2,5 раза благодаря комплексным улучшениям архитектуры и методов обучения на основе Kimi K2.
Это утверждение относится к эффективности, с которой дополнительные вычислительные мощности преобразуются в возможности модели, а не к общему 2,5-кратному увеличению скорости вывода.
Native мультимодальность и контекстное окно в миллион токенов
Kimi K3 спроектирована как native мультимодальная модель, а не как языковая модель, к которой в конце обучения был подключен визуальный модуль.
Её визуальный энкодер MoonViT-V2 имеет около 401 миллиона параметров.
Технический отчет указывает, что MoonViT-V2 был обучен с нуля с использованием цели предсказания следующего токена модели, а не инициализирован из контрастно предобученной визуальной модели, такой как SigLIP.
Moonshot сообщает, что этот подход оставался стабильным в процессе обучения и достиг конкурентоспособной визуальной производительности.

Длина контекста, поддерживаемая этой моделью:
1 048 576 токенов
Этот масштаб особенно важен для систем агентов, поскольку длительная задача кодирования или исследования может накапливать содержимое репозитория, выводы инструментов, журналы, скриншоты, исследовательские материалы, промежуточные планы, записи о неудачных тестах, предыдущие результаты рассуждений и многораундовые исправления.
Контекст из миллиона токенов не устраняет необходимость управления контекстом, но он позволяет K3 сохранять гораздо больший объем истории работы, чем традиционные системы с коротким контекстом.
Три основных архитектурных изменения
В техническом отчете масштабируемость и стабильность K3 объясняются несколькими архитектурными изменениями.
Наиболее значимыми из них являются три:
- Гибридный механизм внимания KDA + гейтированный MLA.
- Остаточное внимание.
- Стабильная латентная модель смеси экспертов.

1. Гибридный механизм внимания: KDA + гейтированный MLA
Kimi K3 использует гибридную конструкцию внимания.
В официальной карточке модели указано:
69 слоев KDA + 24 слоя гейтированного MLA
Эта архитектура следует повторяющемуся шаблону, в котором несколько слоев внимания Kimi Delta чередуются с периодическими слоями гейтированного многоголового латентного внимания.
Внимание Kimi Delta
KDA — это механизм линейного внимания, предназначенный для снижения нагрузки на память и вычисления, связанные с очень длинным контекстом.
Вместо традиционного KV-кеша, который растет с каждым токеном, как в стандартном полном внимании, KDA поддерживает рекуррентное состояние.
Это делает его привлекательным для последовательностей из миллиона токенов.
Ранее Moonshot представила KDA через серию исследований линейного внимания Kimi, и команда сообщила, что по сравнению с полным вниманием KDA снижает потребности в KV-кеше и увеличивает пропускную способность декодирования длинного контекста в условиях их оценки.
Гейтированный MLA
K3 не полностью заменяет глобальное внимание.
Периодические слои гейтированного MLA сохраняют способность модели глобально извлекать информацию в контексте.
Таким образом, эта гибридная конструкция пытается сбалансировать две цели:
- Эффективная обработка длинных последовательностей.
- Мощное глобальное извлечение.
Идея заключается не в том, что линейное внимание всегда лучше глобального, а в том, что каждый механизм обрабатывает разные части проблемы длинного контекста.
2. Остаточное внимание
Глубокие нейронные сети должны передавать информацию через множество уровней, избегая постепенной потери полезных представлений.
Kimi K3 вводит остаточное внимание (AttnRes), чтобы изменить способ передачи информации в глубине.
Этот механизм не полагается на единый последовательный остаточный поток, а позволяет последующим модулям выборочно извлекать представления, созданные предыдущими модулями.
Концептуально это дает сети механизм обучения, позволяющий ей решать, какая ранняя информация должна оставаться непосредственно доступной.
Цель — улучшить поток информации в модели из 93 слоев, не заставляя каждый признак строго проходить через один и тот же остаточный путь.
3. Стабильная LatentMoE
Kimi K3 значительно увеличивает разреженность MoE.
Модель содержит:
896 маршрутизируемых экспертов
Но каждый токен активирует только:
16 маршрутизируемых экспертов
Кроме того, модель включает двух общих экспертов.
Это приводит к очень большому общему количеству параметров модели, но активные вычисления значительно меньше общего количества параметров.
При такой разреженности стабильность обучения и баланс экспертов становятся сложными проблемами.
Конструкция стабильной LatentMoE от Moonshot включает несколько механизмов, предназначенных для решения этих проблем.
SiTU-GLU
Kimi K3 заменяет SwiGLU на SiTU-GLU — функцию активации, предназначенную для предотвращения неограниченного роста при экстремальном масштабировании.
![Изображение показывает структуру Gate branch и Up branch для GLU, SwiGLU и SiTU-GLU, а также их скалярные отклики. Все ветви получают скалярный вход x, кривые имеют общую область определения x ∈ [−10, 100], в правом нижнем углу показана увеличенная область вблизи нуля. При β1 = 4, β2 = 25 кривая SiTU-GLU близка к SwiGLU вблизи нуля, и при больших положительных x функция |f(x)| ≤ β1β2 = 100, в то время как SwiGLU по-прежнему неограничен. Этот рисунок связан с контекстом, в котором описывается замена SwiGLU на SiTU-GLU в Kimi K3 для предотвращения неограниченного роста при экстремальном масштабировании.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/fefa954c-d8a3-4294-a43b-b222b3386796-9daf2fb4-86f3-4c9a-96cf-f477c6f49b97.png)
Квантильное выравнивание
Система также использует метод балансировки нагрузки на основе динамического смещения маршрутизации, а не полагается исключительно на традиционные вспомогательные функции потерь для выравнивания.
Цель — сделать распределение токенов по экспертам после маршрутизации более равномерным, не внося чрезмерных помех в обучение.
Обучение агентов с миллионом токенов
В техническом отчете Kimi K3 особое внимание уделяется пост-обучению для длительных агентов.
Модель обучалась в трех областях:
- Общие рассуждения.
- Общие задачи агентов.
- Агенты программирования.
Она также поддерживает несколько уровней детализации рассуждений:
- Низкий.
- Высокий.
- Максимальный.
Окончательная модель комбинирует несколько специализированных стратегий с помощью многоэкспертной онлайн-дистилляции политик (MOPD).
Moonshot не обучает отдельные постоянные модели для каждой области и уровня детализации, а обучает специализированные модели-учителя и интегрирует их поведение в единую политику K3.
AgentENV: Длительная песочница для обучения
В техническом отчете описана AgentENV — инфраструктурный уровень, созданный для развертывания постоянных агентов.
Система использует Firecracker
Микро-виртуальная среда, позволяющая агенту выполнять длительные последовательности операций в воспроизводимой песочнице.
Обучающая задача может включать:
- Чтение файлов.
- Написание кода.
- Запуск команд.
- Открытие приложений.
- Снятие скриншотов.
- Использование симулированных рабочих инструментов.
- Отладку ошибок.
- Возврат после длительной задержки.
- Продолжение выполнения из предыдущего состояния среды.
Это отличается от обучения с подкреплением, основанного на коротких раундах вопросов и ответов.
Агент может выполнять сотни вызовов инструментов и поддерживать состояние в симулированной среде в течение нескольких виртуальных дней.
Исходная статья описывает симулированную среду, включающую такие приложения, как Slack, Notion и Gmail.
Основная сложность обучения — устойчивость: состояние как среды, так и длинного контекста модели должно оставаться доступным.
В ходе длительного развёртывания.
Синтез задач на основе графа знаний
Длительное циклическое обучение также требует большого количества сложных задач.
Moonshot описывает конвейер генерации задач, организованный вокруг иерархического графа знаний.
Этот граф охватывает компьютерные науки, искусственный интеллект, программирование, математику, физику, химию, биомедицину и гуманитарные науки.
Связанные концепции могут быть выбраны вместе, извлечены соответствующие открытые материалы, а затем из них синтезированы новые задачи для оценки или обучения.
Цель графа — создание задач, требующих фактического использования инструментов и многошаговых рассуждений, а не простого запоминания ответов.
Инфраструктура для MoE-модели уровня 3T
Модель с 2,8 трлн параметров и контекстным окном в миллион токенов невозможно эффективно обучить и обслуживать только за счёт архитектуры.
Технический отчёт Moonshot описывает системную работу, охватывающую ядра KDA, контекстный параллелизм, параллелизм экспертов, управление памятью, планирование длительных циклов RL, кэширование префиксов, спекулятивное декодирование и контроль допуска обслуживания.
Часть из этого уже опубликована.
MoonEP: сбалансированный параллелизм экспертов
MoonEP — открытая библиотека связи для параллелизма экспертов от Moonshot.
В обучении MoE маршрутизация может быть крайне несбалансированной.
Из-за предпочтений маршрутизатора к определённым экспертам один ранг может получить значительно больше токенов, чем другой. В этом случае самое быстрое устройство вынуждено ждать самое медленное.
MoonEP использует динамических избыточных экспертов для решения этой проблемы.
Он может создавать временные копии экспертов в зависимости от текущей схемы маршрутизации, поддерживая баланс рабочей нагрузки токенов между рангами.
Проект описывает свою цель как поддержание точной загрузки токенов на каждом ранге при сокращении накладных расходов на связь.
Это критически важно в масштабе K3, поскольку распределение 896 экспертов по крупному кластеру создаёт огромные проблемы синхронизации.
FlashKDA: высокопроизводительное ядро KDA
FlashKDA предоставляет высокопроизводительные ядра внимания Kimi Delta на основе CUTLASS.
Текущие требования открытого репозитория включают:
SM90 или новее
CUDA 12.9 или новее
PyTorch 2.4 или новее
Репозиторий содержит тесты корректности и эталонные данные для поддерживаемого оборудования.
FlashKDA призван ускорить механизм внимания, делающий архитектуру длинного контекста K3 практичной.
Родная квантизация MXFP4
Kimi K3 использует обучение с учётом квантизации, начиная с этапа контролируемой тонкой настройки.
Официальная конфигурация указывает:
Веса MXFP4
Активации MXFP8
Это отличается от обучения полноценной высокоточной модели с последующей квантизацией после обучения.
Модель обучается работать непосредственно с этими форматами пониженной точности в процессе конвейера.
Это помогает снизить затраты памяти и связи.
Требования, но это не превращает модель в 2,8T в обычную настольную модель.
Можно ли запустить Kimi K3 локально?
Веса открыты, но "можно скачать" не означает "можно легко запустить на ноутбуке".
Общее количество параметров Kimi K3 составляет 2,8 триллиона.
Даже с разреженной активацией и форматами низкой разрядности для запуска полной модели требуется значительная агрегированная память ускорителей, высокоскоростное межсоединение устройств, параллелизм экспертов, совместимый движок вывода и эффективная поддержка KDA, MLA и MoE.
Официальный репозиторий Moonshot рекомендует:
Экосистема всё ещё быстро развивается. Поддержка может зависеть от конкретных схем, ядер, режимов квантизации и оборудования.
Перед созданием самостоятельной среды убедитесь в актуальности документации по развёртыванию Kimi K3; не предполагайте, что стандартные настройки обслуживания Transformer будут работать.
Для большинства частных лиц и небольших команд использование размещённого API может быть значительно проще, чем запуск полной модели.
API Kimi K3 и уровень усилий при рассуждении
Moonshot также предоставляет Kimi K3 через свою официальную API-платформу:
Идентификатор модели:
kimi-k3
Kimi K3 использует возможность рассуждения и возвращает поле reasoning_content.
Официальная карточка модели описывает три уровня усилий при рассуждении:
low
high
max
Важная деталь реализации — сохранённая история размышлений.
Для многораундовых рабочих процессов агента Moonshot указывает, что разработчики должны передавать полное предыдущее сообщение ассистента (включая reasoning_content, content и tool_calls) в следующий запрос.
Отбрасывание части этого состояния может нарушить непрерывность, поскольку обучение K3 требует сохранения истории рассуждений.
Производительность в тестах
Технический отчёт Moonshot оценивает Kimi K3 в области рассуждений и знаний, программирования, рабочих процессов агента и зрения.
Собственный набор тестов компании ставит K3 в ряд сильнейших доступных моделей, опережая многие системы с открытыми весами и проприетарные системы по определённым задачам.
В то же время в отчёте прямо указано, что модель в целом всё ещё отстаёт от сильнейших проприетарных систем, в частности Claude Fable 5 и GPT-5.6 Sol.
Это уточнение важно.
Утверждение не в том, что K3 побеждает во всех тестах.
Более обоснованный вывод заключается в том, что Kimi K3 выводит открытые веса на уровень производительности, который до недавнего времени был в основном связан с передовыми проприетарными системами.

Множество сравнительных тестов также зависят от различных инструментов агента, включая Kimi Code, Claude Code, Codex и официальные инструменты тестирования.
Поэтому оценки в тестах агента не следует интерпретировать как чистую меру способностей модели.
На результаты существенно влияют окружающие инструменты, подсказки, управление контекстом, механизмы отката и оценщики.
Практический пример длительного цикла программирования
В отчёте приводится несколько примеров, призванных продемонстрировать, что K3 способна выполнять сложные инженерные задачи, далеко выходящие за рамки короткого дополнения кода.
Эти примеры предоставлены разработчиками модели и должны рассматриваться как демонстрация, а не как общая гарантия производительности.
MiniTriton: создание системы GPU-программирования
Moonshot сообщает, что Kimi K3 разработал MiniTriton — компактную систему GPU-программирования, подобную Triton.
Этот проект включает промежуточное представление, конвейер компилятора, генерацию PTX, языки фронтенда, компоненты среды выполнения, оптимизацию ядер GPU и примитивы для распределённого обучения.

Moonshot сообщает, что K3 также оптимизирует сложные ядра, связанные с его собственной архитектурой, и достигает значительного ускорения на выбранных ядрах.
Это демонстрирует ожидаемое поведение модели: проверка сложной кодовой базы, анализ производительности, написание низкоуровневого кода, бенчмаркинг результатов и итеративное улучшение.
Однако это не означает, что каждый созданный моделью компилятор или ядро можно полностью доверять без проверки и тестирования человеком.
48-часовой эксперимент по проектированию чипа
В другом исследовании Kimi K3 был помещён в изолированную среду на 48 часов и получил задание создать прототип чипа для вывода небольшой модели, чья концепция проектирования схожа с описанной выше архитектурой.
Модель использовала инструменты автоматизации проектирования электроники с открытым исходным кодом и библиотеку стандартных ячеек Nangate 45 нм.
Moonshot сообщает, что финальный дизайн симуляции был выполнен в рамках бюджета площади анализа в 4 квадратных миллиметра, достигнуто замыкание временных характеристик на частоте 100 МГц, проект содержит около 1,46 миллиона стандартных ячеек, использует 0,277 МиБ SRAM и достигает пропускной способности декодирования более 8700 токенов в секунду в RTL-симуляции.

Это основанное на симуляции концептуальное доказательство, а не серийный чип.
Научное кодирование и астрофизика
K3 также был оценён в задаче воспроизведения результатов в вычислительной астрофизике.
Moonshot сообщает, что модель прочитала и перекрёстно проверила более 20 научных статей, реализовала полный численный пайплайн, оценила более 300 уравнений состояния, выявила несоответствия в опубликованных формулах, написала более 3000 строк кода на Python и создала интерактивную HTML-панель.
![Изображение демонстрирует достижения Kimi K3 в научном кодировании. Для воспроизведения универсального соотношения I-Love-Q в вычислительной астрофизике Kimi K3 проанализировал более 20 статей, перекрёстно проверил результаты, реализовал полный численный пайплайн, оценил более 300 наборов уравнений состояния, обнаружил несоответствия в общедоступных формулах, написал более 3000 строк кода на Python и создал интерактивную HTML-панель примерно за 2 часа, в то время как опытному исследователю обычно требуется 1-2 недели. Это изображение тесно связано с контекстом и наглядно показывает конкретные результаты Kimi K3 в задаче научного кодирования.]
Сообщается, что вышеуказанная автономная работа заняла около двух часов, в то время как опытному исследователю обычно требуется от одной до двух недель.
Для научной работы независимая проверка остаётся критически важной. Модель может сгенерировать полный пайплайн, но всё ещё может содержать тонкие ошибки в предположениях, единицах измерения, численных методах, цитировании или интерпретации.
Оценка кибербезопасности
В техническом отчёте также обсуждается оценка в сфере кибербезопасности.
Moonshot сообщает, что Kimi K3 обнаружил ранее неизвестную уязвимость в ядре Linux в ходе контролируемого тестирования безопасности, и соответствующие находки были проверены экспертами-людьми.
Смысл не в том, что K3 следует использовать для неконтролируемых наступательных операций в сфере безопасности.
Скорее, это указывает на то, что модели кодирования с длинным циклом всё лучше читают большие кодовые базы, отслеживают низкоуровневое поведение, формулируют гипотезы, проверяют их, корректируют методы и продолжают продвигаться после неудачных попыток.
Эти возможности могут поддерживать оборонительный аудит и проверку безопасности кода, но также делают более важными авторизацию, изоляцию в песочнице, контроль доступа и надзор человека.
Стоимость и эффективность
Ценность модели определяется не только оценками в бенчмарках.
Длинноцикловые агентные системы могут генерировать миллионы токенов для одной задачи.
Таким образом, стоимость зависит от длины ввода, длины вывода, сложности вывода, коэффициента попадания в кэш, количества вызовов инструментов, количества повторов, управления контекстом и провайдера вывода.
Технический отчёт Moonshot содержит сравнение оценок и затрат для нескольких агентных бенчмарков.
Эти диаграммы показывают, что K3 обладает относительной экономической эффективностью на некоторых тестовых нагрузках.
Не следует интерпретировать это как общее утверждение, что K3 дешевле всех альтернатив в любых условиях.
При планировании производства следует измерять общую стоимость успешного выполнения задачи, а не только цену за миллион токенов.
Значение публикации весов с открытым исходным кодом
Значение публикации Kimi K3 выходит за рамки рейтинга одной модели.
Она открывает множество областей исследований и разработок, которые трудно изучать в системах, доступных только через API.
Исследователи могут проверять или изменять веса модели, поведение MoE, механизм внимания на основе KDA, механизм длинного контекста, компоненты зрения, поведение квантования, систему обслуживания и стратегии пост-тренировки агентов.
Команды инфраструктуры могут тестировать различные схемы обслуживания.
Предприятия могут оценивать развёртывание в частном порядке, если это экономически оправдано с точки зрения аппаратного обеспечения.
Сообщество может создавать:
- Новые схемы вывода.
- Варианты квантования.
- Производные модели с дообучением.
- Доменные системы.
- Фреймворки для оценки.
- Инструменты маршрутизации моделей.
- Оптимизации под конкретное оборудование.
Сформируется ли на этой основе экосистема, сопоставимая с ранними важными релизами моделей с открытым исходным кодом, будет зависеть от стоимости вывода, доступного оборудования, условий лицензирования, инструментария сообщества и качества производных малых моделей.
Практический контрольный список перед развёртыванием Kimi K3
1. Ознакомьтесь с лицензионным соглашением
Убедитесь, что ваш сценарий использования относится к: внутренним исследованиям, корпоративному использованию, дообучению, встраиваемым приложениям, публичному выводу или модели как услуге.
2. Подтвердите совместимость оборудования
Проверьте архитектуру ускорителя, объём HBM, способ соединения, версию CUDA, требования к ядрам, поддержку квантования, количество устройств и топологию параллелизма экспертов.
3. Выберите поддерживаемый движок вывода
Используйте текущие специфические для K3 решения для vLLM, SGLang или других официально поддерживаемых путей обслуживания.
4. Протестируйте полный контекст в 1 миллион токенов отдельно
Измерьте задержку префилла, задержку декодирования, поведение кэширования префикса, потребление памяти, параллелизм, пропускную способность и восстановление после сбоев.
5. Сохраняйте историю вывода
Для агентных многошаговых рабочих процессов следуйте руководству Moonshot и возвращайте полные сообщения ассистента (включая состояние вывода и вызовов инструментов).
6. Проверьте на реальных задачах
Проведите бенчмаркинг на ваших собственных репозиториях, рабочих процессах исследований, документации, задачах зрения, использовании инструментов и агентных сценариях.
7. Измерьте стоимость выполнения каждой задачи
Сосредоточение исключительно на цене токенов может ввести в заблуждение. Учитывайте количество повторов, вызовов инструментов, длину вывода и затраты на вмешательство человека.
Часто задаваемые вопросы
Является ли Kimi K3 открытым исходным кодом?
Полные веса, кодовая база, документация и технический отчёт Kimi K3 были опубликованы. MoonShot описывает модель как модель с открытыми весами. Модель использует собственную лицензию Kimi K3, а не Apache 2.0.
стандартные протоколы, коммерческим пользователям необходимо тщательно ознакомиться с конкретными условиями.
Где скачать Kimi K3?
Официальные веса можно получить на Hugging Face от Moonshot AI. Основной репозиторий исходного кода и технический отчёт доступны на GitHub.
Сколько параметров у Kimi K3?
Общее количество параметров Kimi K3 составляет около 2,8 триллиона. Благодаря разреженной архитектуре смеси экспертов, каждый токен активирует около 104 миллиардов параметров.
Каков размер контекстного окна Kimi K3?
Официальная модель поддерживает контекст до 1 048 576 токенов. Развёртывание с длинным контекстом по-прежнему требует значительного объёма памяти и инфраструктуры для инференса, особенно в сценариях с параллельной обработкой.
Можно ли запустить Kimi K3 на потребительских GPU?
Полную модель на 2,8T фактически невозможно запустить на обычных потребительских GPU. Даже при использовании разреженной активации и низкоразрядного квантования, полные веса и сервисный стек требуют крупной инфраструктуры с несколькими ускорителями.
Какие движки инференса поддерживают Kimi K3?
Официальный репозиторий Moonshot рекомендует использовать vLLM, SGLang и TokenSpeed в соответствии с руководством по развёртыванию K3. Поскольку модель использует оптимизации KDA, MLA, MoE и MXFP4, перед развёртыванием необходимо проверить поддерживаемые версии.
Что такое MoonEP и FlashKDA?
MoonEP — это библиотека связи для параллельной работы экспертов с открытым исходным кодом от Moonshot, используемая для балансировки нагрузки токенов MoE между GPU. FlashKDA — это высокопроизводительное ядро внимания Kimi Delta, построенное на базе CUTLASS.
Превосходит ли Kimi K3 GPT-5.6 Sol и Claude Fable 5?
Не во всём. Технический отчёт Moonshot указывает, что Kimi K3 достиг производительности на передовом уровне и лидирует в определённых задачах, но в целом всё ещё уступает самым мощным проприетарным системам. Результаты бенчмарков также зависят от фреймворков агентов, инструментов, настроек инференса и методов оценки.
Связанные инструменты
- Kimi K3 на Hugging Face: официальная карточка модели и полные веса Kimi K3.
- Kimi K3 на GitHub: официальный репозиторий с README, лицензией, активами и техническим отчётом.
- MoonEP: библиотека связи для параллельной работы экспертов от Moonshot для динамической балансировки нагрузки MoE.
- FlashKDA: высокопроизводительное ядро внимания Kimi Delta на базе CUTLASS.
- vLLM: движок инференса с открытым исходным кодом, рекомендованный в руководстве по развёртыванию Kimi K3.
- SGLang: фреймворк с открытым исходным кодом для обслуживания LLM и мультимодальных моделей, указанный Moonshot для развёртывания K3.
- Kimi API: хостинговая платформа API от Moonshot AI, предоставляющая доступ к модели
kimi-k3.
Связанные ссылки
- Официальный репозиторий Kimi K3 на GitHub: основной репозиторий с деталями архитектуры, инструкциями по развёртыванию, использованию модели, лицензии и техническими активами.
- Карточка модели Kimi K3 на Hugging Face: официальное описание модели и загружаемые полные веса.
- Технический отчёт Kimi K3: полный исследовательский отчёт, охватывающий архитектуру, обучение, инфраструктуру, оценку и тематические исследования.
- Лицензия Kimi K3: официальная лицензия, регулирующая использование весов модели, кода, производных работ, развёртывание и конкретные коммерческие цели.
- Репозиторий MoonEP: реализация с открытым исходным кодом системы балансировки параллельной работы экспертов от Moonshot.
- Репозиторий FlashKDA: ресурсы с реализацией ядра KDA с открытым исходным кодом и бенчмарками.
- Организация Kimi K3 на ModelScope: модели Moonshot AI, распространяемые через ModelScope.
Резюме
Moonshot AI выпустила полные веса Kimi K3, превратив свою передовую модель с 2,8T параметров в систему, которую исследователи и команды, занимающиеся инфраструктурой, могут изучать, развёртывать, дообучать и расширять в соответствии с лицензией Kimi K3.
Модель объединяет 104B активированных параметров, контекстное окно в 1M токенов, нативную мультимодальность, гибридный механизм внимания KDA/Gated-MLA, остаточное внимание, стабильные латентные MoE, обучение с учётом квантования и посттренинг агентов с долгосрочным планированием.
Не менее важно то, что этот релиз раскрывает часть системной инженерии, стоящей за моделью, через такие проекты, как MoonEP и FlashKDA. K3 остаётся моделью с чрезвычайно высокими требованиями к самостоятельному хостингу, и её лучшие результаты следует интерпретировать в контексте выбора фреймворка и опыта разработчика.
Оценка.
Настоящая веха заключается не просто в существовании модели размером 2,8T, а в том, что модель такого масштаба теперь доступна для изучения, запуска и создания на её основе более широкому сообществу.