Kimi K3 возглавляет арену фронтенд-кода, создаёт GPU-компилятор и проектирует чип за 48 часов

Moonshot AI представила Kimi K3 — нативную мультимодальную модель, разработанную для длительного кодирования, интеллектуальной работы, визуального мышления и агентных рабочих процессов. Модель имеет 2,8 триллиона общих параметров, контекстное окно в 1 миллион токенов и высокоразреженную архитектуру смеси экспертов — для каждого токена активируется лишь 16 из 896 экспертов. Moonshot называет её первой открытой моделью уровня 3T, хотя в анонсе компании указано, что полные веса модели будут опубликованы 27 июля 2026 года. Kimi K3 сразу привлекла внимание благодаря успехам во фронтенд-разработке, автономной оптимизации GPU-ядер, созданию миниатюрного GPU-компилятора MiniTriton и эксперименту по проектированию чипа за 48 часов с использованием инструментов автоматизации проектирования электроники с открытым исходным кодом. Moonshot также признает, что K3 не лидирует во всех категориях. Собственная оценка показывает, что модель уступает Claude Fable 5 и GPT-5.6 Sol по общей производительност

发布于 2026年7月19日generalGEO 评分: 09 次阅读
Изображение выполнено на тёмно-чёрном фоне, слева размытая надпись «KIMI MOONSHOT AI», справа крупный текст «Kimi K3», ниже — пометка «Frontend Leader · GPU Compiler · 48-Hour AI Chip». В центре — светящийся чип с буквой «K». Справа — блок-схема с шагами от «IR» через «Optimize», «Lowering» к «CodeGen». Слева — интерфейс кода. Данное изображение связано с содержанием «SEO-обложки» в документе и является технической обложкой Moonshot AI Kimi K3, соответствующей описанию обложки в документе.

Kimi K3 возглавляет арену фронтенд-кода, создаёт GPU-компилятор и проектирует чип за 48 часов

Введение

Moonshot AI представила Kimi K3 — нативную мультимодальную модель, разработанную для длительного кодирования, интеллектуальной работы, визуального мышления и агентных рабочих процессов.

Модель имеет 2,8 триллиона общих параметров, контекстное окно в 1 миллион токенов и высокоразреженную архитектуру смеси экспертов — для каждого токена активируется лишь 16 из 896 экспертов. Moonshot называет её первой открытой моделью уровня 3T, хотя в анонсе компании указано, что полные веса модели будут опубликованы 27 июля 2026 года.

Kimi K3 сразу привлекла внимание благодаря успехам во фронтенд-разработке, автономной оптимизации GPU-ядер, созданию миниатюрного GPU-компилятора MiniTriton и эксперименту по проектированию чипа за 48 часов с использованием инструментов автоматизации проектирования электроники с открытым исходным кодом.

Moonshot также признает, что K3 не лидирует во всех категориях. Собственная оценка показывает, что модель уступает Claude Fable 5 и GPT-5.6 Sol по общей производительности, но демонстрирует лучшие результаты во многих задачах кодирования и длительных агентных задачах.

Изображение: интеллектуальное сравнение от Artificial Analysis, опубликованное в статье, показывает позицию Kimi K3.

Более дорогая модель Kimi

Kimi K3 поднимает цены API Moonshot на более высокий уровень по сравнению с ранними моделями Kimi для кодирования.

Таблица цен из оригинального отчета приводит следующие тарифы для китайского API:

Модель Вход с попаданием в кэш Вход без попадания в кэш Выход
Kimi K3 ¥2 за млн токенов ¥20 за млн токенов ¥100 за млн токенов
Kimi K2.7 Code ¥1,30 за млн токенов ¥6,50 за млн токенов ¥27 за млн токенов

Сравнение цен Kimi K3 и Kimi K2.7 Code из исходной статьи.

Международная API-платформа Moonshot указывает следующие цены для Kimi K3:

  • $0,30 за млн входных токенов с попаданием в кэш
  • $3,00 за млн входных токенов без попадания в кэш
  • $15,00 за млн выходных токенов

Это значительно дороже Kimi K2.7 Code, но всё ещё ниже цен Claude Fable 5, которые Moonshot приводит в своём сравнительном анализе.

Таблица сравнения цен показывает, что стоимость вывода Kimi K3 составляет лишь 30% от цены Claude Fable 5.

При чтении сравнения цен следует проявлять осторожность. Тарифы API могут различаться в зависимости от региона, провайдера, поведения кэша и последующих обновлений продукта. Перед развертыванием официальная страница Kimi API является лучшим способом проверки текущих тарифов.

Kimi K3 занимает первое место на арене фронтенд-кода

Наиболее впечатляющие ранние результаты получены в области фронтенд-разработки.

На момент публикации этой статьи Kimi K3 занимает первое место в предварительном рейтинге WebDev на арене фронтенд-кода Arena. Исходная диаграмма показывает её показатель побед в 76%, опережая Claude Fable 5 и GPT-5.6 Sol.

Kimi K3 занимает первое место в предварительных результатах арены фронтенд-кода, представленных в отчёте.

В семи категориях фронтенда оригинальный отчёт сообщает, что K3 заняла первое место в шести:

  1. Сайты брендов и маркетинга
  2. Дизайн по референсному изображению
  3. Интерфейсы анализа данных
  4. Потребительские продукты
  5. Симуляция и моделирование
  6. Инструменты для создания контента

Сообщается, что в категории игр она заняла второе место.

Эти результаты особенно важны, поскольку фронтенд-работа — это не просто задача генерации кода. Способная большая языковая модель должна уметь интерпретировать визуальные требования, создавать функциональные приложения, запускать их, проверять результаты и модифицировать реализацию, когда интерфейс не соответствует задумке.

Воссоздание браузерного интерфейса в стиле macOS

Одним из примеров, приведённых в оригинальной статье, является воссоздание интерфейса в стиле macOS 27 с помощью кластера агентов примерно за шесть часов.

Результат — не просто статический скриншот. Согласно отчёту, за некоторыми исключениями, такими как браузер и телефонные функции, большинство десктопных приложений и взаимодействий работают корректно.

Браузерный интерфейс, сгенерированный агентами, имитирующий современную десктопную операционную систему.

Другие демонстрации включают симулятор механической руки и полностью программную браузерную 3D-игру на Three.js и WebGPU.

Эти примеры остаются демонстрационными, а не стандартизированными бенчмарками, но они показывают типы рабочих процессов, которые Moonshot хочет поддерживать с помощью K3: длительные, визуальные, итеративные процессы создания программного обеспечения.

Визуализация в цикле

Moonshot описывает фронтенд-рабочий процесс K3 как визуализацию в цикле.

Модель не просто генерирует код и останавливается, а способна:

  1. Писать или модифицировать код приложения.
  2. Запускать проект.
  3. Проверять скриншоты или результаты рендеринга в реальном времени.
  4. Обнаруживать проблемы с макетом, цветом, иерархией или взаимодействием.
  5. Изменять код.
  6. Повторно рендерить обновлённый результат и повторять шаги.

Этот процесс устраняет разрыв между генерацией кода и визуальной оценкой.

Модель может генерировать синтаксически корректный HTML, CSS и JavaScript, но при этом создавать плохой интерфейс. Наблюдая за выводом рендеринга, K3 может выявить проблемы, которые трудно обнаружить только по исходному коду.

Для больших фронтенд-репозиториев контекстное окно в 1 миллион токенов также имеет решающее значение. Оно позволяет вместить множество компонентов, определений типов, правил дизайн-системы, документацию проекта и межфайловые зависимости в одном рабочем контексте.

В оригинальной статье также упоминается компромисс: некоторые пользователи сообщают, что сложные фронтенд-задачи занимают от 20 минут до часа. Это лишь отдельные наблюдения, а не контролируемые измерения задержки, но это указывает на то, что K3

Бенчмарки программирования и долгосрочные инженерные проекты

Программирование — одно из ключевых преимуществ Kimi K3.

В исходном отчете приведены следующие результаты бенчмарков:

Бенчмарк Kimi K3 Claude Fable 5 GPT-5.6 Sol
DeepSWE 67,5 70,0 73,0
Program Bench 77,8 76,8 77,6
SWE Marathon 42,0 35,0 39,0

Изображение показывает производительность Kimi K3 в нескольких бенчмарках кодинга и программной инженерии. Включает оценки DeepSWE, Terminal Bench 2.1, Program Bench, SWE Marathon: DeepSWE — Kimi K3: 67,5, Claude Fable 5: 70,0, GPT-5.6 Sol: 73,0; Terminal Bench 2.1 — Kimi K3: 88,3, GPT-5.6 Sol: 88,9. Изображение тесно связано с контекстом, наглядно демонстрируя оценки Kimi K3 в разных тестах, помогая читателю понять его производительность в кодинге и программной инженерии.

Заявленные результаты Kimi K3 в нескольких бенчмарках программирования и программной инженерии.

Официальный блог Kimi K3 содержит важные методологические пояснения.

Что касается DeepSWE, Moonshot в своем основном сравнении приводит результаты фреймворка Kimi Code, тогда как публичный рейтинг mini-SWE-agent показывает 67,3. Таким образом, в зависимости от фреймворка и настроек оценки возможны небольшие расхождения.

Для SWE Marathon Moonshot использовал калибровочную ветку H20 официальных задач. Компания также отметила, что у Claude Fable 5 в отдельных оценках наблюдалось резервное поведение, что могло снизить его измеренные баллы.

Эти детали не ставят под сомнение результаты, но важны при сравнении моделей. Агентный фреймворк, разрешения инструментов, оборудование, настройки логического вывода, резервное поведение и калибровка задач — всё это может влиять на итоговый балл.

Автономная оптимизация GPU-ядер

Moonshot проверил, сможет ли Kimi K3 оптимизировать GPU-ядра с минимальным участием человека.

Каждая модель получила одинаковую песочницу и могла в течение максимум 24 часов анализировать, переписывать, тестировать и оптимизировать следующие ядра:

  • AttnRes (остатки внимания)
  • Kimi Delta Attention
  • MLA-нагрузка с размерностью 512 голов
  • Универсальное GPU другого поставщика

Тестирование NVIDIA проводилось на оборудовании H200.

Оптимизация AttnRes

Для рабочей нагрузки AttnRes исходный текст показывает, что K3 разработал новый двухэтапный алгоритм ядра, сократив

совокупное время выполнения прямого и обратного проходов с 283,6 мс до 114,4 мс.

Это соответствует ускорению примерно на 59,7% по сравнению с базовым уровнем, что позволило Kimi K3 в экспериментальной конфигурации Moonshot приблизиться к результату Claude Fable 5.

Изображение показывает траекторию оптимизации Kimi K3 для задачи AttnRes (остатки внимания). По горизонтальной оси — активные часы, по вертикальной — коэффициент ускорения. Разными цветами линий показана оптимизация для Kimi K3, Claude Fable 5, GPT 5.5+, GPT 5.6 Sol. Красная линия Kimi K3 показывает постепенный рост ускорения от 0% до 59,7%, приближаясь к 57,1% у Claude Fable 5. График тесно связан с контекстом, наглядно демонстрируя динамику улучшений Kimi K3 в задаче AttnRes.

Заявленный график улучшений Kimi K3 в задаче ядра AttnRes.

График также показывает процесс улучшения агента с течением времени. K3 достиг нескольких значительных прорывов в начале работы, затем продолжал оптимизацию ядра в последующих итерациях.

Ядро MLA-512

В задаче MLA-512, выполняемой с нуля, ядро Kimi K3 достигло заявленных 517,8 TFLOPS при совокупной прямой и обратной нагрузке.

Второй по величине результат, показанный в отчете, составил около 492,7 TFLOPS.

Изображение показывает производительность Kimi K3 в TFLOPS (триллионы операций с плавающей запятой в секунду) для различных задач оптимизации модели. По горизонтальной оси — активные часы, по вертикальной — TFLOPS. Разными цветами линий показана оптимизация для задач AttnRes, DSA, MLA, KDA - GP GPU. Kimi K3 демонстрирует выдающийся результат в задаче MLA — 517,8 TFLOPS, значительно превосходя другие модели. На графике также отмечены значения TFLOPS для Claude Fable 5, Claude Opus, GPT 4.8, GPT 5.5, GPT 5.6. График тесно связан с контекстом, наглядно показывая производительность задач оптимизации Kimi K3 в тестах Moonshot.

Kimi K3 достиг заявленных 517,8 TFLOPS в задаче оптимизации MLA-512.

Moonshot сообщает, что на поздних этапах разработки модели ранние версии K3 взяли на себя основную часть работы по оптимизации ядер команды. Это рабочий процесс, о котором сообщает сама компания; он не проходил независимую проверку в материалах, на которые есть ссылки в источнике.

MiniTriton: Компилятор GPU, построенный с нуля

Следующий эксперимент вышел за рамки оптимизации отдельных ядер.

Moonshot исследовал, сможет ли Kimi K3 создать с нуля миниатюрную систему программирования для GPU. Результатом стал MiniTriton — компактный компилятор, подобный Triton, включающий:

  • Собственное промежуточное представление на уровне тайлов
  • Уровень IR, построенный на основе MLIR
  • Процесс оптимизации
  • Конвейер генерации кода PTX
  • Поддержку времени выполнения для сгенерированных ядер

Moonshot сообщает, что MiniTriton достиг или превзошёл производительность Triton и torch.compile в поддерживаемых бенчмарках roofline, включая превосходство над Triton на некоторых рабочих нагрузках.

![Изображение показывает производительность MiniTriton на CUDA-ядрах GPU NVIDIA L20 (sm_89) в roofline-анализе. По горизонтальной оси — арифметическая интенсивность (FLOP/байт), по вертикальной — достигнутая производительность (GFLOPS). Точками разных цветов и форм показаны данные для различных компиляторов: torch.eager, torch.compile, minitriton. Например, torch.compile достигает 37,2 TFLOPS при значении 10^1. Также отмечены точки производительности для разных размеров тайлов (BT) и количества тайлов (T), например, BT=16 достигает 1024 GFLOPS при значении 10^1. График тесно связан с контекстом, наглядно демонстрируя производительность MiniTriton.](https://we0-cms.oss-cn-beijing.aliyuncs.

com/cms-assets/image/2026/07/664fc2e9-1b2c-459d-b907-898ed77df1af-2b65c54f-ba91-475a-81e6-9a3472a15637.png)

Производительность CUDA-ядер MiniTriton на графическом процессоре NVIDIA L20, представленная в виде графика «roofline».

Компилятор также поддерживает сквозное обучение nanoGPT и демонстрирует стабильную сходимость. По заявлению Moonshot, кривая потерь остается близкой к эталонной реализации, с лишь незначительными отклонениями.

Это более значимо, чем изолированные микробенчмарки. Это свидетельствует о том, что сгенерированная система способна объединить язык фронтенда, промежуточное представление, конвейер оптимизации, генерацию PTX и среду выполнения в единый согласованный рабочий процесс.

Однако на момент написания данной статьи Moonshot еще не опубликовал публично репозиторий MiniTriton. Поэтому заявления о производительности основаны на материалах презентации Kimi K3 и пока не могут быть воспроизведены по официально выпущенному коду.

Чип, спроектированный за 48-часовой прогон

Kimi K3 также был протестирован в области проектирования микросхем.

В ходе автономного 48-часового прогона модель с использованием инструментов EDA с открытым исходным кодом и библиотеки технологических элементов Nangate 45nm спроектировала, оптимизировала и верифицировала чип, предназначенный для обслуживания небольших моделей на базе архитектуры K3.

Moonshot сообщает о следующих результатах моделирования проекта:

  • Площадь менее 4 мм²
  • 1,46 миллиона стандартных ячеек
  • 0,277 МБ статической памяти с произвольным доступом (SRAM)
  • Обеспечение временных задержек на частоте 100 МГц
  • Пропускная способность моделирования декодирования более 8700 токенов в секунду
  • Матричное устройство умножения с накоплением INT4 со встроенным обратным квантованием

Изображение демонстрирует результаты моделирования чипа, спроектированного Kimi K3 за 48-часовой автономный прогон. На изображении представлены различные модули, такие как «10 LGWR read pipe» и другие, каждый из которых имеет цифровую маркировку. В правом верхнем углу отображается информация «8358 tps», указывающая на скорость обработки 8358 токенов в секунду. Данное изображение связано с содержанием документа о проектировании чипа Kimi K3 за 48-часовой автономный прогон с использованием инструментов EDA с открытым исходным кодом и технологического процесса Nangate 45nm, наглядно демонстрируя результат проектирования.

Данное тематическое исследование проектирования чипа в симуляции показало скорость обработки более 8700 токенов в секунду.

Важно различать верифицированный цифровой проект и физический чип, прошедший производственный цикл.

Публично описанные материалы представляют собой упражнение по проектированию, оптимизации, проверке временных задержек и моделированию с использованием EDA. Они не утверждают, что чип был изготовлен на пластине, упакован и протестирован в кремнии.

Даже с учетом этого ограничения, выполнение расширенного конвейера проектирования аппаратного обеспечения является заметным примером долгосрочного кодирования. Оно требует от агента координации работы между архитектурными решениями, описанием аппаратуры, синтезом, размещением и трассировкой, проверкой временных задержек, верификацией и итеративной оптимизацией.

Два ключевых нововведения в основе масштаба 2,8T

Kimi K3 построен на двух технологиях, разработанных Moonshot AI:

  1. Kimi Delta Attention
  2. Остаточные механизмы внимания (Attention Residuals)

Модель объединяет эти технологии с архитектурой Mixture of Experts с более разреженной активацией.

Изображение демонстрирует архитектуру Kimi K3, разделенную на три части. Слева расположены модули Stable LatentMoE и KDA, включающие общих экспертов, маршрутизатор, линейные слои, слои нормализации и т.д.; в центре – операции AttnRes с линейными слоями, слоями нормализации, KDA и т.д.; справа – магистраль Block Attention Residuals с модулями Stable LatentMoE, Gated MLA, Stable LatentMoE, KDA и другими. Данная диаграмма тесно связана с контекстом, наглядно демонстрируя структуру ключевых компонентов модели Kimi K3, таких как Stable LatentMoE, KDA, AttnRes, помогая понять их свойства, такие как эффективная обработка длинных последовательностей, гибкая передача информации и разреженная активация.

Kimi K3 объединяет KDA, остаточные механизмы внимания, Gated MLA и Stable LatentMoE.

Kimi Delta Attention

Kimi Delta Attention, сокращенно KDA, предназначен для повышения эффективности механизма внимания при работе с длинными последовательностями.

Вместо полной опоры на стандартный механизм полного контекстуального внимания во всем контексте, KDA предлагает эффективный механизм для обработки длинных входных данных, сохраняя при этом информацию, необходимую для задач кодирования, рассуждения и работы агента.

Это одна из основ контекстного окна уровня миллионов токенов модели K3.

Механизм остаточных связей внимания

Традиционные слои Transformer многократно добавляют выходные данные каждого нового слоя к накапливаемому скрытому состоянию.

Механизм остаточных связей внимания (AttnRes) изменяет эту схему. Он позволяет последующим слоям выборочно извлекать представления с разной глубины, вместо того чтобы рассматривать все предыдущие слои как часть единого совокупного потока.

Moonshot описывает это как более гибкий способ обеспечения потока информации в сверхглубоких моделях.

Архитектура Stable Latent MoE

Kimi K3 имеет 896 модулей-экспертов, но для каждого токена активируется только 16 экспертов.

Такая экстремальная разреженность, снижая вычислительную нагрузку на один токен (относительно общего размера модели), одновременно усложняет маршрутизацию и балансировку нагрузки. Фреймворк Stable Latent MoE от Moonshot призван поддерживать стабильность обучения в условиях такой разреженной конфигурации.

Квантильная балансировка

Моделям Mixture of Experts необходимо равномерно распределять токены между экспертами, чтобы избежать перегрузки небольшого числа экспертов.

K3 использует технику квантильной балансировки, которая распределяет экспертов на основе квантилей оценок маршрутизатора, а не гиперпараметров балансировки, настраиваемых вручную. Moonshot заявляет, что это устраняет чувствительные гиперпараметры балансировки нагрузки, делая распределение экспертов в больших масштабах более стабильным.

Поэлементный оптимизатор для головок внимания

K3 расширяет оптимизатор Muon, реализуя поэлементный Muon-оптимизатор для головок внимания.

Этот подход разбивает параметры внимания на независимые структуры, оптимизируя каждую головку внимания отдельно. Цель — обеспечить более адаптивное поведение оптимизации для каждой головки внимания при крупномасштабном обучении.

SiTU и Gated MLA

Два дополнительных компонента обеспечивают контроль активации и внимания:

  • Блок Sigmoid Tanh Unit (SiTU) улучшает контроль активации
  • Gated MLA повышает гибкость выбора внимания

В сочетании с KDA, AttnRes, Stable Latent MoE, квантильной балансировкой и поэлементным Muon-оптимизатором, Moonshot заявляет об общем повышении эффективности масштабирования примерно в 2,5 раза по сравнению с Kimi K2.

Обучение с учетом квантования и архитектура вывода

Kimi K3 использует обучение с учетом квантования, начиная с этапа контролируемой тонкой настройки.

В официальном техническом блоге перечисляются:

  • Веса MXFP4
  • Активации MXFP8

Цель — повысить совместимость с различными аппаратными ускорителями, сохраняя при этом возможность обучения и развертывания модели такого масштаба.

Moonshot также рекомендует развертывание на узлах с более чем 64 ускорителями для эффективного вывода. Это ясно указывает на то, что открытые веса не означают удобное локальное развертывание — модель с 2,8 триллиона параметров остается тяжелой инфраструктурной системой.

Механизм кэширования префиксов KDA

KDA создает новые вызовы для традиционного кэширования префиксов.

Moonshot заявляет, что разработала соответствующую реализацию кэширования предварительного заполнения и внесла свой вклад в экосистему vLLM. Согласно их официальному API, коэффициент попадания в кэш для рабочих нагрузок, связанных с кодом, превышает 90%.

Этот уровень кэширования объясняет значительную разницу в цене между кэшированными и некэшированными входными данными. Данная реализация будет выпущена с открытым исходным кодом одновременно с моделью, разработчики смогут ознакомиться с официальными объявлениями Kimi и vLLM.

Репозиторий кода, отражающий текущее состояние доступности и интеграции.

Известные ограничения

Moonshot перечисляет три важных ограничения Kimi K3.

Чувствительность к истории рассуждений

Режим обучения K3 сохраняет предыдущую историю рассуждений модели.

Если агентный фреймворк не возвращает полную ожидаемую историю, качество генерации может стать нестабильным. Когда пользователи в середине активного сеанса переключаются с других моделей на

При K3 также может возникнуть та же проблема.

Moonshot AI рекомендует использовать проверенные совместимые инструменты (например, Kimi Code) и избегать переключения моделей в середине сеанса.

Чрезмерная инициативность

K3 проходила интенсивное обучение для выполнения длительных и сложных задач.

Поэтому она может чрезмерно реагировать на мелкие проблемы или нечеткие инструкции, принимая решения, не ожидаемые пользователем.

Приложения, требующие строгих границ, должны явно определять их в системной подсказке или в файле AGENTS.md.

Разрыв в пользовательском опыте

Moonshot AI заявляет, что K3 по-прежнему имеет заметный разрыв в пользовательском опыте по сравнению с Claude Fable 5 и GPT-5.6 Sol.

Это ограничение ценно — показатели бенчмарков и демонстрации автономной инженерии не охватывают все аспекты производственного опыта, включая согласованность ответов, задержку, интерпретацию инструкций, надежность инструментов и плавность диалога.

Доступность и статус открытых весов

Kimi K3 доступна через следующие каналы:

При запуске K3 по умолчанию использует максимальную интенсивность размышлений. Moonshot AI сообщает, что в будущих обновлениях будут добавлены опции с более низкой и более высокой интенсивностью размышлений.

Компания объявила, что полные веса модели будут опубликованы до 27 июля 2026 года. До тех пор, пока эти веса и технический отчет не станут доступны, часть архитектуры, настройки бенчмарков, реализации MiniTriton и процессы проектирования чипов основаны на опубликованных описаниях Moonshot AI.

Изображение показывает изменение количества параметров открытых флагманских моделей различных компаний с июля 2025 года по октябрь 2026 года. Горизонтальная ось — временная шкала, вертикальная — общее количество параметров. Разными цветами линий обозначены разные компании, такие как Moonshot AI, Xiaomi, Alibaba и другие. Kimi K3 достигает 2,8 триллиона параметров в июле 2026 года, что является текущим максимумом. График тесно связан с контекстом и наглядно демонстрирует преимущество Kimi K3 по количеству параметров, а также сравнение по этому показателю с другими большими моделями.

Kimi K3 увеличивает масштаб открытых моделей, о которых сообщает Moonshot AI, до 2,8 триллиона параметров.

Часто задаваемые вопросы

Что такое Kimi K3?

Kimi K3 — это нативная мультимодальная модель с 2,8 триллиона параметров, разработанная Moonshot AI, предназначенная для длительного кодирования, интеллектуальной работы, визуального мышления и агентных задач. Она поддерживает контекстное окно в 1 миллион токенов, активируя 16 из 896 экспертов на каждый токен.

Является ли Kimi K3 открытым исходным кодом?

Moonshot AI называет K3 открытой моделью уровня 3T и объявила, что полные веса модели будут опубликованы до 27 июля 2026 года. На момент написания этой статьи публикация полных весов и технического отчета K3 еще не завершена.

Какова стоимость API Kimi K3?

Цены международного API Kimi: 0,30 доллара США за миллион кэшированных входных токенов, 3,00 доллара США за миллион некэшированных входных токенов и 15,00 долларов США за миллион выходных токенов. Цены могут меняться.

Поэтому производственным пользователям следует проверять текущие тарифы на официальной платформе API.

Действительно ли Kimi K3 занимает первое место по возможностям фронтенд-кодирования?

На момент запуска Kimi K3 временно занимала первое место в рейтинге Arena WebDev. По мере добавления новых голосов и моделей рейтинг динамически меняется, поэтому для получения актуальной информации обращайтесь к реальной странице Arena.

Что такое MiniTriton?

MiniTriton — это компактный GPU-компилятор, который, по словам Moonshot AI, был создан Kimi K3 с нуля. Он включает в себя промежуточное представление на уровне блоков на основе MLIR, оптимизационные проходы, конвейер генерации кода PTX и поддерживает сквозное обучение nanoGPT.

Производит ли Kimi K3 физические чипы?

Официальной информации о физической tape-out нет. Moonshot AI описывает 48-часовой прогон автономной электронной автоматизации проектирования (EDA), который использовал библиотеку Nangate 45nm для завершения проектирования, оптимизации, верификации и симуляции чипа.

Можно ли запустить Kimi K3 локально?

Модель чрезвычайно велика, и Moonshot AI предполагает, что для эффективного вывода требуется конфигурация как минимум с 64 ускорителями. Даже после открытия весов локальный запуск потребует значительной специализированной инфраструктуры или значительно измененных схем развертывания.

Каковы основные ограничения Kimi K3?

Moonshot AI отмечает чувствительность к сохранению истории размышлений, чрезмерную инициативность в нечетких задачах и разрыв в пользовательском опыте по сравнению с Claude Fable 5 и GPT-5.6 Sol. Рекомендуется использовать явные агентные ограничения и совместимые адаптационные фреймворки.

Связанные инструменты

  • Kimi: Рабочее пространство агентов Moonshot AI, позволяющее использовать Kimi K3 в процессах кодирования, исследований, работы с документами, слайдами и визуализации.
  • Kimi Code: Терминальный кодирующий агент с открытым исходным кодом от Moonshot AI, также рекомендуемый совместимый адаптационный фреймворк для K3.
  • Платформа Kimi API: Официальный API-сервис для доступа к kimi-k3 и другим моделям Kimi.
  • Рейтинг Arena WebDev: Таблица рейтингов, основанных на реальных голосах сообщества для фронтенд-моделей и веб-разработки.
  • Triton: Язык и компилятор с открытым исходным кодом для написания высокопроизводительных GPU-ядер.
  • MLIR: Многоразовая инфраструктура компилятора LLVM для построения промежуточных представлений и оптимизационных конвейеров.
  • vLLM: Инференс-движок для больших языковых моделей с открытым исходным кодом, поддерживающий высокопроизводительный вывод и кэширование префиксов.
  • OpenROAD: Инструментарий с открытым исходным кодом для автоматизированного проектирования чипов (RTL-to-GDSII), связанный с автоматизированным процессом проектирования.

Связанные ссылки

  • Официальный технический блог Kimi K3: Публикация Moonshot AI, охватывающая архитектуру, примеры кодирования, цены, доступность, оценки и ограничения.
  • Платформа API Kimi K3: Официальный источник текущего доступа и цен на API K3.
  • Репозиторий GitHub Kimi Code: Официальный репозиторий кодирующего агента и документация по установке.
  • Рейтинг Arena WebDev: Текущие рейтинги и данные голосования фронтенд-моделей.
  • Рейтинг DeepSWE: Общедоступный бенчмарк программной инженерии, цитируемый в оценочном отчете Moonshot AI.
  • Program Bench: Бенчмарк программирования, используемый в сравнении кодирования K3.
  • SWE Marathon: Длительный бенчмарк программной инженерии, цитируемый Moonshot AI.

Обзор

Kimi K3 — самая большая модель Moonshot AI на сегодняшний день, имеющая в общей сложности 2,

8 триллионов параметров, поддержка нативного мультимодального ввода, контекстное окно в 100 тысяч токенов и разреженная активация 16 из 896 экспертов.

Наиболее впечатляющие ранние результаты проявились в области долгосрочных инженерных задач. K3 занял первое место на арене фронтенд-кода, оптимизировал GPU-ядра, создал компилятор MiniTriton и выполнил 48-часовой рабочий процесс по проектированию аналоговых микросхем с использованием инструментов с открытым исходным кодом (EDA).

Архитектура включает механизм внимания Kimi Delta, остаточные связи внимания, стабильный разреженный MoE, квантильный баланс, оптимизатор Muon на голову, SiTU и шлюзовую MLA. Компания Moon’s Dark Side сообщает, что эффективность масштабирования повысилась в 2,5 раза по сравнению с Kimi K2, однако также признает серьезные ограничения в совместимости с агентами, проактивности и общем пользовательском опыте.

Самое важное заявление о Kimi K3 — не то, что он выиграл все бенчмарки, а то, что он способен сохранять высокую продуктивность в исключительно длительных, визуально-ориентированных и инструментально-зависимых инженерных задачах.

Kimi K3 возглавляет арену фронтенд-кода, создаёт GPU-компилятор и проектирует чип за 48 часов