Kimi K3, 이제 가중치 공개: 문의 어두운 면 AI의 2.8T 파라미터 최첨단 모델 탐험

문의 어두운 면 AI가 약속을 이행하며 Kimi K3의 전체 가중치를 공개했습니다. 이는 지금까지 가장 크고 야심찬 모델입니다. 이 모델은 현재 문의 어두운 면 AI의 공식 Hugging Face 및 GitHub 페이지에 상세한 기술 보고서와 관련 인프라 프로젝트와 함께 게재되었습니다. Kimi K3는 네이티브 멀티모달 혼합 전문가 모델로, 총 2.8조 개의 파라미터를 보유하며 각 토큰에서 약 1040억 개의 파라미터가 활성화되고 100만 토큰의 컨텍스트 윈도우를 지원합니다. 문의 어

发布于 2026年7月30日generalGEO 评分: 02 次阅读
이 이미지는 문의 어두운 면 AI가 Kimi K3 대형 모델을 발표하는 프로모션 비주얼로, 짙은 검은색 배경에 청자색 테크 스타일 디자인을 사용했습니다. 중앙에는 흰색 텍스트 'Kimi K3 Is Now Open-Weight'가 강조되어 있고, 위쪽에는 반투명한 'Kimi' 로고, 아래쪽에는 브랜드명 'moonshot AI'가 있습니다. 오른쪽에는 기하학적 노드 연결 패턴이 표면에 있는 빛나는 보라색 테크 스타일 자물쇠 아이콘이 있으며, 후광이 있는 플랫폼 위에 떠 있고 주위에 점광선이 감싸고 있습니다. 왼쪽에는 코드 기호가 있는 모델 카드가 있어 이 2.8T 파라미터 최첨단 모델의 오픈 웨이트 특성을 강조합니다.

Kimi K3, 이제 가중치 공개: 2.8조 파라미터 프론티어 모델 '달의 어두운 면'을 탐험하다

서론

Moonshot AI(월지암면 AI)가 약속을 지켰습니다. 자사의 역대 최대 규모이자 가장 야심찬 모델인 Kimi K3의 전체 가중치를 공식 발표한 것입니다.

이 모델은 현재 Moonshot AI의 공식 Hugging Face 및 GitHub 페이지를 통해 다운로드할 수 있으며, 상세 기술 보고서와 관련 인프라 프로젝트도 함께 제공됩니다.

Kimi K3는 네이티브 멀티모달 혼합 전문가(MoE) 모델로, 총 2.8조 개의 파라미터를 보유하고 있으며, 각 토큰당 약 1,040억 개의 파라미터가 활성화되고 100만 토큰의 컨텍스트 윈도우를 지원합니다.

Moonshot은 이를 장기 프로그래밍, 연구, 멀티모달 이해, 에이전트 기반 지식 작업, 그리고 수백 또는 수천 단계에 달할 수 있는 추론 작업을 위해 설계된 오픈 웨이트(open-weight) 프론티어 모델로 자리매김하고 있습니다.

이번 발표는 두 가지 측면에서 중요합니다.

첫째, 모델 자체가 오픈 웨이트 규모를 3조 파라미터 수준으로 끌어올렸습니다.

둘째, Moonshot이 공개한 내용은 모델 체크포인트에 그치지 않습니다. 공개 자료에는 아키텍처, 사후 훈련 전략, 장문맥 강화 학습 인프라, 전문가 병렬 훈련 시스템, 추론 최적화, 벤치마크 결과 및 여러 장기 실행 엔지니어링 사례 연구가 상세히 기술되어 있습니다.

이 이미지는 Moonshot AI가 Kimi K3 오픈소스 모델을 공개한 GitHub 프로젝트 페이지를 보여줍니다. 프로젝트 브랜치는 main이며, 총 1개의 브랜치와 0개의 태그가 있고, 가장 최근 커밋은 7분 전의 초기 커밋입니다. 페이지에는 assets 폴더, LICENSE 파일, README.md 파일, 그리고 k3_tech_report.pdf라는 기술 보고서 파일이 포함되어 있으며, 이는 문서에서 언급된 Kimi K3와 함께 공개된 부속 자료들입니다. 사용자는 페이지의 "Code" 버튼을 통해 프로젝트 코드 관련 내용을 확인할 수 있습니다.

Kimi K3 전체 가중치, 이제 사용 가능

Moonshot은 이전에 Kimi K3를 발표하고 2026년 7월 27일까지 전체 가중치를 공개하겠다고 약속했습니다.

이제 그 공개가 완료되었습니다.

공식 모델은 다음 채널에서 확인할 수 있습니다.

GitHub 저장소에는 README 파일, Kimi K3 라이선스, 전체 기술 보고서, 아키텍처 및 벤치마크 리소스, 배포 가이드, 모델 사용 설명이 포함되어 있습니다.

Hugging Face 모델 카드는 모델 구성과 공개된 가중치에 대한 액세스 방법을 제공합니다.

이는 이 모델이 공개 출시 예정이었던 관리형 프론티어 시스템에서, 연구자 및 자격을 갖춘 인프라 팀이 Kimi K3 라이선스 조건에 따라 실제로 다운로드, 검사, 배포, 미세 조정 및 개조할 수 있는 모델로 전환되었음을 의미합니다.

이미지는 Kimi K3 관련 정보를 보여줍니다. Kimi K3는 오늘 Kimi.com, Kimi Work, Kimi Code 및 Kimi API에서 사용할 수 있습니다. 출시 시 Kimi K3는 기본적으로 최대 사고 노력을 사용하며, 향후 업데이트를 통해 저-고 노력 모드가 도입될 예정입니다. 현재 추론 파트너 및 오픈소스 유지관리자와 긴밀히 협력하여 기술적 세부 사항을 일관되게 유지하고 생태계의 안정적인 배포를 보장하고 있습니다. 전체 모델 가중치는 2026년 7월 27일에 공개될 예정이며, 아키텍처, 훈련 및 평가 세부 사항은 Kimi K3 기술 보고서와 함께 발표됩니다.

Kimi K3의 '공개'가 의미하는 바

Kimi K3는 공개된 코드와 문서를 갖춘 오픈 웨이트 모델이라고 설명하는 것이 가장 적절합니다.

해당 라이선스는 사용자가 라이선스 조건에 따라 모델을 사용, 복제, 수정, 미세 조정, 배포, 파생 저작물 생성, 재배포, 재라이선스 및 판매할 수 있는 광범위한 권리를 부여합니다.

하지만,

이 라이선스에는 추가적인 상업적 요구 사항이 포함되어 있습니다.

예를 들어, 적격 모델-서비스(MaaS) 사업을 운영하며 연속 12개월 동안 총 수익이 2,000만 달러를 초과하는 회사는 Kimi K3 또는 그 파생물을 상업적 목적으로 사용하기 전에 Moonshot AI와 별도의 계약을 체결해야 합니다.

또한 이 라이선스는 특정 사용자 또는 수익 기준을 초과하는 특정 초대형 상업 제품 또는 서비스에 대해 표시 요구 사항을 규정하고 있습니다.

내부 사용 및 Moonshot 공식 제품 또는 인증된 추론 파트너를 통한 사용은 별도로 취급됩니다.

따라서 Kimi K3를 상업적 목적으로 사용하려는 모든 사람은 Apache 2.0, MIT 또는 기타 표준 허용 라이선스와 동일하다고 가정하지 말고 실제 라이선스를 주의 깊게 읽어야 합니다.

1,040억 개 활성화 파라미터를 가진 2.8조 파라미터 모델

Kimi K3의 총 용량은 매우 방대하지만, 혼합 전문가(MoE) 설계는 모든 토큰이 2.8조 개의 파라미터 전체를 활성화하지 않음을 의미합니다.

공식 모델 카드는 다음 정보를 제공합니다.

사양 Kimi K3
아키텍처 혼합 전문가(MoE)
총 파라미터 수 2.8T
활성화 파라미터 수 104B
레이어 수 93
밀집 레이어 수 1
라우팅 전문가 수 896
토큰당 선택된 전문가 수 16
공유 전문가 수 2
어휘 크기 160K
컨텍스트 길이 1,048,576 토큰
비전 인코더 MoonViT-V2
비전 인코더 파라미터 수 401M
양자화 방식 MXFP4 가중치 / MXFP8 활성화
모달리티 텍스트 및 이미지

기술 보고서는 Kimi K2와의 보다 정확한 아키텍처 비교를 제공합니다.

이미지는 Kimi K2와 Kimi K3의 아키텍처 비교표로, 레이어 수, 총 파라미터, 활성화 파라미터, 히든 차원, 전문가 차원 등 다양한 측면의 차이를 보여줍니다. Kimi K3는 레이어 수, 총 파라미터, 활성화 파라미터, 전문가 차원 등에서 향상되었으며, 레이어 수는 52%, 총 파라미터는 167%, 활성화 파라미터는 220% 증가했습니다. 또한 Kimi K3는 새로운 어텐션 및 잔차 메커니즘을 도입했으며, 훈련 컨텍스트 길이, 어텐션 메커니즘, 활성화 함수 등에 변화가 있습니다. 이 표는 문맥과 밀접하게 관련되어 Kimi K3가 Kimi K2에 비해 아키텍처적으로 개선된 점을 시각적으로 보여줍니다.

Kimi K2와 비교하여 K3는 모델 깊이와 전문가 희소성을 증가시키는 동시에 새로운 어텐션 및 잔차 메커니즘을 도입했습니다.

Moonshot은 Kimi K2 대비 아키텍처 및 훈련 방식의 종합적인 개선을 통해 전반적인 확장 효율성이 약 2.5배 향상되었다고 밝혔습니다.

이 주장은 추가 계산 능력이 모델 성능으로 전환되는 효율성을 의미하며, 일반적인 의미의 2.5배 추론 속도 향상을 의미하는 것은 아닙니다.

네이티브 멀티모달과 백만 토큰 컨텍스트 윈도우

Kimi K3는 훈련 종료 시점에 비전 모듈을 연결한 언어 모델이 아닌, 네이티브 멀티모달 모델로 설계되었습니다.

비전 인코더 MoonViT-V2는 약 4.01억 개의 파라미터를 보유하고 있습니다.

기술 보고서에 따르면 MoonViT-V2는 SigLIP과 같은 대조 사전 훈련된 비전 모델에서 초기화되는 대신, 모델의 다음 토큰 예측 목표를 통해 처음부터 훈련되었습니다.

Moonshot은 이 방법이 훈련 과정에서 안정성을 유지하고 경쟁력 있는 비전 성능을 달성했다고 보고합니다.

![이미지는 Moonshot

AI 사전 학습 절제 실험에서, 다양한 모델의 시각적 타워 그래디언트 노름이 학습 단계에 따라 변화하는 양상. 그림 (a)는 전체 학습 궤적, 그림 (b)는 14k~16k 단계의 확대도. 파란색 선은 SigLIP에서 초기화된 MoonViT-3D, 빨간색 선은 처음부터 학습된 MoonViT-V2를 나타냄. SigLIP 초기화 모델과 비교해 처음부터 학습된 MoonViT-V2는 더 낮은 그래디언트 노름을 유지하며 변동이 적어, 최적화가 더 안정적임을 보여줌. 이 그림은 문맥과 밀접하게 연결되어 MoonViT-V2의 학습 과정 안정성을 직관적으로 제시함.](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/63b386e9-0be5-4813-a254-4665269d9469-a3cea91a-babc-4ab7-9d22-af510c0efa46.jpeg)

](https://we0-cms.oss-cn-beijing.aliyuncs.com/cms-assets/image/2026/07/b6691c45-6229-4970-8a27-4e5a6deb00e1-dc511091-a635-4fc2-a80b-ab2e008b1415.png)

해당 모델이 지원하는 컨텍스트 길이는 다음과 같습니다:

1,048,576개의 토큰

이 규모는 에이전트 시스템에서 특히 중요합니다. 장시간 실행되는 코딩 또는 연구 작업은 저장소 내용, 도구 출력, 로그, 스크린샷, 연구 자료, 중간 계획, 테스트 실패 기록, 이전 추론 결과 및 다중 수정 정보를 축적할 수 있기 때문입니다.

백만 토큰 규모의 컨텍스트가 컨텍스트 관리의 필요성을 없애는 것은 아니지만, K3가 기존의 짧은 컨텍스트 시스템보다 훨씬 큰 작업 기록을 유지할 수 있게 해줍니다.

세 가지 주요 아키텍처 변경 사항

기술 보고서는 K3의 규모와 안정성을 여러 아키텍처 변경에 기인한다고 밝힙니다.

그중 가장 눈에 띄는 세 가지는 다음과 같습니다:

  1. 혼합 KDA + 게이트 MLA 주의 메커니즘.
  2. 주의 잔차.
  3. 안정적인 잠재 혼합 전문가 모델.

이미지는 Kimi K3 아키텍처를 세 부분으로 나누어 보여줍니다. 왼쪽은 Stable Normalized LatentMoE와 KDA 모듈로, Shared Expert, Routed Expert, Router, Linear, Norm 등의 구성 요소를 포함합니다. 오른쪽 상단은 AttnRes 연산으로, Output, Stable LatentMoE, Gated MLA, Stable LatentMoE, KDA 등이 있습니다. 오른쪽은 Block Attention Residuals 백본으로, Block n-1, Block n-2, Block n-3 등이 있습니다. 이 그림은 문맥과 밀접하게 연결되어 Kimi K3 아키텍처의 세 가지 주요 변경 사항의 모듈 구조를 직관적으로 제시합니다.

1. 혼합 주의 메커니즘: KDA + 게이트 MLA

Kimi K3는 혼합 주의 설계를 채택했습니다.

공식 모델 카드에는 다음과 같이 명시되어 있습니다:

69개 레이어 KDA + 24개 레이어 게이트 MLA

이 아키텍처는 여러 Kimi Delta Attention 레이어와 주기적인 게이트 멀티헤드 잠재 주의 레이어가 결합된 반복 패턴을 따릅니다.

Kimi Delta Attention

KDA는 초장기 컨텍스트와 관련된 메모리 및 계산 부담을 줄이기 위해 설계된 선형 주의 메커니즘입니다.

KDA는 표준 전체 주의와 동일한 방식으로 각 토큰에 따라 증가하는 기존 KV 캐시를 사용하는 대신, 순환 상태를 유지합니다.

따라서 백만 토큰 시퀀스에 매력적입니다.

Moonshot은 이전에 Kimi Linear Research 시리즈를 통해 KDA를 소개했으며, 팀은 평가 조건에서 KDA가 전체 주의에 비해 KV 캐시 요구를 줄이고 장문맥 디코딩 처리량을 향상시켰다고 보고했습니다.

게이트 MLA

K3는 글로벌 주의를 완전히 대체하지 않습니다.

주기적인 게이트 MLA 레이어는 모델이 컨텍스트 내에서 정보를 전역적으로 검색할 수 있는 능력을 유지합니다.

따라서 이 혼합 설계는 두 가지 목표를 균형 있게 조정하려고 합니다:

  • 효율적인 긴 시퀀스 처리.
  • 강력한 전역 검색.

그 핵심 아이디어는 선형 주의가 항상 글로벌 주의보다 우수하다는 것이 아니라, 각 메커니즘이 긴 컨텍스트 문제의 다른 부분을 처리한다는 것입니다.

2. 주의 잔차

심층 신경망은 여러 계층을 통해 정보를 전달하면서 유용한 표현이 점차 손실되는 것을 피해야 합니다.

Kimi K3는 주의 잔차(AttnRes)를 도입하여 깊이에 따른 정보 전달 방식을 변경합니다.

이 메커니즘은 균일한 순차적 잔차 흐름에 의존하지 않고, 후속 모듈이 이전 모듈에서 생성된 표현을 선택적으로 검색할 수 있도록 합니다.

개념적으로, 이는 네트워크에 학습 메커니즘을 제공하여 어떤 초기 정보를 직접 접근 가능하게 유지할지 결정할 수 있게 합니다.

목표는 93개 레이어 모델에서 정보 흐름을 개선하되, 모든 특징이 동일한 잔차 경로를 엄격하게 통과하도록 강제하지 않는 것입니다.

3. 안정형 LatentMoE

Kimi K3는 MoE의 희소성을 크게 향상시켰습니다.

모델은 다음을 포함합니다:

896개의 라우팅 전문가

그러나 각 토큰은 다음만 활성화합니다:

16개의 라우팅 전문가

또한 모델에는 두 개의 공유 전문가가 포함되어 있습니다.

따라서 모델의 총 파라미터 수는 매우 크지만, 활성 계산량은 총 파라미터 수보다 훨씬 적습니다.

이러한 희소성 수준에서 훈련 안정성과 전문가 균형은 까다로운 문제가 됩니다.

Moonshot의 안정형 LatentMoE 설계는 이러한 문제를 해결하기 위한 여러 메커니즘을 포함합니다.

SiTU-GLU

Kimi K3는 SwiGLU를 SiTU-GLU로 대체했습니다. 이는 극단적인 확장 상황에서 무한히 증가하는 것을 방지하도록 설계된 활성화 함수입니다.

이미지는 GLU, SwiGLU 및 SiTU-GLU의 게이트 분기(Gate branch)와 상위 분기(Up branch) 구조와 그들의 스칼라 응답 곡선을 보여줍니다. 모든 분기는 스칼라 입력 x를 받으며, 곡선은 x ∈ [−10, 100]의 정의역을 공유하고, 오른쪽 아래는 원점 근처 영역을 확대하여 보여줍니다. SiTU-GLU는 β1 = 4, β2 = 25일 때, 그 곡선이 원점 근처에서 SwiGLU와 유사하며, x가 큰 양수일 때 SiTU-GLU의 |f(x)| ≤ β1β2 = 100인 반면, SwiGLU는 여전히 무한합니다. 이 그림은 Kimi K3에서 SiTU-GLU가 SwiGLU를 대체하여 극단적인 확장에서 무한 성장을 방지한다는 내용과 관련이 있습니다.

분위수 균형

이 시스템은 또한 전통적인 보조 균형 손실 함수에 완전히 의존하는 대신, 동적 라우팅 바이어스를 기반으로 한 부하 균형 방법을 채택합니다.

목표는 과도한 훈련 간섭을 도입하지 않으면서 라우팅된 토큰을 전문가 간에 더 고르게 분포시키는 것입니다.

백만 토큰 에이전트 훈련

Kimi K3의 기술 보고서는 특히 장시간 실행되는 에이전트의 사후 훈련을 강조합니다.

이 모델은 세 가지 영역에서 훈련되었습니다:

  • 일반 추론.
  • 일반 에이전트 작업.
  • 프로그래밍 에이전트.

또한 여러 가지 추론 정밀도 수준을 지원합니다:

  • 낮음.
  • 높음.
  • 최고.

최종 모델은 다중 교사 온라인 정책 증류(MOPD)를 통해 여러 특화 정책을 결합합니다.

Moonshot은 각 영역과 정밀도 수준에 대해 별도의 영구 모델을 훈련하는 대신, 특화된 교사 모델을 훈련하고 그 동작을 통합된 K3 정책으로 통합합니다.

AgentENV: 장시간 샌드박스 훈련

기술 보고서에는 AgentENV가 설명되어 있습니다. 이는 지속적인 에이전트 배포를 위한 인프라 계층입니다.

이 시스템은 Firecracker 기반을 사용합니다.

미세 가상 머신 환경을 통해 에이전트가 재현 가능한 샌드박스 내에서 긴 시퀀스 작업을 수행할 수 있습니다.

하나의 훈련 작업은 다음을 포함할 수 있습니다:

  1. 파일 읽기
  2. 코드 작성
  3. 명령 실행
  4. 애플리케이션 실행
  5. 스크린샷 캡처
  6. 시뮬레이션된 작업 공간 도구 사용
  7. 오류 디버깅
  8. 긴 지연 후 반환
  9. 이전 환경 상태에서 계속 실행

이는 짧은 질문-답변回合에 기반한 강화 학습과는 다릅니다.

에이전트는 수백 번의 도구 호출을 수행하고 시뮬레이션 환경에서 상태를 유지하며, 여러 가상의 일(日) 동안 지속될 수 있습니다.

원문은 Slack, Notion, Gmail 등의 애플리케이션이 포함된 시뮬레이션 환경에 대해 설명합니다.

주요 훈련 과제는 지속성입니다. 환경과 모델의 긴 컨텍스트 상태 모두 사용 가능한 상태로 유지되어야 합니다.

긴 배포 과정 동안.

지식 그래프 기반 작업 합성

긴 주기 훈련에는 또한 많은 수의 어려운 작업이 필요합니다.

Moonshot은 계층적 지식 그래프를 중심으로 구성된 작업 생성 파이프라인을 설명합니다.

이 그래프는 컴퓨터 과학, 인공지능, 코딩, 수학, 물리학, 화학, 생의학, 인문학 등 여러 분야를 포함합니다.

관련 개념이 함께 샘플링되고, 관련 공개 자료가 검색된 후, 이 자료들로부터 새로운 평가 또는 훈련 작업이 합성됩니다.

이 그래프의 목적은 단순히 답을 기억하는 것이 아니라 실제 도구 사용과 다단계 추론이 필요한 작업을 생성하는 것입니다.

3T 규모 MoE 모델의 인프라

백만 토큰 컨텍스트 윈도우를 가진 2.8T 모델은 모델 아키텍처만으로는 효율적인 훈련과 서비스가 불가능합니다.

Moonshot의 기술 보고서는 KDA 커널, 컨텍스트 병렬화, 전문가 병렬화, 메모리 관리, 장기 RL 스케줄링, 프리픽스 캐싱, 추측 디코딩, 서비스 승인 제어 등 시스템 작업을 다룹니다.

이 중 일부는 이미 공개되었습니다.

MoonEP: 균형 잡힌 전문가 병렬화

MoonEP는 Moonshot이 오픈소스로 공개한 전문가 병렬 통신 라이브러리입니다.

MoE 훈련에서 라우팅은 심각한 불균형을 초래할 수 있습니다.

라우터가 특정 전문가를 선호하기 때문에, 한 랭크가 다른 랭크보다 훨씬 많은 토큰을 받을 수 있습니다. 이런 경우 가장 빠른 장치가 가장 느린 장치를 기다려야 합니다.

MoonEP는 동적 중복 전문가를 사용하여 이 문제를 해결합니다.

현재 라우팅 패턴에 따라 임시 전문가 복사본을 생성하여 각 랭크의 토큰 작업 부하를 균형 있게 유지합니다.

이 프로젝트는 각 랭크가 예상 라우팅 토큰 부하량을 정확히 유지하고 통신 오버헤드를 줄이는 것을 목표로 설명합니다.

이는 K3 규모에서 896개의 전문가를 대규모 클러스터에 분산할 때 발생하는巨大的 동기화 문제를 해결하는 데 중요합니다.

FlashKDA: 고성능 KDA 커널

FlashKDA는 CUTLASS 기반으로 구현된 고성능 Kimi Delta Attention 커널을 제공합니다.

공개 저장소는 현재 다음 요구 사항을 명시합니다:

SM90 이상
CUDA 12.9 이상
PyTorch 2.4 이상

저장소는 지원 하드웨어에 대한 정확성 테스트와 벤치마크 데이터를 포함합니다.

FlashKDA는 K3의 긴 컨텍스트 아키텍처를 실용적으로 만드는 Attention 메커니즘을 가속화하기 위해 설계되었습니다.

네이티브 MXFP4 양자화

Kimi K3는 지도 미세 조정 단계부터 양자화 인식 훈련을 사용합니다.

공식 구성은 다음을 명시합니다:

MXFP4 가중치
MXFP8 활성화 값

이는 먼저 전체 정밀도 모델을 훈련한 후 훈련 후에 양자화하는 방식과 다릅니다.

모델은 파이프라인 내에서 이러한 저정밀도 형식을 직접 사용하여 연산하도록 훈련됩니다.

이는 메모리 및 통신 오버헤드를 줄이는 데 도움이 됩니다.

그러나 이것이 2.8T 모델을 일반 데스크탑 모델로 바꾸지는 않습니다.

Kimi K3를 로컬에서 실행할 수 있나요?

가중치는 공개되어 있지만, "다운로드 가능"하다고 해서 "노트북에서 쉽게 실행 가능"한 것은 아닙니다.

Kimi K3의 총 파라미터 수는 2.8조입니다.

희소 활성화와 저정밀도 형식을 사용하더라도 전체 모델을 실행하려면 대규모 집적 가속기 메모리, 고대역폭 장치 간 연결, 전문가 병렬 실행, 호환되는 추론 엔진, KDA, MLA 및 MoE에 대한 효율적인 지원이 필요합니다.

Moonshot 공식 저장소는 다음을 권장합니다:

  • vLLM
  • SGLang
  • Moonshot 배포方案을 통해 사용되는 TokenSpeed

생태계는 여전히 빠르게 진화 중입니다. 지원은 특정方案, 커널, 양자화 모드 및 하드웨어에 따라 달라질 수 있습니다.

자체 호스팅 환경을 구축하기 전에 최신 Kimi K3 배포 문서를 확인하고, 표준 Transformer 서비스 설정이 제대로 작동할 것이라고 가정하지 마십시오.

대부분의 개인 및 소규모 팀에게는 호스팅 API가 전체 모델을 실행하는 것보다 훨씬 쉬울 수 있습니다.

Kimi K3 API 및 추론 노력 수준

Moonshot은 또한 공식 API 플랫폼을 통해 Kimi K3를 제공합니다:

https://platform.kimi.ai/

모델 식별자는 다음과 같습니다:

kimi-k3

Kimi K3는 추론 기능을 사용하며 reasoning_content 필드를 반환합니다.

공식 모델 카드는 세 가지 추론 노력 수준을 설명합니다:

low
high
max

중요한 구현 세부 사항은 유지된思考 기록입니다.

다중 턴 에이전트 워크플로우의 경우, Moonshot은 개발자가 이전 전체 어시스턴트 메시지(reasoning_content, content, tool_calls 포함)를 다음 요청에 다시 전달해야 한다고 명시합니다.

이 중 일부 상태를 버리면 연속성이 손상될 수 있습니다. K3의 훈련 방식은 추론 기록을 유지해야 하기 때문입니다.

벤치마크 성능

Moonshot의 기술 보고서는 추론 및 지식, 코딩, 에이전트 워크플로우, 비전 측면에서 Kimi K3를 평가합니다.

자체 평가 스위트는 K3를 가장 강력한 사용 가능 모델 중 하나로 평가하며, 특정 작업에서 많은 오픈 가중치 및 독점 시스템보다 앞서 있습니다.

동시에 보고서는 이 모델이 전체적으로 가장 강력한 독점 시스템, 특히 Claude Fable 5 및 GPT-5.6 Sol에는 여전히 뒤처진다고 명확히 밝힙니다.

이 조건은 중요합니다.

주장은 K3가 모든 벤치마크에서 이겼다는 것이 아닙니다.

더 설득력 있는 결론은 Kimi K3가 오픈 가중치를 최근까지 주로 최첨단 독점 시스템과 관련된 성능 영역으로 가져왔다는 것입니다.

이미지는 표로, Kimi K3와 Claude Fable 5, GPT-5.6 Sol, GLM-5.2 등 모델의 추론 및 지식, 코딩, 에이전트 워크플로우, 비전 등 여러 측면에서의 성능을 비교합니다. 표에서 Bold는 최고 결과, Underline은 두 번째로 좋은 결과를 나타냅니다. 예를 들어 추론 및 지식 측면에서 Kimi K3는 GQA OpenWorld, Critiq, ACLRC 등 작업에서 두각을 나타내며 일부 작업에서는 Claude Fable 5 등 모델보다 우수합니다. 이 표는 맥락과 밀접하게 관련되어 Kimi K3의 다양한 작업에서의 성능을 시각적으로 보여줍니다.

여러 벤치마크 비교는 또한 Kimi Code, Claude Code, Codex 및 공식 벤치마크 도구를 포함한 다양한 에이전트 도구에 의존합니다.

따라서 에이전트 벤치마크 점수는 순수한 모델 능력의 반영으로 해석되어서는 안 됩니다.

측정 결과. 주변의 도구, 프롬프트, 컨텍스트 관리, 폴백 메커니즘 및 평가자가 결과에 실질적인 영향을 미칠 수 있습니다.

장기 코딩 사례 연구

보고서는 K3가 짧은 코드 완성 작업을 훨씬 넘어서는 복잡한 엔지니어링 작업에 적합함을 입증하기 위한 몇 가지 사례를 제공합니다.

이 사례들은 모델 개발자가 제공한 것으로, 사례 제시용으로 간주되어야 하며 일반적인 성능 보장으로 받아들여서는 안 됩니다.

MiniTriton: GPU 프로그래밍 시스템 구축

Moonshot은 Kimi K3가 MiniTriton, 즉 Triton과 유사한 컴팩트한 GPU 프로그래밍 시스템을 개발했다고 보고합니다.

이 프로젝트는 중간 표현(IR), 컴파일러 플로우, PTX 생성, 프론트엔드 언어, 런타임 컴포넌트, GPU 커널 최적화 및 분산 학습 프리미티브를 포함합니다.

이미지는 NVIDIA L20 GPU에서 MiniTriton 컴파일러를 사용하여 개발된 Kimi K3의 GPU 컴퓨팅 사례를 보여줍니다. CUDA 코어와 텐서 코어의 성능 스레드 차트, 그리고 MiniTriton과 torch eager, MiniTriton 분산 프리미티브(NCCL)와 단일 GPU 학습의 수렴 곡선 그래프를 포함합니다. CUDA 코어 스레드 차트는 train, gpt, torch eager 등 다양한 컴파일러의 성능을 비교하고, 텐서 코어 스레드 차트는 train, gpt 등 컴파일러의 성능을 비교하며, 수렴 곡선 그래프는 MiniTriton과 torch eager, MiniTriton 분산 프리미티브와 단일 GPU 학습의 학습 손실 변화를 각각 제시합니다.

Moonshot은 K3가 자체 아키텍처와 관련된 복잡한 커널도 최적화했으며, 선정된 커널에서 상당한 가속 효과를 달성했다고 언급했습니다.

이는 모델의 예상되는 동작을 보여줍니다: 복잡한 코드베이스 검사, 성능 분석 수행, 저수준 코드 작성, 결과 벤치마킹 및 반복적 개선이 그것입니다.

하지만 이것이 모든 모델이 생성하는 컴파일러나 커널을 인간의 검토나 테스트 없이 완전히 신뢰할 수 있다는 의미는 아닙니다.

48시간 칩 설계 실험

또 다른 사례 연구에서, Kimi K3는 샌드박스 환경에서 48시간 동안 실행되었으며, 위 아키텍처와 유사한 설계 방식을 가진 소형 모델을 위한 추론 칩 프로토타입을 만들도록 요청받았습니다.

이 모델은 오픈소스 전자 설계 자동화 도구와 Nangate 45nm 표준 셀 라이브러리를 사용했습니다.

Moonshot은 최종 설계 시뮬레이션이 4mm² 분석 면적 예산 내에서 완료되었으며, 100MHz 클록 주파수에서 타이밍 폐쇄를 달성했고, 약 146만 개의 표준 셀을 포함하며, 0.277MiB의 SRAM을 사용했으며, RTL 시뮬레이션을 통해 초당 8,700개 이상의 토큰 디코딩 처리량을 달성했다고 보고했습니다.

이미지는 Kimi K3가 설계한 추론 칩 프로토타입 관련 소개입니다. 초기 개념 검증으로서, Kimi K3는 동일한 아키텍처 설계를 따르며, 혼합 KDA 및 NoPE-MLA 어텐션 메커니즘, Block AttnRes, 시그모이드 기반 MoE 라우팅 등을 포함합니다. 4mm² 분석 면적 예산 내에서 설계는 100MHz 클록에서 타이밍을 폐쇄했으며, 약 146만 개의 표준 셀, 0.277MiB SRAM, 융합된 역양자화를 갖춘 INT4 MAC 어레이를 포함하고, RTL 시뮬레이션 디코딩 처리량은 초당 8,700 토큰을 초과합니다. 이 설계는 48시간 자율 실행 동안 Kimi Code를 사용하여 구축, 최적화 및 검증되었으며, 코드는 GitHub에서 확인할 수 있습니다.

이는 시뮬레이션 기반의 개념 검증이며, 양산용 칩이 아닙니다.

연구 코딩 및 천체물리학

K3는 또한 계산 천체물리학 재현 과제에서 평가되었습니다.

Moonshot은 모델이 20편 이상의 논문을 읽고 교차 검증했으며, 완전한 수치 계산 파이프라인을 구현했고, 300개 이상의 상태 방정식을 평가했으며, 발표된 공식의 불일치를 식별했고, 3,000줄 이상의 Python 코드를 작성했으며, 대화형 HTML 대시보드를 생성했다고 밝혔습니다.

![이미지는 연구 코딩 분야에서 Kimi K3의 성과를 보여줍니다. 계산 천체물리학에서 I-Love-Q 일반 관계를 재현하기 위해, Kimi K3는 20편 이상의 논문을 검토하고 결과를 교차 검증했으며, 완전한 수치 파이프라인을 구현했고, 300개 이상의 방정식 상태를 평가했으며, 공개된 공식의 불일치를 발견했고, 3,000줄 이상의 Python 코드를 작성했으며, 약 2시간 만에 대화형 HTML 대시보드를 생성한 반면, 숙련된 연구자는 일반적으로 1-2주가 소요됩니다. 해당 이미지는 맥락과 밀접하게 연관되어 Kimi K3가 연구 코딩 과제에서 달성한 구체적인 결과를 직관적으로 보여줍니다.]

보고에 따르면, 위 자율 작업에는 약 2시간이 소요된 반면, 숙련된 연구자는 일반적으로 1-2주가 필요합니다.

연구 작업의 경우 독립적 검증이 여전히 중요합니다. 모델은 완전한 파이프라인을 생성할 수 있지만, 가정, 단위, 수치 방법, 인용 또는 해석에서 미세한 오류가 발생할 수 있습니다.

사이버 보안 평가

기술 보고서는 또한 사이버 보안과 관련된 평가를 다루고 있습니다.

Moonshot AI는 Kimi K3가 통제된 보안 테스트에서 이전에 알려지지 않은 Linux 커널 취약점을 발견했으며, 관련 발견 사항은 인간 전문가에 의해 검토되었다고 밝혔습니다.

그 의의는 K3를 감독되지 않은 공격적 보안 작업에 사용해야 한다는 것이 아닙니다.

이는 긴 맥락 코딩 모델이 점차 대규모 코드베이스를 읽고, 저수준 동작을 추적하며, 가설을 세우고, 가설을 검증하며, 방법을 수정하고, 실패 시도 후에도 계속 진행할 수 있게 되고 있음을 보여줍니다.

이러한 능력은 방어적 감사 및 보안 코드 검토를 지원할 수 있지만, 권한 부여, 샌드박스 격리, 접근 통제 및 인간 감독을 더욱 중요하게 만듭니다.

비용 및 효율성

모델의 가치는 벤치마크 점수만으로 결정되지 않습니다.

장기 에이전트 시스템은 단일 작업에서 수백만 개의 토큰을 생성할 수 있습니다.

따라서 비용은 입력 길이, 출력 길이, 추론 복잡도, 캐시 적중률, 도구 호출 횟수, 재시도 횟수, 컨텍스트 관리 및 추론 제공자에 따라 달라집니다.

Moonshot AI의 기술 보고서는 여러 에이전트 벤치마크의 점수와 비용 비교를 포함하고 있습니다.

이 차트들은 K3가 일부 테스트 워크로드에서 상대적인 비용 효율성을 가지고 있음을 보여줍니다.

이는 K3가 모든 상황에서 모든 대안보다 저렴하다는 일반적인 결론으로 해석되어서는 안 됩니다.

프로덕션 계획에서는 백만 토큰당 가격만이 아니라 작업을 성공적으로 완료하는 데 드는 총 비용을 측정해야 합니다.

오픈소스 가중치 공개의 의미

Kimi K3의 공개는 단일 모델의 순위를 넘어서는 의미를 가집니다.

이는 API 전용 시스템에서 연구하기 어려운 여러 연구 및 엔지니어링 분야를 개척했습니다.

연구자들은 모델 가중치, MoE 동작, KDA 기반 어텐션 메커니즘, 긴 컨텍스트 메커니즘, 비전 구성 요소, 양자화 동작, 서빙 시스템 및 에이전트 사후 훈련 전략을 검사하거나 수정할 수 있습니다.

인프라 팀은 다양한 서빙 방안을 테스트할 수 있습니다.

기업은 하드웨어 경제성이 합리적인 경우 사설 배포를 평가할 수 있습니다.

커뮤니티는 다음을 구축할 수 있습니다:

  • 새로운 추론 방안
  • 양자화 변형
  • 파인튜닝 파생 모델
  • 특정 도메인 시스템
  • 평가 프레임워크
  • 모델 라우팅 도구
  • 하드웨어 특화 최적화

이러한 것들이 초기 중요 오픈소스 모델 출시에 필적하는 생태계를 구축할 수 있을지는 추론 비용, 접근 가능한 하드웨어, 라이선스 조건, 커뮤니티 툴체인 및 파생 소형 모델의 품질에 달려 있습니다.

Kimi K3 배포 전 실용 체크리스트

1. 라이선스 계약 읽기

귀하의 사용 사례가 내부 연구, 기업 용도, 파인튜닝, 임베디드 애플리케이션, 공공 추론 또는 모델 서비스에 해당하는지 확인하십시오.

2. 하드웨어 지원 확인

가속기 아키텍처, HBM 용량, 상호 연결 방식, CUDA 버전, 커널 요구 사항, 양자화 지원, 장치 수 및 전문가 병렬 토폴로지를 확인하십시오.

3. 지원되는 추론 엔진 선택

현재 vLLM, SGLang 또는 기타 공식 지원 서비스 경로에 맞는 K3 전용 방안을 사용하십시오.

4. 전체 100만 컨텍스트 별도 테스트

프리필 지연 시간, 디코딩 지연 시간, 프리픽스 캐싱 동작, 메모리 점유율, 동시성 능력, 처리량 및 장애 복구를 측정하십시오.

5. 추론 기록 보존

에이전트 기반 다중 턴 워크플로우의 경우 Moonshot의 지침에 따라 추론 및 도구 호출 상태를 포함한 전체 어시스턴트 메시지를 반환하십시오.

6. 실제 작업 검증

자체 저장소, 연구 워크플로우, 문서, 비전 작업, 도구 사용 및 에이전트 시나리오에 대해 벤치마킹하십시오.

7. 완료된 각 작업의 비용 측정

단순히 토큰 가격에 집중하는 것은 오해를 불러일으킬 수 있습니다. 재시도 횟수, 도구 호출, 출력 길이 및 인간 개입 비용을 계산하십시오.

자주 묻는 질문

Kimi K3는 오픈소스인가요?

Kimi K3의 전체 가중치, 코드베이스, 문서 및 기술 보고서는 모두 공개되었으며, MoonShot은 이를 오픈 가중치 모델이라고 설명합니다. 이 모델은 Apache 2.0이 아닌 맞춤형 Kimi K3 라이선스를 사용합니다.

등 표준 프로토콜의 경우, 상업 사용자는 구체적인 조항을 신중히 검토해야 합니다.

Kimi K3는 어디에서 다운로드하나요?

공식 가중치는 Hugging Face의 Moonshot AI에서 받을 수 있습니다. 주요 소스 코드 저장소와 기술 보고서는 GitHub에서 확인할 수 있습니다.

Kimi K3의 파라미터 수는 얼마인가요?

Kimi K3의 총 파라미터 수는 약 2.8조 개입니다. 희소 혼합 전문가 모델 아키텍처를 채택하여 각 토큰당 약 1,040억 개의 파라미터가 활성화됩니다.

Kimi K3의 컨텍스트 윈도우는 얼마인가요?

공식 모델은 최대 1,048,576개의 토큰 컨텍스트를 지원합니다. 긴 컨텍스트 배포는 특히 동시 접속 시나리오에서 여전히 많은 메모리와 추론 인프라가 필요합니다.

Kimi K3를 소비자용 GPU에서 실행할 수 있나요?

완전한 2.8T 모델은 일반 소비자용 GPU에서 사실상 실행이 불가능합니다. 희소 활성화와 저비트 양자화를 적용하더라도 전체 가중치와 서비스 스택에는 대규모 멀티 액셀러레이터 인프라가 필요합니다.

어떤 추론 엔진이 Kimi K3를 지원하나요?

Moonshot 공식 저장소는 K3 전용 배포 가이드를 통해 vLLM, SGLang, TokenSpeed를 사용할 것을 권장합니다. 이 모델은 KDA, MLA, MoE 및 MXFP4 관련 최적화를 채택했으므로 배포 전에 현재 지원되는 버전을 확인해야 합니다.

MoonEP와 FlashKDA란 무엇인가요?

MoonEP는 Moonshot이 오픈소스로 공개한 전문가 병렬 통신 라이브러리로, GPU 간 MoE 토큰 로드 밸런싱에 사용됩니다. FlashKDA는 CUTLASS 기반으로 구축된 고성능 Kimi Delta 어텐션 커널입니다.

Kimi K3가 GPT-5.6 Sol 및 Claude Fable 5보다 우수한가요?

모든 면에서 뛰어난 것은 아닙니다. Moonshot의 기술 보고서에 따르면 Kimi K3는 최첨단 성능 수준에 도달했으며 특정 작업에서 선두를 차지했지만, 전반적으로 가장 강력한 독점 시스템에는 여전히 뒤처집니다. 벤치마크 결과는 에이전트 프레임워크, 도구, 추론 설정 및 평가 방법에 따라 달라집니다.

관련 도구

  • Hugging Face의 Kimi K3: 공식 모델 카드 및 전체 Kimi K3 가중치.
  • GitHub의 Kimi K3: README, 라이선스, 자산 및 기술 보고서가 포함된 공식 저장소.
  • MoonEP: Moonshot의 전문가 병렬 통신 라이브러리로 MoE 워크로드 동적 밸런싱용.
  • FlashKDA: CUTLASS 기반 고성능 Kimi Delta 어텐션 커널.
  • vLLM: Kimi K3 배포 가이드에서 권장하는 오픈소스 추론 및 서비스 엔진.
  • SGLang: Moonshot이 K3 배포용으로 명시한 오픈소스 LLM 및 멀티모달 서비스 프레임워크.
  • Kimi API: Moonshot AI가 호스팅하는 API 플랫폼으로 kimi-k3 모델에 접근 가능.

관련 링크

요약

Moonshot AI는 이제 전체 Kimi K3 가중치를 공개하여 2.8T 파라미터의 최첨단 모델을 연구자와 인프라 팀이 Kimi K3 라이선스 하에 검사, 배포, 미세 조정 및 확장할 수 있는 시스템으로 전환했습니다.

이 모델은 104B 활성화 파라미터, 1M 토큰 컨텍스트 윈도우, 네이티브 멀티모달, 하이브리드 KDA/Gated-MLA 어텐션 메커니즘, 어텐션 잔차 연결, 안정적인 잠재 MoE, 양자화 인식 학습 및 장기 호라이즌 에이전트 후학습을 결합했습니다.

이번 공개는 MoonEP 및 FlashKDA와 같은 프로젝트를 통해 모델 뒤에 숨은 일부 시스템 엔지니어링을 드러냈다는 점에서도 중요합니다. K3는 여전히 자체 호스팅 요구 사항이 매우 높은 모델이며, 최고 성능 결과는 프레임워크 선택과 개발자 실행 환경의 맥락에서 해석되어야 합니다.

평가.
진정한 이정표는 단순히 2.8T 규모의 모델이 존재한다는 사실이 아니라, 이러한 규모의 모델이 이제 더 넓은 커뮤니티가 검토하고 실행하며 그 위에 구축할 수 있게 되었다는 점입니다.