Kimi K3, 프론트엔드 코드 아레나 정상 등극, GPU 컴파일러 구축, 48시간 만에 칩 설계
문지암면(Moonshot AI)이 Kimi K3를 출시했습니다. 이 모델은 장시간 코딩, 지식 작업, 시각적 추론 및 에이전트 기반 워크플로우를 위해 설계된 네이티브 멀티모달 모델입니다. 이 모델은 총 2.8조 개의 파라미터, 100만 토큰의 컨텍스트 윈도우, 그리고 고도로 희소한 혼합 전문가 아키텍처를 갖추고 있습니다. 각 토큰에 대해 896개의 전문가 중 단 16개만 활성화됩니다. 문지암면은 이를 최초의 공개 3T급 모델이라고 설명했지만, 회사의 발표에 따르면 전체 모델 가중치는 2026년 7월 27일에 공개될 예정입니다. Kimi K3는 프론트엔드 개발, 자율 GPU 커널 최적화, MiniTriton이라는 소형 GPU 컴파일러 생성, 그리고 오픈소스 전자 설계 자동화 도구를 사용한 48시간 만의 칩 설계 실험 등의 성과로 즉시 주목을 받았습니다. 문지암면은 또한 K3가 모든 범주에서 선두를 달리는 것은 아니라고 인정했습니다. 자체 평가에 따르면 이 모델은 전반적인 성능에서 Claude Fable 5와 GPT-5.6 Sol에 뒤쳐지지만, 여러 코딩 및 장시간 에이전트 작업에서 더 나은 결과를 보여줍니다. 이미지 출처: 기사에서 공유한 Artificial Analysis 스마트 비교, Kimi K3의 위치를 보여줍니다. Kimi K3는 문지암면의 API 가격을 이전 Kimi 코딩 모델보다 더 높은 수준으로 끌어올렸습니다. 원본 보고서의 가격표에는 중국 지역 API에 대한 다음 요율이 나와 있습니다: | 모델 | 캐시 적중 입력 | 캐시 미스 입력 | 출력 | |-|-|-|-| | Kimi K3 | 백만 토큰당 ¥2 | 백만 토큰당 ¥20 | 백만 토큰당 ¥100 | | Kimi K2.7 Code | 백만 토큰당 ¥1.30 | 백만 토큰당 ¥6.50 | 백만 토큰당 ¥27 | 출처: 기사에서 Kimi K3와 Kimi K2.7 Code 가격 비교. 문지암면 국제 API 플랫폼에 나열된 Kimi K3 가격은 다음과 같습니다: - 백만 캐시 적중 입력 토큰당 $0.

Kimi K3, 프론트엔드 코드 아레나 정상 등극, GPU 컴파일러 구축, 48시간 만에 칩 설계
서론
문지암면(Moonshot AI)이 Kimi K3를 출시했습니다. 이 모델은 장시간 코딩, 지식 작업, 시각적 추론 및 에이전트 기반 워크플로우를 위해 설계된 네이티브 멀티모달 모델입니다.
이 모델은 총 2.8조 개의 파라미터, 100만 토큰의 컨텍스트 윈도우, 그리고 고도로 희소한 혼합 전문가 아키텍처를 갖추고 있습니다. 각 토큰에 대해 896개의 전문가 중 단 16개만 활성화됩니다. 문지암면은 이를 최초의 공개 3T급 모델이라고 설명했지만, 회사의 발표에 따르면 전체 모델 가중치는 2026년 7월 27일에 공개될 예정입니다.
Kimi K3는 프론트엔드 개발, 자율 GPU 커널 최적화, MiniTriton이라는 소형 GPU 컴파일러 생성, 그리고 오픈소스 전자 설계 자동화 도구를 사용한 48시간 만의 칩 설계 실험 등의 성과로 즉시 주목을 받았습니다.
문지암면은 또한 K3가 모든 범주에서 선두를 달리는 것은 아니라고 인정했습니다. 자체 평가에 따르면 이 모델은 전반적인 성능에서 Claude Fable 5와 GPT-5.6 Sol에 뒤쳐지지만, 여러 코딩 및 장시간 에이전트 작업에서 더 나은 결과를 보여줍니다.
이미지 출처: 기사에서 공유한 Artificial Analysis 스마트 비교, Kimi K3의 위치를 보여줍니다.
더 비싼 Kimi 모델
Kimi K3는 문지암면의 API 가격을 이전 Kimi 코딩 모델보다 더 높은 수준으로 끌어올렸습니다.
원본 보고서의 가격표에는 중국 지역 API에 대한 다음 요율이 나와 있습니다:
| 모델 | 캐시 적중 입력 | 캐시 미스 입력 | 출력 |
|---|---|---|---|
| Kimi K3 | 백만 토큰당 ¥2 | 백만 토큰당 ¥20 | 백만 토큰당 ¥100 |
| Kimi K2.7 Code | 백만 토큰당 ¥1.30 | 백만 토큰당 ¥6.50 | 백만 토큰당 ¥27 |
출처: 기사에서 Kimi K3와 Kimi K2.7 Code 가격 비교.
문지암면 국제 API 플랫폼에 나열된 Kimi K3 가격은 다음과 같습니다:
- 백만 캐시 적중 입력 토큰당 $0.30
- 백만 캐시 미스 입력 토큰당 $3.00
- 백만 출력 토큰당 $15.00
이는 Kimi K2.7 Code보다 훨씬 비싸지만, 문지암면이 출시 비교에서 인용한 Claude Fable 5의 가격보다는 여전히 낮습니다.
가격 비교표에 따르면 Kimi K3의 출력 가격은 Claude Fable 5 제시 가격의 30%에 불과합니다.
가격 비교를 읽을 때는 주의가 필요합니다. API 요율은 지역, 공급업체, 캐시 동작 및 후속 제품 업데이트에 따라 다를 수 있습니다. 배포 전에 공식 Kimi API 페이지에서 현재 과금 기준을 확인하는 것이 가장 좋습니다.
Kimi K3, 프론트엔드 코드 경기장 1위
가장 주목할 만한 초기 성과는 프론트엔드 개발 분야에서 나왔습니다.
이 글을 작성하는 시점에서 Kimi K3는 Arena 프론트엔드 코드 경기장의 예비 WebDev 순위에서 1위를 차지했습니다. 출처 차트에 따르면 승률은 76%로, Claude Fable 5와 GPT-5.6 Sol을 앞서고 있습니다.
Kimi K3가 보고서에 제시된 예비 프론트엔드 코드 경기장 결과에서 1위를 차지했습니다.
7개의 프론트엔드 범주 중 원본 보고서에 따르면 K3는 6개 범주에서 1위를 차지했습니다:
- 브랜드 및 마케팅 웹사이트
- 참조 이미지 디자인
- 데이터 분석 인터페이스
- 소비자 제품
- 시뮬레이션
- 콘텐츠 제작 도구
게임 범주에서는 2위를 기록한 것으로 알려졌습니다.
이러한 결과는 프론트엔드 작업이 단순한 코드 생성 문제가 아니기 때문에 특히 중요합니다. 유능한 대규모 모델은 시각적 요구 사항을 해석하고, 기능적인 애플리케이션을 만들고, 실행하고, 결과를 검사하고, 인터페이스가 예상 디자인과 일치하지 않을 때 구현을 수정할 수 있어야 합니다.
브라우저 기반 macOS 스타일 인터페이스 재구축
원본 기사에서 인용된 한 예는 에이전트 클러스터를 사용하여 약 6시간 만에 macOS 27 스타일 인터페이스를 재현한 것입니다.
결과는 단순한 정적 스크린샷이 아닙니다. 보고서에 따르면 브라우저 및 전화 기능과 같은 몇 가지 예외를 제외하고 대부분의 데스크톱 애플리케이션과 상호 작용이 정상적으로 작동했습니다.
에이전트가 생성한, 현대 데스크톱 운영 체제를 모방한 브라우저 인터페이스.
다른 데모에는 로봇 손 시뮬레이터와 Three.js 및 WebGPU를 사용한 완전한 프로그래밍 기반의 브라우저 기반 3D 게임이 포함되었습니다.
이러한 예는 여전히 표준화된 벤치마크가 아닌 데모 수준이지만, Moonshot이 K3가 지원하기를 원하는 워크플로우 유형, 즉 장시간 실행되고 시각적이며 반복적인 소프트웨어 생성을 보여줍니다.
루프 속의 시각
Moonshot은 K3의 프론트엔드 워크플로우를 루프 속의 시각으로 설명합니다.
모델은 코드를 한 번 생성하고 멈추는 대신 다음을 수행할 수 있습니다:
- 애플리케이션 코드를 작성하거나 수정합니다.
- 프로젝트를 실행합니다.
- 실시간 스크린샷 또는 렌더링 결과를 확인합니다.
- 레이아웃, 색상, 계층 구조 또는 상호 작용 문제를 감지합니다.
- 코드를 수정합니다.
- 업데이트된 결과를 다시 렌더링하고 위 단계를 반복합니다.
이 프로세스는 코드 생성과 시각적 평가 사이의 격차를 해소합니다.
모델이 문법적으로 유효한 HTML, CSS 및 JavaScript를 생성할 수 있지만 여전히 형편없는 인터페이스를 만들 수도 있습니다. 렌더링 출력을 관찰함으로써 K3는 소스 코드만으로는 발견하기 어려운 문제를 식별할 수 있습니다.
더 큰 프론트엔드 저장소의 경우 100만 토큰 컨텍스트 윈도우도 중요합니다. 하나의 작업 컨텍스트 내에 많은 구성 요소, 유형 정의, 디자인 시스템 규칙, 프로젝트 문서 및 파일 간 종속성을 수용할 수 있습니다.
원본 기사는 또한 절충점을 언급했습니다. 일부 사용자는 복잡한 프론트엔드 작업에 20분에서 1시간 사이가 소요된다고 보고했습니다. 이는 통제된 지연 시간 측정이 아닌 개별 관찰일 뿐이지만, K3가
장기적인 반복을 선호할 가능성이 높으며, 즉각적인 출력보다는 그렇습니다.
프로그래밍 벤치마크와 장기 엔지니어링
프로그래밍은 Kimi K3의 핵심 강점 중 하나입니다.
원본 보고서의 벤치마크 차트에는 다음과 같은 결과가 나열되어 있습니다.
| 벤치마크 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 |
| Program Bench | 77.8 | 76.8 | 77.6 |
| SWE Marathon | 42.0 | 35.0 | 39.0 |

Kimi K3의 여러 프로그래밍 및 소프트웨어 엔지니어링 평가에 대한 보고된 결과.
Kimi K3 공식 블로그는 중요한 방법론적 설명을 제공합니다.
DeepSWE의 경우, Moonshot은 주요 비교에서 Kimi Code 프레임워크의 결과를 보고한 반면, 공개 mini-SWE-agent 순위표 결과는 67.3으로 나열됩니다. 따라서 프레임워크 및 평가 설정에 따라 미세한 차이가 나타날 수 있습니다.
SWE Marathon의 경우, Moonshot은 공식 작업의 H20 교정 브랜치를 사용했습니다. 또한, Claude Fable 5가 일부 평가에서 백업 동작을 보여 측정 점수가 낮아졌을 수 있다고 지적했습니다.
이러한 세부 사항이 결과를 부정하는 것은 아니지만, 모델을 비교할 때 중요합니다. 에이전트 프레임워크, 도구 권한, 하드웨어, 추론 설정, 백업 동작 및 작업 교정 모두 최종 점수에 영향을 미칠 수 있습니다.
자율 GPU 커널 최적화
Moonshot은 Kimi K3가 최소한의 인간 감독 하에 GPU 커널을 최적화할 수 있는지 테스트했습니다.
각 모델은 동일한 샌드박스 환경을 제공받았으며, 최대 24시간 동안 다음 관련 커널에 대한 분석, 재작성, 벤치마킹 및 최적화를 완료할 수 있었습니다.
- Attention Residuals
- Kimi Delta Attention
- 512 헤드 차원의 MLA 워크로드
- 다른 공급업체의 범용 GPU
NVIDIA 테스트는 H200 하드웨어에서 실행되었습니다.
AttnRes 최적화
Attention Residuals 워크로드의 경우, 원문은 K3가 새로운 2단계 커널 알고리즘을 설계하여 정방향 및 역방향 실행의 총 소요 시간을 283.6밀리초에서 114.4밀리초로 줄였다고 밝혔습니다.
이는 기준선 대비 약 59.7%의 가속에 해당하며, Moonshot의 실험 구성에서 Kimi K3가 Claude Fable 5의 성능에 근접하도록 만들었습니다.

Kimi K3가 AttnRes 커널 작업에서 보고된 개선 궤적 그래프.
이 그래프는 또한 에이전트가 시간이 지남에 따라 개선되는 과정을 보여줍니다. K3는 실행 초기에 여러 주요 진전을 이루었고, 이후 후속 반복을 통해 커널을 지속적으로 최적화했습니다.
MLA-512 커널
MLA-512 작업을 처음부터 시작한 경우, Kimi K3의 커널은 정방향 및 역방향 결합 부하에서 보고된 517.8 TFLOPS에 도달했습니다.
보고서에 표시된 두 번째로 높은 결과는 약 492.7 TFLOPS였습니다.

Kimi K3가 MLA-512 최적화 작업에서 보고된 517.8 TFLOPS에 도달했습니다.
Moonshot은 모델 개발 후반 단계에서 초기 버전의 K3가 팀의 커널 최적화 작업 대부분을 담당했다고 밝혔습니다. 이는 회사가 자체 보고한 작업 흐름이며, 출처가 링크한 자료에서 독립적으로 검증되지 않았습니다.
MiniTriton: 처음부터 구축한 GPU 컴파일러
다음 실험은 단일 커널 최적화를 넘어섰습니다.
Moonshot은 Kimi K3가 처음부터 소형 GPU 프로그래밍 시스템을 구축할 수 있는지 탐구했습니다. 그 결과는 MiniTriton으로, Triton과 유사한 소형 컴파일러이며 다음을 포함합니다.
- 자체 타일 수준 중간 표현
- MLIR 기반으로 구축된 IR 계층
- 최적화 프로세스
- PTX 코드 생성 파이프라인
- 생성된 커널에 대한 런타임 지원
Moonshot은 MiniTriton이 지원되는 지붕선 벤치마크에서 Triton 및 torch.compile의 성능에 도달하거나 능가했으며, 일부 워크로드에서는 Triton보다 우수한 성능을 보였다고 보고했습니다.

com/cms-assets/image/2026/07/664fc2e9-1b2c-459d-b907-898ed77df1af-2b65c54f-ba91-475a-81e6-9a3472a15637.png)
MiniTriton이 NVIDIA L20 GPU에서 보고한 CUDA 코어 루프라인 성능.
이 컴파일러는 또한 엔드 투 엔드 nanoGPT 훈련을 지원하며 안정적인 수렴을 달성했습니다. Moonshot에 따르면 손실 곡선은 참조 구현과 거의 일치하며 약간의 편차만 보입니다.
이는 고립된 마이크로벤치마크를 통한 테스트보다 더 의미 있습니다. 이는 생성된 시스템이 프론트엔드 언어, 중간 표현, 최적화 파이프라인, PTX 생성 및 런타임을 일관된 워크플로우로 연결할 수 있음을 보여줍니다.
그러나 이 글을 작성하는 시점에서 Moonshot은 MiniTriton 코드베이스를 공개적으로 출시하지 않았습니다. 따라서 성능 주장은 Kimi K3 발표 자료에서 비롯되었으며, 아직 공식 출시된 코드를 통해 재현할 수 없습니다.
48시간 자율 실행 중 설계된 칩
Kimi K3는 또한 칩 설계에서 테스트되었습니다.
자율적으로 실행된 48시간 동안, 이 모델은 오픈소스 EDA 도구와 Nangate 45nm 공정 설계 키트를 사용하여 K3 아키텍처 기반의 소형 모델을 서빙하도록 설계된 칩을 구축, 최적화 및 검증했습니다.
Moonshot은 다음과 같은 시뮬레이션 설계 결과를 보고했습니다:
- 면적 4 mm² 미만
- 146만 개의 표준 셀
- 0.277 MB SRAM
- 100 MHz에서 타이밍 수렴
- 시뮬레이션된 디코딩 처리량 초당 8700개 이상의 토큰
- 융합 역양자화를 갖춘 INT4 곱셈-덧셈 배열

이 칩 설계 사례 연구는 시뮬레이션에서 초당 8700개 이상의 토큰 처리 속도를 보고했습니다.
검증된 디지털 설계와 실제 제조된 물리적 칩의 차이는 중요합니다.
공개된 자료는 EDA 설계, 최적화, 타이밍 및 시뮬레이션 연습을 설명합니다. 이 칩이 테이프아웃, 제조, 패키징 및 실리콘에서 테스트되었음을 명시하지 않습니다.
이러한 제한이 있음에도 불구하고 확장된 하드웨어 설계 파이프라인을 완성한 것은 주목할 만한 장기 코딩 사례입니다. 에이전트가 아키텍처 결정, 하드웨어 설명, 합성, 배치 및 라우팅, 타이밍 검사, 검증 및 반복 최적화 간에 협력해야 하기 때문입니다.
2.8T 규모 뒤에 숨은 두 가지 핵심 혁신
Kimi K3는 Moonshot AI가 개발한 두 가지 기술을 기반으로 구축되었습니다:
- Kimi Delta Attention
- Attention Residuals (어텐션 잔차)
이 모델은 이러한 기술을 활성화가 더 희소한 혼합 전문가 아키텍처와 결합합니다.

Kimi K3는 KDA, 어텐션 잔차, Gated MLA 및 Stable LatentMoE를 결합합니다.
Kimi Delta Attention
Kimi Delta Attention, 줄여서 KDA는 어텐션 메커니즘을 긴 시퀀스에서 더 효율적으로 만들기 위해 설계되었습니다.
KDA는 전체 컨텍스트에 걸친 표준 전체 어텐션에만 의존하지 않고, 인코딩, 추론 및 에이전트 작업에 필요한 정보를 유지하면서 긴 입력을 처리하는 효율적인 메커니즘을 제공합니다.
이는 K3 모델의 백만 수준 컨텍스트 윈도우의 기반 중 하나입니다.
어텐션 잔차 메커니즘
전통적인 Transformer 레이어는 각 새 레이어의 출력을 누적된 은닉 상태에 반복적으로 추가합니다.
**어텐션 잔차 메커니즘(AttnRes)**은 이 패턴을 변경합니다. 모든 초기 레이어를 통합된 누적 흐름의 일부로 간주하는 대신, 후속 레이어가 다양한 깊이에서 선택적으로 표현을 검색할 수 있도록 합니다.
Moonshot은 이를 초심층 모델에서 정보 흐름을 위한 더 유연한 방식이라고 설명합니다.
안정적인 잠재 MoE 아키텍처
Kimi K3는 896개의 전문가 모듈을 가지고 있지만, 각 토큰은 16개의 전문가만 활성화합니다.
이러한 극도의 희소성은 전체 모델 크기에 비해 단일 토큰 계산량을 줄이는 반면, 라우팅 및 부하 균형의 어려움을 증가시킵니다. Moonshot의 안정적인 잠재 MoE 프레임워크는 이러한 희소 구성에서 훈련 안정성을 유지하는 것을 목표로 합니다.
분위수 균형
혼합 전문가 모델은 소수의 전문가에 과부하가 걸리는 것을 피하기 위해 전문가 간에 토큰을 적절히 분배해야 합니다.
K3는 분위수 균형 기술을 사용하여, 수동으로 조정된 균형 전략에 의존하는 대신 라우터 점수의 분위수를 통해 전문가를 할당합니다. Moonshot은 이것이 민감한 부하 균형 하이퍼파라미터를 제거하여 대규모 전문가 할당을 더 안정적으로 만든다고 말합니다.
헤드별 옵티마이저
K3는 Muon 옵티마이저를 확장하여 헤드별 Muon 최적화를 구현합니다.
이 방식은 어텐션 파라미터를 독립적인 구조로 분해하여 각 어텐션 헤드에 대해 개별적으로 최적화합니다. 목표는 대규모 훈련에서 각 어텐션 헤드에 대해 더 적응적인 최적화 동작을 제공하는 것입니다.
SiTU 및 게이트형 MLA
두 가지 추가 구성 요소가 활성화 및 어텐션 제어를 지원합니다:
- **Sigmoid Tanh 유닛(SiTU)**은 활성화 제어를 개선합니다
- 게이트형 MLA는 어텐션 선택의 유연성을 향상시킵니다
KDA, AttnRes, 안정적인 잠재 MoE, 분위수 균형 및 헤드별 Muon과 결합하여, Moonshot은 이러한 개선 사항이 Kimi K2 대비 전체 확장 효율성을 약 2.5배 향상시킨다고 말합니다.
양자화 인식 훈련 및 추론 아키텍처
Kimi K3는 감독형 미세 조정 단계부터 양자화 인식 훈련을 채택합니다.
공식 기술 블로그는 다음을 나열합니다:
- MXFP4 가중치
- MXFP8 활성화
목표는 이러한 규모의 모델을 훈련 및 배포 가능하게 유지하면서, 다양한 가속기 하드웨어 간의 호환성을 높이는 것입니다.
Moonshot은 또한 효율적인 추론을 위해 64개 이상의 가속기를 갖춘 슈퍼노드 배포를 권장합니다. 이는 개방형 가중치가 편리한 로컬 배포와 동일하지 않음을 명확히 보여줍니다. 이 2.8조 파라미터 모델은 여전히 대규모 인프라 시스템입니다.
KDA 프리픽스 캐싱 메커니즘
KDA는 기존 프리픽스 캐싱에 새로운 과제를 제기합니다.
Moonshot은 해당 프리필 캐싱 구현을 개발하여 vLLM 생태계에 기여했다고 밝혔습니다. 공식 API는 코드 유형 워크로드에서 90% 이상의 캐시 적중률을 보입니다.
이 캐싱 레이어는 캐시된 입력과 캐시되지 않은 입력 간의 가격 차이를 설명합니다. 이 구현은 모델과 함께 오픈소스로 공개될 예정이며, 개발자는 Kimi 및 vLLM 공식 발표를 확인할 수 있습니다.
현재 가용성 및 통합 상태의 코드 저장소.
알려진 제한 사항
Moonshot은 Kimi K3의 세 가지 중요한 제한 사항을 나열합니다.
사고 이력에 대한 민감성
K3의 훈련 패턴은 모델의 이전 사고 이력을 유지합니다.
에이전트 프레임워크가 완전한 예상 이력을 반환하지 않으면 생성 품질이 불안정해질 수 있습니다. 사용자가 활성 세션 중간에 다른 모델에서 전환할 때
K3 사용 시에도 동일한 문제가 발생할 수 있습니다.
Moonshot AI는 검증된 호환 도구(예: Kimi Code) 사용을 권장하며, 대화 중간에 모델을 전환하지 않도록 조언합니다.
과도한 주도성
K3는 장시간 고난이도 작업에 대해 대규모로 학습되었습니다.
따라서 작은 문제나 모호한 지시에 과도하게 반응하여 사용자가 예상하지 못한 결정을 내릴 수 있습니다.
엄격한 경계 조건이 필요한 애플리케이션은 시스템 프롬프트나 AGENTS.md 파일에 이러한 경계를 명확히 정의해야 합니다.
사용자 경험 격차
Moonshot AI는 Claude Fable 5 및 GPT-5.6 Sol과 비교했을 때 K3에 여전히 뚜렷한 사용자 경험 격차가 존재한다고 밝혔습니다.
이 제한 조건은 매우 가치 있는 정보입니다. 벤치마크 점수와 자율 엔지니어링 데모는 응답 일관성, 지연 시간, 명령어 해석, 도구 신뢰성, 대화 유창성 등 프로덕션 환경의 모든 측면을 포괄하지 못하기 때문입니다.
가용성 및 오픈 웨이트 상태
Kimi K3는 다음 채널을 통해 이용할 수 있습니다:
출시 시점에 K3는 기본적으로 최대 사고 강도를 사용합니다. Moonshot AI는 향후 업데이트를 통해 더 낮은 사고 강도와 더 높은 사고 강도 옵션이 추가될 것이라고 밝혔습니다.
해당 회사는 2026년 7월 27일까지 전체 모델 가중치를 공개할 것이라고 발표했습니다. 이러한 가중치와 기술 보고서가 공개되기 전까지는 일부 아키텍처, 벤치마크 설정, MiniTriton 구현 및 칩 설계 프로세스가 Moonshot AI가 이미 공개한 설명에 의존합니다.

Kimi K3는 Moonshot AI가 보고한 오픈 모델 규모를 2.8조 개의 파라미터로 끌어올렸습니다.
자주 묻는 질문
Kimi K3란 무엇인가요?
Kimi K3는 Moonshot AI가 개발한 2.8조 개의 파라미터를 가진 네이티브 멀티모달 모델로, 장기 코딩, 지식 작업, 시각적 추론 및 에이전트 작업에 적합합니다. 100만 토큰의 컨텍스트 윈도우를 지원하며, 토큰당 896개의 전문가 중 16개를 활성화합니다.
Kimi K3는 오픈소스인가요?
Moonshot AI는 K3를 오픈 3T급 모델이라고 밝히며, 2026년 7월 27일까지 전체 모델 가중치를 공개할 것이라고 발표했습니다. 이 글을 작성하는 시점에서 K3의 전체 가중치 공개 및 기술 보고서는 아직 완료되지 않았습니다.
Kimi K3 API 비용은 얼마인가요?
국제 Kimi API 가격은 다음과 같습니다: 캐시된 입력 토큰 100만 개당 0.30달러, 캐시되지 않은 입력 토큰 100만 개당 3.00달러, 출력 토큰 100만 개당 15.00달러입니다. 가격은 변동될 수 있습니다.
따라서 프로덕션 사용자는 공식 API 플랫폼에서 현재 요금을 확인해야 합니다.
Kimi K3의 프론트엔드 코딩 능력이 정말 1위인가요?
Kimi K3는 출시 당시 Arena WebDev 순위에서 1위를 차지했습니다. 더 많은 투표와 모델이 추가됨에 따라 순위는 동적으로 변하므로 최신 순위는 실시간 Arena 페이지를 참조하세요.
MiniTriton이란 무엇인가요?
MiniTriton은 Moonshot AI가 Kimi K3가 처음부터 구축했다고 밝힌 컴팩트 GPU 컴파일러입니다. MLIR 기반 타일 레벨 중간 표현, 최적화 패스, PTX 코드 생성 파이프라인을 포함하며 엔드투엔드 nanoGPT 학습을 지원합니다.
Kimi K3는 실제 칩을 제조했나요?
물리적인 테이프아웃(칩 제조)에 대한 공식 발표는 없습니다. Moonshot AI는 Nangate 45nm 라이브러리를 사용하여 칩 설계, 최적화, 검증 및 시뮬레이션을 완료한 48시간의 자율 전자 설계 자동화(EDA) 실행을 설명했습니다.
Kimi K3를 로컬에서 실행할 수 있나요?
해당 모델은 매우 커서, Moonshot AI는 효율적인 실행을 위해 추론 구성에 최소 64개의 가속기가 필요하다고 조언합니다. 가중치가 공개된 후에도 로컬 실행에는 여전히 대규모 전문 인프라 또는 대폭 수정된 배포 방식이 필요합니다.
Kimi K3의 주요 한계는 무엇인가요?
Moonshot AI는 유지된 사고 기록에 민감하고 모호한 작업에서 지나치게 능동적이며 Claude Fable 5 및 GPT-5.6 Sol과 비교하여 사용자 경험 격차가 있다는 점을 지적합니다. 명시적인 에이전트 제약 조건과 호환 가능한 적응 프레임워크를 사용할 것을 권장합니다.
관련 도구
- Kimi: Moonshot AI의 에이전트 작업 공간으로, 코딩, 연구, 문서, 슬라이드 및 시각화 워크플로우에서 Kimi K3를 사용할 수 있습니다.
- Kimi Code: Moonshot AI가 오픈소스로 공개한 터미널 코딩 에이전트이자 권장되는 K3 호환 적응 프레임워크입니다.
- Kimi API 플랫폼:
kimi-k3및 기타 Kimi 모델에 액세스하기 위한 공식 API 서비스입니다. - Arena WebDev 순위표: 프론트엔드 및 웹 개발 모델을 위한 실시간 커뮤니티 투표 순위표입니다.
- Triton: 고성능 GPU 커널 작성을 위한 오픈소스 언어 및 컴파일러입니다.
- MLIR: 중간 표현 및 최적화 파이프라인 구축을 위한 LLVM의 재사용 가능한 컴파일러 인프라입니다.
- vLLM: 높은 처리량의 추론 및 프리픽스 캐싱을 지원하는 오픈소스 대규모 언어 모델 추론 엔진입니다.
- OpenROAD: 자동화된 칩 설계 워크플로우와 관련된 오픈소스 RTL-to-GDSII 툴체인입니다.
관련 링크
- Kimi K3 공식 기술 블로그: 아키텍처, 코딩 사례, 가격, 가용성, 평가 및 한계를 다루는 Moonshot AI의 발행 기사입니다.
- Kimi K3 API 플랫폼: 현재 K3 API 액세스 및 가격에 대한 공식 출처입니다.
- Kimi Code GitHub 저장소: 공식 코딩 에이전트 저장소 및 설치 문서입니다.
- Arena WebDev 순위표: 현재 프론트엔드 모델 순위 및 투표 데이터입니다.
- DeepSWE 리더보드: Moonshot AI 평가 보고서에서 인용된 공개 소프트웨어 엔지니어링 벤치마크입니다.
- Program Bench: K3 코딩 비교에 사용된 프로그래밍 벤치마크입니다.
- SWE Marathon: Moonshot AI가 인용한 장기 소프트웨어 엔지니어링 벤치마크입니다.
개요
Kimi K3는 총 2조 8천억 개의 파라미터를 가진 Moonshot AI의 현재까지 가장 큰 모델로
8조 개의 파라미터, 네이티브 멀티모달 입력 지원, 100만 토큰 컨텍스트 윈도우 보유, 896개 전문가 중 16개를 희소 활성화.
가장 두드러진 초기 성과는 장주기 엔지니어링 분야에서 나타났다. K3는 프론트엔드 코드 아레나 초기 순위에서 1위를 차지했으며, GPU 커널을 최적화하고 MiniTriton 컴파일러를 구축했으며, 오픈소스 EDA 도구를 사용해 48시간 만에 칩 설계 워크플로우를 시뮬레이션 완료했다.
이 아키텍처는 Kimi Delta 어텐션 메커니즘, 어텐션 잔차 연결, 안정적인 잠재 MoE, 분위수 균형, 헤드별 Muon 옵티마이저, SiTU 및 게이트형 MLA를 통합한다. 월즈 어둠의 면은 Kimi K2 대비 확장 효율이 2.5배 향상되었다고 보고했으며, 동시에 에이전트 호환성, 주도성 및 전반적인 사용자 경험 측면에서 중요한 한계가 있음을 인정했다.
Kimi K3의 가장 중요한 선언은 모든 벤치마크에서 우승했다는 것이 아니라, 비정상적으로 길고 시각적이며 도구 체인에 의존하는 엔지니어링 작업에서 높은 효율성을 유지할 수 있다는 점이다.