평두거(平头哥), AI 소프트웨어 스택 'SAIL' 오픈소스 공개: 56만 개 '전무(镇武)' 칩 지원
AI 가속기는 단순히 강력한 하드웨어 사양만으로 제 역할을 다하지 못합니다. 개발자는 PyTorch, TensorFlow, vLLM, SGLang과 같은 프레임워크를 통해 작업하며, 모델은 컴파일, 스케줄링, 실행, 성능 분석, 디버깅, 그리고 장치 간 배포 과정을 거쳐야 합니다. 애플리케이션과 칩 사이에는 이론적 성능을 실제 사용 가능한 연산력으로 전환할지 결정하는 거대한 인프라 계층이 존재합니다. WAIC 2026 컨퍼런스에서 알리바바 그룹의 반도체 자회사인 평두거(平头哥)가 **T

평두거(平头哥), AI 소프트웨어 스택 'SAIL' 오픈소스 공개: 56만 개 '전무(镇武)' 칩 지원
서문
AI 가속기는 단순히 강력한 하드웨어 사양만으로 실용적이지 않습니다. 개발자는 PyTorch, TensorFlow, vLLM, SGLang 등의 프레임워크를 통해 작업합니다. 이들의 모델은 반드시 컴파일, 스케줄링, 실행, 성능 분석, 디버깅을 거쳐야 하며, 장치 간 분산 배포되어야 합니다. 애플리케이션과 칩 사이에는 이론적 성능을 실제 사용 가능한 연산 능력으로 전환하는지 결정하는 방대한 인프라 계층이 존재합니다.
2026년 세계 인공지능 대회에서 알리바바 그룹 산하 반도체 회사 두두두두는 자사의 玄铁 가속기 시리즈를 위한 AI 소프트웨어 스택인 T-Head SAIL을 오픈소스로 공개했습니다.
SAIL의 전체 명칭은 Seed of AI Library(AI 라이브러리 씨앗)입니다.
두두두두는 이 프로젝트를 운영 체제 지원, SDK 구성 요소, 프로그래밍 인터페이스, 최적화 라이브러리, 컴파일러, 런타임 소프트웨어 및 개발자 도구를 포괄하는 완전한 경로로 설명합니다. 명백한 목표는 개발자가 익숙한 언어, 프레임워크, 코드 또는 워크플로우를 포기하도록 강요하지 않으면서 玄铁 하드웨어의 채택을 더 쉽게 만드는 것입니다.
알리바바에 따르면, 2026년 4월 기준 玄铁 AI 칩의 누적 출하량은 56만 개에 달하며, 20개 이상의 산업 분야에서 400곳 이상의 고객에게 서비스를 제공하고 있습니다. 공개 전에 해당 하드웨어와 소프트웨어 스택은 알리바바 클라우드 및 외부 프로덕션 환경에서 이미 사용되었습니다.
따라서 두두두두는 SAIL을 소규모 연구 프로토타입으로 전시하는 것이 아닙니다. 이들은 이미 대규모 워크로드와 프로덕션 서비스 요구 사항에 의해 검증된 소프트웨어 기반을 오픈소스로 공개하는 것입니다.
소프트웨어 스택이 중요한 이유
새로 제조된 가속기는 신경망을 정의하는 Python 코드를 직접 실행할 수 없습니다. 소프트웨어 스택은 고급 프로그램을 하드웨어가 효율적으로 실행할 수 있는 작업으로 변환해야 합니다. 이 과정은 다음을 포함합니다:
- 운영 체제가 장치를 인식하고 관리할 수 있도록 함.
- 사용자 공간 및 커널 드라이버를 통해 하드웨어 기능 노출.
- 메모리, 명령 큐, 실행 컨텍스트 및 동기화 관리.
- 모델 계산 그래프와 커널을 실행 가능한 명령어로 컴파일.
- 튜닝된 수학 라이브러리, 신경망 라이브러리, 미디어 라이브러리 및 통신 라이브러리 제공.
- 가속기를 기존 AI 프레임워크와 연결.
- 개발자에게 성능 분석, 디버깅, 모니터링 및 클러스터 운영 도구 제공.
어느 한 수준의 약점은 성능을 저하시키거나 배포를 어렵게 만들 수 있습니다. 연산자가 하나 누락되면 느린 대체(fallback)가 발생할 수 있습니다. 잘못된 통신 소프트웨어는 다중 장치 확장 능력을 제한할 수 있습니다. 불투명한 컴파일러는 최적화를 어렵게 만듭니다. 취약한 성능 분석 도구는 성능 작업을 맹목적인 추측으로 만들 수 있습니다. 이것이 NVIDIA의 경쟁적 지위가 GPU 하드웨어뿐만 아니라 CUDA, 라이브러리, 컴파일러 도구 체인, 문서화 및 오랜 기간 축적된 개발자 경험에 의해 뒷받침되는 이유입니다. 두두두두가 SAIL을 오픈소스로 공개하기로 결정한 것은 바로 생태계 수준에서 경쟁하기 위해서입니다.
블랙박스에서 더 검증 가능한 플랫폼으로
AI 가속기 소프트웨어는 과거에 사전 컴파일된 바이너리 파일 형태로 배포되곤 했습니다. 개발자는 문서화된 API를 호출할 수 있었지만, 모델이 어떻게 변환되고 실행되는지에 대한 가시성은 종종 제한적이었습니다. 일반적인 문제는 다음과 같습니다:
- 어떤 연산자 구현이 선택되었는가?
- 그래프의 특정 부분이 성능이 좋지 않은 이유는 무엇인가?
- 메모리는 어떻게 할당되는가?
- 어떤 통신 경로가 사용되는가?
- 호환성 문제는 어디서 시작되는가?
- 특정 배포 환경에 맞게 워크로드를 최적화할 수 있는가?
소스 코드, 문서, 드라이버 및 도구를 공개하면 개발자가 플랫폼을 검사, 진단, 조정 및 최적화할 수 있는 더 많은 옵션을 얻을 수 있습니다. 오픈소스가 자동으로 성숙한 생태계를 형성하지는 않습니다. 관련 구성 요소는 여전히 문서화, 유지 관리, 테스트, 명확한 라이선스 및 실제 워크로드에서 지원되어야 합니다. 커뮤니티 거버넌스와 버전 안정성은 최초 코드 공개만큼 중요합니다.
현재 공개된 내용
주요 공식 접속 포털은 '두두두두 개발자 커뮤니티'입니다:
https://developer.t-head.cn/home
공식 발표에 따르면 이 포털은 다음을 제공합니다:
- 풀 스택 기술 문서
- SDK 소프트웨어 패키지
- 커널 드라이버
- 성능 분석 도구
- 디버깅 도구
- 镇岳 AI 칩을 위한 개발 리소스
최초 공개를 오픈소스 로드맵 전체의 완성으로 간주해서는 안 됩니다.
| 단계 | 공개 계획 |
|---|---|
| 최초 공개 | 문서, SDK 패키지, 커널 드라이버, 성능 도구 및 디버깅 리소스 |
| 2단계 | 추가 통신 라이브러리 소프트웨어, 버전 2.2 Docker 및 PIP 소스, 개발자 포럼 |
| 3단계 | 계산 가속 라이브러리, 추론 엔진 소프트웨어, 버전 2.3 Docker 및 PIP 소스 |
| 추후 개발 | 추가 업데이트, 도구, 커뮤니티 활동 및 생태계 확장 |
버전이 지속적으로 출시됨에 따라 소프트웨어 패키지 가용성, 라이선스, 하드웨어 요구 사항 및 빌드 지침은 실시간 포털을 통해 확인해야 합니다.
두두두두 5계층 SAIL 기술 스택
두두두두는 SAIL을 장치 제어부터 프로덕션 도구까지 포괄하는 5계층 개발 기술 스택으로 설명합니다.
| 계층 | 주요 구성 요소 | 용도 |
|---|---|---|
| 드라이버 및 런타임 | PPU 드라이버, KMD, UMD, PPU 런타임 | 장치 접근, 메모리 관리, 명령 제출 및 실행 컨텍스트 |
| 프로그래밍 언어 | C, C++, Python | 애플리케이션 및 시스템 개발을 위한 친숙한 인터페이스 |
| 컴파일러 | 컴파일러, 디버거 | 그래프 및 코드 변환, 최적화, 검사 및 디버깅 |
| 고성능 라이브러리 | acBLAS, acDNN, acFFT, acRAND, acSOLVER, acSPARSE, 미디어 및 통신 라이브러리 | 일반적인 AI 및 수치 워크로드를 위한 최적화된 구현 |
| 개발자 도구 | Asight Compute, Asight Systems, PPU-SMI, PPU-DCGM | 성능 분석, 디버깅, 모니터링 및 클러스터 관리 |
드라이버 및 런타임
최하위 계층은 운영 체제와 가속기를 연결합니다.
PPU 드라이버
두두두두는 드라이버를 다음과 같이 구분합니다:
- KMD: 커널 모드 드라이버.
- UMD: 사용자 모드 드라이버.
커널 모드 구성 요소는 운영 체제 및 장치와의 특권 상호 작용을 처리합니다. 사용자 모드 구성 요소는 상위 런타임 및 애플리케이션 소프트웨어에 장치 기능을 노출합니다.
PPU 런타임
PPU 런타임은 다음을 포함한 리소스를 관리합니다:
- 장치 메모리
- 명령 큐
- 계산 컨텍스트
- 애플리케이션-장치 작업
- 실행
조정 계층입니다. 이 계층은 하드웨어가 애플리케이션에 의해 발견, 할당 및 예측 가능한 방식으로 사용될 수 있는지 결정합니다.
C, C++ 및 Python 인터페이스
SAIL은 C, C++ 및 Python 언어를 지원합니다. 이는 개발자가 하드웨어를 사용해보기 전에 특정 벤더 언어를 배울 필요성을 줄여줍니다. Python은 여전히 모델 정의 및 실험의 주요 언어이며, C와 C++는 성능 라이브러리, 런타임, 프레임워크 확장 및 시스템 통합에 필수적입니다. 이러한 주류 언어를 지원함으로써 팀이 기존 코드, 내부 라이브러리, 디버깅 관행, 빌드 시스템 및 엔지니어링 경험을 재사용할 수 있습니다. 언어 호환성이 모든 애플리케이션이 매끄럽게 실행됨을 보장하지는 않습니다. 사용자 정의 CUDA 확장, 지원되지 않는 연산자, 하드웨어별 가정 또는 특수 종속성은 여전히 포팅 작업이 필요할 수 있습니다.
컴파일러 및 디버거
컴파일러는 모델 그래프와 소스 코드 수준의 작업을 镇岳 하드웨어에서 실행 가능한 코드로 변환합니다. 일반적인 AI 컴파일러 작업은 다음과 같습니다:
- 그래프 최적화
- 연산자 융합
- 레이아웃 변환
- 메모리 계획
- 커널 선택
- 스케줄링 최적화
- 정밀도 변환
- 상수 폴딩
- 병렬 실행 계획
두두두두는 컴파일러 계층에 디버거도 포함시킵니다. 이는 매우 중요합니다. 개발자는 컴파일된 그래프가 왜 비정상적으로 동작하는지, 또는 특정 코드 조각의 성능이 기대에 미치지 못하는 이유를 이해해야 합니다. 공식 발표는 컴파일러와 디버거를 완전한 개발 순환으로 설명합니다. 구체적인 검사 및 디버깅 기능은 현재 출시 문서를 참조하여 확인해야 합니다.
고성능 라이브러리
최적화된 라이브러리는 가속기 생태계에서 가장 가치 있는 구성 요소 중 하나입니다. 대부분의 AI 시스템은 동일한 범주의 계산 작업을 반복적으로 사용합니다. 튜닝된 라이브러리는 프레임워크가 모든 개발자가 장치별 커널을 작성하도록 강요하는 대신 효율적인 구현을 호출할 수 있도록 합니다.
핵심 계산 라이브러리
| 라이브러리 이름 | 주요 기능 |
|---|---|
acBLAS |
기본 선형 대수 연산 |
acDNN |
심층 신경망 계산 |
acFFT |
고속 푸리에 변환 |
acRAND |
난수 생성 |
acSOLVER |
수치 솔버 |
acSPARSE |
희소 행렬 연산 |
실질적인 가치는 연산자 커버리지, 데이터 유형, 수치 안정성, 기술 문서, 커널 품질 및 지원되는 프레임워크와의 통합 정도에 따라 달라집니다.
미디어 및 전처리 라이브러리
| 라이브러리 이름 | 주요 기능 |
|---|---|
HGDEC |
비디오 디코딩 |
HGENC |
비디오 인코딩 |
HGJPEG |
JPEG 이미지 처리 |
| HGPP | 데이터 전처리 |
멀티모달 모델에서 미디어 처리가 점점 중요해지고 있다. 이미지/비디오 코덱, 크기 조정, 형식 변환 및 전처리는 파이프라인의 주요 병목 현상이 될 수 있다.
집합 통신
핑터거는 다음을 나열했다:
PCCLsailSHMEM
집합 통신 라이브러리는 다중 장치, 다중 노드 학습에 필요한 작업(전체 리덕션, 전체 수집, Reduce-scatter, 브로드캐스트 및 동기화)을 지원한다. 통신 성능은 대규모 클러스터의 확장 효율성을 결정하는 경우가 많다. 공식 로드맵에 따르면 더 많은 통신 라이브러리 소프트웨어가 후속 단계에서 공개될 예정이다.
개발자는 각 구성 요소의 현재 소스 코드 상태를 확인해야 한다.
추가 구성 요소
이 기술 스택은 다음 구성 요소도 나열한다:
acextHGML
이러한 구성 요소는 핵심 라이브러리 세트를 확장하고 추가적인 기계 학습 기능을 지원한다. 최신 API 세부 정보는 실시간 소프트웨어 패키지 문서를 참조하는 것이 좋다.
개발 및 운영 도구
Asight Compute
Asight Compute는 연산자 수준 성능 분석 도구로, 개발자가 커널 실행, 활용률, 메모리 동작 및 하위 수준 성능 병목 현상을 검사할 수 있도록 지원한다.
Asight Systems
Asight Systems는 프레임워크 실행, 런타임 활동, 커널, 메모리 전송, 통신, 호스트 작업 및 유휴 주기에 대한 시스템 수준 뷰를 제공한다.
PPU-SMI
PPU-SMI는 실시간 장치 모니터링 및 관리를 지원한다. 구체적인 지표와 명령어는 현재 문서를 참조하라.
PPU-DCGM
PPU-DCGM은 클러스터 수준의 리소스 및 장치 관리를 지원한다. 대규모 배포에서는 단일 카드뿐만 아니라 여러 가속기와 노드에 걸친 글로벌 가시성이 필요하다.
세 가지 마이그레이션 약속
핑터거는 SAIL의 개발자 포지셔닝을 세 가지 핵심 개념으로 요약한다:
- 전체 코드를 다시 작성할 필요 없음
- 에코시스템 적응을 오래 기다릴 필요 없음
- 특정 프레임워크에 강제로 바인딩되지 않음
이는 제조업체의 주장이며, 각 조직의 실제 워크로드에 따라 검증해야 한다.
전체 재작성 불필요
SAIL의 설계는 주류 프로그래밍 모델 및 프레임워크와 일치한다.
핑터거는 개발자가 기존의 많은 코드, 모델, 엔지니어링 경험, 연산자 지식 및 튜닝 관행을 재사용할 수 있다고 밝혔다. 공식 발표에 따르면 마이그레이션에는 소량의 코드 적응만 필요하다.
널리 지원되는 작업을 기반으로 구축된 표준 모델은 원활하게 마이그레이션될 수 있지만, 사용자 정의 CUDA 커널, 제조업체별 확장, 난해한 종속성 또는 긴밀하게 결합된 추론 인프라를 포함하는 시스템은 더 많은 작업이 필요할 수 있다.
긴 적응 지연 없음
AI 프레임워크와 모델은 빠르게 반복된다. 하드웨어 플랫폼이 각 중요 버전을 지원하는 데 수개월이 걸리면 소프트웨어 에코시스템에 항상 뒤처질 수밖에 없다.
핑터거는 SAIL의 주류 AI 추론 프레임워크에 대한 평균 적응 시간이 7일 이내라고 밝혔다.
이는 제조업체가 보고한 평균값으로, 모든 모델, 프레임워크 버전, 연산자 또는 기능에 대한 보장은 아니다.
개발자는 지원되는 버전, 구현이 프로덕션 수준인지 여부, 사용 가능한 데이터 유형, 분산 실행이 검증되었는지 확인해야 한다.
프레임워크 바인딩 없음
핑터거는 SAIL이 260개 이상의 주류 학습, 추론 및 에코시스템 구성 요소(예: PyTorch, TensorFlow, vLLM, SGLang)에 적응했다고 밝혔다.
이 숫자에는 프레임워크, 통합 모듈, 모델, 라이브러리 및 관련 구성 요소가 포함될 수 있으며, 260개의 완전히 독립적인 최상위 프레임워크는 아니다. 실시간 호환성 카탈로그를 권위 있는 참조로 사용하는 것이 좋다.
전략적 의도는 개발자가 단일 독점 애플리케이션 환경으로 강제 마이그레이션되는 대신 선호하는 프레임워크를 유지할 수 있어야 한다는 것이다.
실용적 평가 프로세스
SAIL 도입을 고려하는 팀은 호환성 주장에만 의존하지 말고 자체 모델을 테스트해야 한다.
1. 요구 사항 확인
다음을 점검하라:
- 지원되는 진우 하드웨어.
- 운영 체제 및 커널 버전.
- 드라이버 및 런타임 버전.
- 컨테이너 지원 상태.
- Python 버전.
- 프레임워크 버전.
- 컴파일러 요구 사항.
- 클러스터 네트워크 요구 사항.
2. 검증된 예제부터 시작
공식 문서에 나열된 모델을 사용하여 설치, 컴파일, 결과 출력의 정확성을 확인하고, 프로파일러를 실행할 수 있으며, 장치 상태가 정상적으로 보고되는지 확인하라.
3. 기능 정확성 비교
다음을 측정하라:
- 모델 정확도.
- 수치적 편차.
- 정밀도 성능.
- 결정론.
- 지원되지 않는 연산자.
- 폴백 실행.
4. 성능 측정
다음을 기록하라:
- 처리량.
- 첫 번째 토큰 지연 시간.
- 간격 토큰 지연 시간.
- 배치 지연 시간.
- 장치 활용률.
- 메모리 사용량.
- 컴파일 시간.
- 다중 장치 확장 능력.
5. 마이그레이션 작업 기록
모든 코드, 빌드, 연산자, 환경 및 배포 변경 사항을 추적하라. 단 한 번의 성공적인 데모를 보여주는 것보다 마이그레이션 비용을 더 현실적으로 추정할 수 있다.
6. 운영 테스트
프로덕션 환경 평가에는 장치 장애, 프로세스 재시작, 프레임워크 업그레이드, 드라이버 업그레이드, 스케줄링, 모니터링, 로그 수집, 롤백 및 성능 회귀 분석이 포함되어야 한다.
SAIL 뒤의 하드웨어 발전 역사
SAIL은 핑터거의 장기 인프라 계획의 일부다.
한광 800
핑터거는 2019년에 한광 800을 출시했다. 이는 알리바바의 첫 AI 추론 칩이다.
알리바바 공식 발표에 따르면 ResNet-50 테스트에서 피크 성능이 초당 78,563장의 이미지와 와트당 500 IPS에 도달했다.
이 칩은 상품 검색, 추천, 이미지 처리, 광고 및 고객 서비스와 같은 내부 비즈니스에 배포되었다. 알리바바는 출시 당시 시연된 사례에서 10억 개의 상품 이미지를 처리하는 시간이 약 1시간에서 약 5분으로 단축되었다고 밝혔다.
한광 800은 전용 하드웨어가 최적화된 소프트웨어 및 알고리즘과 결합될 때의 가치를 보여준다.
이티엔 710
2021년, 알리바바는 이티엔 710을 출시했다. 이는 5나노미터 Arm 서버 프로세서로, 128개의 코어와 600억 개의 트랜지스터를 포함한다.
알리바바는 SPECint2017 점수가 440이며, 비교 대상 Arm 서버 프로세서보다 성능이 20%, 에너지 효율이 50% 향상되었다고 보고했다.
이티엔은 핑터거의 포지셔닝을 AI 추론에서 범용 클라우드 컴퓨팅으로 확장했다. 알리클라우드는 이티엔 프로세서 기반의 ECS 인스턴스 시리즈를 제공한다.
진우 가속기 제품군
핑터거의 진우 제품군은 AI 학습과 추론을 모두 지원한다.
원본 문서는 초기 진우 810 시리즈가 알리바바 통이첸원 환경 및 외부 산업 사용자에게 배포된 상황을 설명한다. 과거 진우 모델에 대한 통일된 상세 공식 영어 사양이 없으므로 이 문서는 원본의 모든 하드웨어 데이터를 반복하지 않는다.
최신 진우 M890은 알리바바의 공식 소개가 있다.
진우 M890
알리바바는 2026년에 진우 M890을 출시했다.
| 사양 | 진우 M890 |
|---|---|
| 메모리 | 144 GB |
| 칩 간 대역폭 | 800 GB/s |
| 상대 성능 | 진우 810E의 3배 |
| 정밀도 지원 | 학습 및 추론, 기본 FP4 포함 |
이 칩은 높은 동시성 추론, 긴 컨텍스트, 반복적인 도구 호출 및 예측할 수 없는 수요를 가진 에이전트 워크로드를 위해 설계되었다.
알리바바는 M890을 ICN 스위치 1.0과 페어링하여 최대 25.6 Tbps의 총 대역폭을 제공하고 64개 가속기 클러스터 간의 혼잡 없는 통신을 지원한다고 밝혔다.
판주 AL128 슈퍼 노드는 128개의 가속기를 랙 수준 시스템에 통합하며, SAIL은 이 하드웨어를 노출, 컴파일, 분석 및 운영하는 데 필요한 소프트웨어 계층을 제공한다.
컴퓨팅, 네트워킹 및 스토리지
원본 문서는 세 가지 영역을 통해 핑터거의 데이터 센터 칩 전략을 설명한다:
컴퓨팅
- 전우 AI 가속기
- 이티엔 Arm 서버 CPU
- 한광 추론 기술
네트워킹
- ICN 스위치 상호 연결 기술
- 판하이 스마트 네트워크 인터페이스 카드 제품
스토리지
- 전웨 스토리지 컨트롤러 제품
현대 AI 클러스터는 컴퓨팅, 메모리, 상호 연결, 스토리지, 네트워킹, 스케줄링, 런타임 소프트웨어 및 프레임워크 통합 간의 협력 성능에 의존한다. 어느 한 영역의 병목 현상도 전체 시스템의 가치를 약화시킬 수 있다.
56만 개 칩 출하 후 SAIL을 오픈소스로 하는 이유는?
기업은 가속기를 판매하기 위해 광범위한 개발자 플랫폼을 구축할 필요가 없다. 반면 에코시스템은 문서, 예제, 라이브러리, 호환성, 지원, 예측 가능한 버전 릴리스 및 외부 개발자가 미래 발전에 영향을 미칠 수 있는 경로가 필요하다.
핑터거는 알리바바 내부 및 고객 배포에서 자체 칩을 사용해 왔다. SAIL을 오픈소스화하면 다음과 같은 이점이 있을 수 있다:
- 더 많은 개발자가 전우 하드웨어를 사용하도록 유치
- 프레임워크 및 모델 지원 확장
- 외부 팀이 문제를 진단하는 데 도움
- 대학 및 연구 기관이 기술 스택을 연구하도록 지원
- 소프트웨어 회사가 통합 솔루션을 만들도록 장려
- 고객에게 배포 최적화에 대한 더 많은 제어권 제공
- 기존 가속기 에코시스템에서 마이그레이션 비용 절감
이번 발표는 국내 AI 컴퓨팅 분야의 보편적인 문제점, 즉 하드웨어 성능이 소프트웨어 성숙도 및 개발자 인지도보다 빠르게 발전하는 현상을 반영합니다.
오픈소스 기술 스택은 더 넓은 커뮤니티의 참여를 유도하여 이러한 격차를 해소하는 데 기여할 것입니다.
SAIL 성공의 결정적 요인
첫 번째 릴리스는 시작에 불과합니다. 채택률은 다음 요소에 달려 있습니다.
- 문서 품질
- 재현 가능한 빌드
- 명확한 라이선스
- 연산자 커버리지
- 프레임워크 버전 지원
- 성능 투명성
- 안정적인 버전 릴리스
- 커뮤니티 거버넌스
- 하드웨어 액세스 권한
- 국제화 지원
개발자들은 또한 후속 오픈소스 단계가 계획대로 진행되는지, 그리고 커뮤니티가 실질적인 기여를 할 수 있는지 주목할 것입니다.
주요 제한 사항 및 해결 과제
일부 구성 요소는 아직 준비되지 않음
공식 로드맵에 따르면, 일부 통신 소프트웨어, 가속 라이브러리, 추론 엔진 구성 요소 및 Docker/PIP 소스는 후속 단계에서 출시될 예정입니다.
저장소 및 다운로드 구조는 다를 수 있음
공식 액세스 포털은 핑토우거 개발자 커뮤니티입니다. 각 구성 요소는 다운로드, 문서, 로그인, 패키지 관리 또는 저장소 워크플로가 다를 수 있습니다.
각 구성 요소의 라이선스는 개별 확인 필요
드라이버, 도구, 라이브러리, 예제 및 타사 소프트웨어의 라이선스:
모든 패키지가 동일한 라이선스를 사용하는 것은 아닙니다. 수정 또는 재배포 전에 각 다운로드 패키지에 포함된 라이선스를 확인하십시오.
CUDA 호환성은 자동으로 보장되지 않음
필요한 연산이 지원되는 경우, 프레임워크 수준의 애플리케이션은 약간의 수정만으로 마이그레이션할 수 있습니다. 사용자 정의 CUDA 커널 및 CUDA 전용 확장은 일반적으로 별도의 포팅 작업이 필요합니다.
국제적 채택은 여전히 해결 과제
언어 지원, 커뮤니티 거버넌스, 지원 채널, 클라우드 액세스 및 하드웨어 가용성은 중국 외부에서의 채택에 영향을 미칠 것입니다.
자주 묻는 질문
T-Head SAIL이란 무엇인가요?
T-Head SAIL은 알리바바 그룹의 핑토우거가 자사의 젠위에 가속기를 위해 개발한 AI 소프트웨어 스택입니다. 드라이버, 런타임 소프트웨어, 언어 인터페이스, 컴파일러, 최적화 라이브러리, 성능 분석, 디버깅, 장치 모니터링 및 클러스터 관리를 포함합니다.
SAIL은 무엇을 의미하나요?
SAIL은 Seed of AI Library의 약자입니다. 핑토우거는 이 이름이 개방형 코드를 더 넓은 AI 컴퓨팅 생태계의 씨앗으로 삼겠다는 목표를 반영한다고 밝혔습니다.
SAIL 스택 전체가 이미 오픈소스로 공개되었나요?
계획된 모든 구성 요소가 첫 번째 단계에서 공개된 것은 아닙니다. 첫 번째 오픈소스 릴리스에는 문서, SDK 패키지, 커널 드라이버, 성능 도구 및 디버깅 리소스가 포함되며, 후속 단계에서는 더 많은 통신 소프트웨어, 패키지 소스 코드, 가속 라이브러리 및 추론 엔진이 포함될 예정입니다.
개발자는 어디에서 T-Head SAIL을 다운로드할 수 있나요?
공식 포털은 핑토우거 개발자 커뮤니티입니다. 패키지 가용성, 하드웨어 요구 사항, 라이선스 및 설치 지침은 실시간 포털을 통해 확인하십시오.
SAIL은 어떤 AI 프레임워크를 지원하나요?
핑토우거는 PyTorch, TensorFlow, vLLM 및 SGLang 등을 지원 생태계로 명시했으며, 소프트웨어 스택이 260개 이상의 프레임워크 및 생태계 구성 요소에 적응했다고 밝혔습니다. 구체적인 버전 및 프로덕션 상태는 호환성 문서를 확인해야 합니다.
CUDA 애플리케이션을 수정 없이 SAIL에서 실행할 수 있나요?
지원되는 연산을 사용하는 프레임워크 수준 애플리케이션은 약간의 조정만으로 가능할 수 있습니다. 사용자 정의 CUDA 코드, CUDA 전용 확장, 지원되지 않는 연산 및 하드웨어 전제 조건에 의존하는 부분은 포팅이 필요할 수 있습니다.
어떤 성능 분석 및 관리 도구가 포함되나요?
핑토우거는 연산자 분석을 위한 Asight Compute, 시스템 성능 분석을 위한 Asight Systems, 장치 모니터링을 위한 PPU-SMI, 클러스터 수준 관리를 위한 PPU-DCGM을 명시했습니다.
어떤 칩이 T-Head SAIL을 사용하나요?
SAIL은 젠위에 AI 가속기 시리즈 전용으로 설계되었습니다. 알리바바는 2026년 4월 기준으로 젠위에의 누적 출하량이 56만 개에 달하며, 이 소프트웨어 스택이 알리바바 클라우드 및 외부 프로덕션 환경에서 사용되고 있다고 밝혔습니다.
관련 도구
- 핑토우거 개발자 커뮤니티: SAIL 문서, SDK 패키지, 드라이버, 성능 도구 및 디버깅 리소스의 공식 포털.
- PyTorch: 오픈소스 머신러닝 프레임워크로, SAIL 지원 생태계 중 하나.
- TensorFlow: SAIL 생태계를 통해 지원되는 오픈소스 학습 및 추론 프레임워크.
- vLLM: T-Head 호환성 공지에서 언급된 오픈소스 고처리량 LLM 서비스 엔진.
- SGLang: SAIL이 지원하는 오픈소스 언어 및 멀티모달 모델 서비스 프레임워크.
- Anolis OS: T-Head의 SAIL 아키텍처 운영체제 목록에 등장하는 Linux 배포판.
- 알리바바 클라우드 모델 스튜디오: 알리바바 클라우드의 기반 모델 기반 애플리케이션 구축 및 배포 플랫폼.
관련 링크
- 공식 T-Head SAIL 발표: 알리바바 클라우드 개발자 커뮤니티 공지로, 기술 스택, 라이브러리, 도구, 호환성 성명 및 단계별 로드맵 포함.
- T-Head 개발자 커뮤니티: 현재 SAIL 문서 및 다운로드의 공식 포털.
- 알리바바 클라우드 WAIC 2026 개요: SAIL 오픈소스 및 젠위에 출하량을 확인하는 공식 영어 보고서.
- 젠위에 M890 공식 소개: M890 메모리, 상호 연결 대역폭, 성능 및 관련 인프라에 대한 공식 정보.
- 의톈 710 공식 발표: 알리바바 클라우드 Arm 서버 프로세서의 공식 사양 및 벤치마크 데이터.
- 함광 800 공식 발표: 알리바바 최초 AI 추론 칩의 최초 발표 정보.
- 알리바바 클라우드 더블 11 사례 연구: 알리바바 클라우드 인프라 및 함광 800 관련 공식 프로덕션 사례 정보.
요약
T-Head는 젠위에 가속기를 대규모로 배포한 후 SAIL을 오픈소스로 공개했습니다. 이 기술 스택은 젠위에 하드웨어를 운영체제, 프로그래밍 언어, 컴파일러, 최적화 라이브러리, AI 프레임워크, 성능 분석 도구 및 클러스터 관리 시스템과 연결합니다.
주요 약속은 마이그레이션 장벽을 낮추는 것입니다: 익숙한 코드와 프레임워크를 재사용하고, 새로운 AI 소프트웨어 지원을 더 빠르게 받으며, 단일 폐쇄형 개발 경로에 갇히지 않도록 하는 것입니다. 이러한 약속은 실제 모델, 사용자 정의 커널, 프레임워크 버전, 성능 목표 및 운영 요구 사항을 통해 검증되어야 합니다.
이번 공개는 실질적이지만 단계적으로 진행됩니다. 문서, SDK, 드라이버, 성능 도구 및 디버깅 리소스는 개발자 커뮤니티를 통해 제공되며, 추가 통신 라이브러리, 패키지 소스, 가속 라이브러리 및 추론 엔진 구성 요소는 후속 버전에서 출시될 예정입니다.
T-Head의 가장 중요한 조치는 단순히 또 다른 칩을 출시하는 것이 아니라, 개발자들이 이러한 칩이 지속 가능한 컴퓨팅 플랫폼이 될 수 있도록 하는 소프트웨어 계층을 살펴보고, 사용하며, 궁극적으로 함께 형성하도록 초대하는 것입니다.