Qingcheng.ai, WAIC 2026에서 토큰 '슈퍼 그리드' 구축... DeepSeek 배포 비용 75% 절감 주장
2026년 세계 인공지능 대회에서 모델 회사들은 매개변수 수로 전시장을 가득 채웠고, 인프라 제공업체들은 점점 더 큰 컴퓨팅 클러스터를 선보였습니다. 그러나 Qingcheng.ai의 부스에서 주요 관심사는 단일 모델이나 서버가 아니라, AI 에이전트의 전체 라이프사이클에서 토큰이 어떻게 생산, 라우팅, 분배, 측정 및 관리되는지를 보여주는 완전한 차트였습니다. Qingcheng.ai는 이 모델을 **토큰 '전점 후공'**이라고 부릅니다. 이 프레임워크는 세 가지 계층으로 구성됩니다: 1.

Qingcheng.ai, WAIC 2026에서 토큰 '슈퍼 그리드' 구축... DeepSeek 배포 비용 75% 절감 주장
서론
WAIC 2026 전시회에서 모델 기업들은 매개변수 개수로 전시장을 가득 채웠고, 인프라 제공업체들은 점점 더 거대해지는 컴퓨팅 클러스터를 선보였다. 그러나 청성지능(青城智能) 부스의 주인공은 특정 모델이나 서버가 아니었다.
바로 AI 에이전트의 전체 수명 주기에서 토큰이 어떻게 생산, 라우팅, 배포, 계량, 관리되는지를 보여주는 완전한 개요도였다.
청성지능은 이 모델을 **토큰 ‘전점후장(前店後廠)’**이라 명명했다. 이 프레임워크는 세 가지 계층으로 구성된다:
- 백엔드의 토큰 생산 계층
- 중간의 라우팅 및 서비스 계층
- 에이전트 애플리케이션 및 거버넌스 계층
이 회사는 자사의 아키텍처를 인공지능 시대의 전력 시스템에 비유한다. 컴퓨팅 하드웨어와 추론 소프트웨어는 발전소 역할을, AI 핑(AI Ping)은 전력망 역할을, 에이전트 도구는 전력을 소비하는 기기 역할을 한다.
청성지능 부스에서는 토큰 생산, 라우팅, 거버넌스의 전체 워크플로우를 전시했다.
원문 보고서에 따르면, 이 시스템은 세 가지 반복적인 문제를 해결하기 위해 설계되었다: 모델 API의 불안정성, 국산 이기종 가속기의 낮은 활용률, 대규모 에이전트 배포 시 명확한 토큰 회계 부재.
대규모 에이전트 애플리케이션 이전의 토큰 병목 현상
AI 에이전트가 데모 단계에서 프로덕션 환경으로 진입함에 따라, 하나의 사용자 요청이 여러 번의 모델 호출을 유발할 수 있다.
에이전트는 파일 검색, 데이터베이스 검색, 도구 호출, 코드 생성, 결과 평가, 계획 수정, 다른 에이전트 호출 등을 수행해야 할 수 있다. 사용자가 보는 응답은 최종 단계일 뿐이다. 그 뒤에는 시스템이 여러 서비스를 거쳐 대량의 토큰을 소비할 수 있다.
원문은 워크플로우가 확장됨에 따라 심각해지는 세 가지 주요 인프라 문제를 지적한다.
토큰 공급 불안정
모델 API 용량은 수요 피크 시 변동될 수 있다.
동일한 요청이 어떤 순간에는 빠르게 응답하다가, 다른 순간에는 느려지거나 사용 불가능해질 수 있다. 일상적인 대화 시나리오에서는 짧은 지연이 허용될 수 있지만, 각 단계의 후속 작업이 이전 단계의 응답에 의존하는 다단계 에이전트 워크플로우에서는 이러한 지연이 프로세스 중단으로 이어질 수 있다.
따라서 기업 시스템은 단순히 모델에 접근하는 것 이상이 필요하다. 예측 가능한 지연 시간, 처리량, 신뢰성, 출력 품질이 필요하다.
국산 가속기의 효율적 활용 어려움
많은 기관이 이미 혼합된 국산 GPU, NPU 및 지능형 컴퓨팅 서버를 도입했다. 하드웨어는 준비되었을 수 있지만, 그 위에 대규모 모델을 효율적으로 배포하는 것은 여전히 어렵다.
vLLM과 같은 인기 있는 추론 프레임워크는 처음에 NVIDIA 및 CUDA 생태계에 최적화되었다. 점점 더 많은 장치를 지원할 수 있지만, 모든 기능과 최적화를 다양한 가속기 아키텍처에 적용하려면 여전히 많은 엔지니어링 작업이 필요하다.
청성지능은 기본 추론 엔진과 하드웨어 인식 소프트웨어 스택이 이러한 클러스터에서 더 많은 사용 가능한 토큰 출력을 추출할 수 있다고 믿는다.
에이전트 지출 추적의 어려움
한 회사가 여러 에이전트를 운영할 때, 월별 모델 청구서는 어떤 워크플로우가 비용을 발생시켰는지 항상 보여주지 않는다.
단일 에이전트가 여러 모델을 호출하고, 여러 공급업체를 사용하며, 하위 에이전트를 실행하고, 몇 시간 동안 지속적으로 실행될 수 있다. 상세한 추적이 없다면, 조직은 다음과 같은 기본적인 질문에 답하기 어려울 수 있다:
- 어떤 에이전트가 토큰을 소비했는가?
- 어떤 모델과 공급업체를 호출했는가?
- 어떤 도구나 단계가 가장 큰 비용을 발생시켰는가?
- 특정 워크플로우가 예상 예산을 초과했는가?
- 해당 요청을 더 저렴한 서비스로 라우팅할 수 있었는가?
청성지능은 자사의 3계층 시스템을 생산, 배포, 애플리케이션, 과금을 연결하는 통합 인프라 아키텍처로 포지셔닝한다.

전시 청사진은 하위 컴퓨팅부터 에이전트 애플리케이션까지의 워크플로우를 묘사한다.
3계층 ‘전점후장’ 아키텍처
이 아키텍처는 간단한 산업적 비유를 중심으로 구축되었다.
**후장(後廠)**은 컴퓨팅 하드웨어를 토큰으로 변환한다. **상점(商店)**은 토큰 서비스를 집계하고 라우팅한다. **애플리케이션 노드(應用節點)**는 에이전트를 배포하고 토큰 소비 방식을 제어한다.
청성지능의 아키텍처는 토큰 생산, 서비스 라우팅, 에이전트 거버넌스를 연결한다.
이 세 계층은 독립적인 제품이 아닌 협력하여 작동하도록 설계되었다.
후장: 토큰 생산 계층
후장은 물리적 컴퓨팅 리소스를 표준화된 모델 추론 능력으로 변환하는 역할을 한다.
주요 구성 요소는 다음과 같다:
- 하드웨어 및 컴퓨팅 파트너
- 츠투(赤兔) 추론 엔진
- 바꾸루(八卦爐) 지능형 소프트웨어 스택
청성지능은 이 계층을 발전소에 비유한다. 목표는 배포 복잡성을 줄이면서 사용 가능한 하드웨어에서 가능한 한 많은 안정적이고 사용 가능한 토큰을 생성하는 것이다.
츠투: 프로덕션 지향 추론 엔진
츠투는 청성지능이 오픈소스로 공개한 고성능 추론 프레임워크이다.
공식 저장소는 이를 프로덕션 지향적이며 효율성, 유연성, 사용성을 중시하는 엔진으로 설명한다. CPU 및 단일 가속기부터 대규모 클러스터까지 배포를 지원하며, 여러 국산 하드웨어 플랫폼에 최적화되어 있다.
이 프로젝트는 또한 DeepSeek, Qwen, GLM, Kimi 등의 모델과 표준 OpenAI 호환 HTTP 인터페이스를 지원한다.

츠투는 이기종 컴퓨팅 플랫폼에서 대규모 모델 추론 성능을 향상시키는 데 사용된다.
청성지능은 단일 하드웨어 생태계를 중심으로 설계된 프레임워크를 적용하는 것은 잘못된 도구를 사용하는 것과 유사할 수 있다고 본다. 이 회사의 비유는 다음과 같다: 빵을 굽기 위해 설계된 오븐을 개조하여 찐빵을 만들 수는 있지만, 전용 찜기
저장소는 또한 성능 결과가 하드웨어, 소프트웨어 및 테스트 부하에 따라 달라질 수 있다고 지적합니다.
바꿔로: 인프라 복잡성 숨기기
바꿔로는 Qingcheng.ai가 모델 학습, 추론, 배포, 스케줄링 및 운영을 위해 사용하는 소프트웨어 스택입니다.
이 회사는 이를 복잡한 인프라 작업을 더 관리하기 쉬운 엔터프라이즈급 플랫폼으로 패키징하는 방식으로 활용합니다.
바꿔로는 이기종 하드웨어 위에 위치하여 배포 및 운영 도구를 제공합니다.
바꿔로는 다음 분야에서 필요한 수동 작업을 줄이는 것을 목표로 합니다:
- 클러스터 리소스 관리
- 모델 및 애플리케이션 배포
- 분산 학습
- 추론 최적화
- 성능 평가
- 애플리케이션 전달
- 모니터링 및 운영
Qingcheng.ai는 또한 Inspur Information과 협력하여 공동 최적화된 YuanNao Bagua Furnace All-in-One을 출시했습니다. 공개된 Qwen3-32B 테스트에서 협력사는 Chitu 최적화 후 총 추론 처리량이 최대 14.45배 향상되었고, 전체 스택 튜닝 후 엔드투엔드 성능이 약 10배 개선되었다고 보고했습니다.
이 데이터는 협력사 자체 테스트 환경에서 얻은 것으로, WAIC에서 설명된 DeepSeek FP4 사례와 동일하지 않습니다.
이기종 클러스터 최적화
백엔드 팩토리 레이어는 여러 유형의 가속기를 관리하도록 설계되었습니다.
원본 보고서에 언급된 한 가지 전략은
프리필 및 디코딩 워크로드를 분리하는 것입니다.
프리필 단계에서는 시스템이 입력 프롬프트를 처리하고 모델의 내부 캐시를 구축합니다. 디코딩 단계에서는 시스템이 점진적으로 출력 토큰을 생성합니다. 이 두 단계는 메모리, 대역폭 및 컴퓨팅 특성에서 차이가 있습니다.
이기종 클러스터는 각 단계를 가장 효율적으로 처리할 수 있는 하드웨어에 할당할 수 있습니다. 이 방식은 때때로 "프리필-디코딩 분리"라고 불립니다.
목표는 모든 가속기가 동일하게 작동하도록 하는 것이 아니라, 각 하드웨어가 자신의 강점에 가장 잘 맞는 워크로드 부분을 처리하도록 하는 것입니다.
스토어: AI Ping을 토큰 라우팅 허브로
토큰이 생성되면 애플리케이션은 여전히 이를 안정적으로 가져올 방법이 필요합니다.
중간 계층은 AI Ping, 즉 Qingcheng Zhiyun의 모델 서비스 평가 및 API 라우팅 플랫폼입니다.
AI Ping은 지속적으로 모델 서비스를 모니터링하고 여러 서비스 제공업체 위에 통합 인터페이스를 제공합니다.

AI Ping은 모델 API를 평가하고 서비스 제공업체 간에 요청을 라우팅합니다.
원본 보고서에 따르면 AI Ping은 다음을 모니터링합니다:
- 30개 이상의 서비스 제공업체
- 600개 이상의 모델 서비스 인터페이스
- 지연 시간
- 처리량
- 신뢰성
- 캐시 적중률
- 토큰 품질
- 가격 및 서비스 가용성
이 플랫폼은 개발자가 여러 계정을 생성하고, 다양한 API 형식을 관리하며, 각 서비스 제공업체를 수동으로 비교해야 하는 필요성을 줄이는 것을 목표로 합니다.
사용자는 다음과 같은 목표를 우선시할 수 있습니다:
- 비용 절감
- 응답 속도 향상
- 신뢰성 향상
- 출력 품질 개선
선호도가 지정되지 않은 경우, AI Ping은 자체 라우팅 로직을 사용하여 사용 가능한 서비스를 선택할 수 있습니다.
서비스 혼잡 시 동적 라우팅
정적 통합은 개발자가 구성을 변경할 때까지 모든 요청을 동일한 서비스 제공업체로 보냅니다.
동적 라우팅은 다릅니다. 특정 서비스 제공업체가 느려지거나 사용할 수 없게 되면, 라우팅 계층은 후속 요청을 현재 더 나은 성능을 보이는 다른 서비스로 전환할 수 있습니다.
이는 에이전트 워크로드에 유용합니다. 한 번의 중단으로 인해 긴 작업이 실패할 수 있기 때문입니다.
이 플랫폼이 예상하는 피드백 루프는 다음과 같습니다:
- AI Ping이 서비스 품질을 지속적으로 측정합니다.
- 라우팅 결정은 최신 측정 데이터를 사용합니다.
- 실제 사용자 트래픽이 추가 성능 데이터를 제공합니다.
- 새로운 데이터가 미래의 평가 및 라우팅을 개선합니다.
Qingcheng Zhiyun은 통합 API를 통해 소규모 팀도 일반적으로 내부 플랫폼 팀이 필요로 하는 라우팅 및 모니터링 기능에 액세스할 수 있다고 밝혔습니다.
이 회사는 AI Ping을 통해 비용, 처리량 및 지연 시간에서의 평균 개선을 별도로 보고했습니다. 이러한 백분율은 플랫폼에서 발표한 결과로, 선택한 모델, 서비스 제공업체, 트래픽 패턴 및 라우팅 전략에 따라 실제 결과가 달라질 수 있습니다.
애플리케이션 노드: 에이전트 스토어 및 ATM
최종 계층은 에이전트가...
토큰이 배포되는 방식 및 사용 거버넌스 규칙에 중점을 둡니다.
이 시스템은 두 가지 주요 구성 요소로 구성됩니다:
- Agent 스토어
- ATM (Agent Token Manager)
Agent 스토어
Agent 스토어는 범용 및 업계 특화 Agent의 배포 및 재사용 계층으로 포지셔닝됩니다.
핵심 가치는 Agent 개발자와 배포 가능한 워크플로우가 필요한 조직을 연결하고, 이러한 Agent가 더 넓은 토큰 인프라에 액세스할 수 있도록 하는 데 있습니다.
원본 보고서는 이를 공유 전력망에 연결된 가전제품 시장에 비유했습니다. 이 문서 작성 시점에서 Agent 스토어의 가격 정책, 검토 기준, 배포 형식 및 상업 조건에 대한 공개 문서는 여전히 매우 제한적입니다.
ATM: Agent Token Manager
ATM은 Agent Token Manager의 약자입니다.
Qingcheng Technology는 2026 세계 인공지능 대회에서 이를 다중 에이전트 시스템을 위한 로컬화된 토큰 관리 및 거버넌스 도구로 출시했습니다.
이 도구는 다음 기능을 제공합니다:
- API 자격 증명 통합 관리
- 토큰 사용량 추적
- 비용 할당 계산
- 소비 한도 제어
- 공급업체 전환 및 장애 복구
- 다중 에이전트 리소스 격리
- 비정상 사용량 경고
- 로컬화/개인 정보 보호 중심 모니터링
원본 문서에 따르면 ATM은 행동 후크, 로컬 파일 스캔 및 개인 정보 게이트웨이와 같은 메커니즘을 통해 Agent 활동을 관찰할 수 있습니다.
실제 적용에서 ATM은 AI 워크로드의 "전기 계량기"와 유사합니다. 목표는 토큰 과금을 해당 소비를 발생시킨 Agent, 작업, 모델 및 도구와 연결하는 것입니다.
이는 클라우드 비용 관리(FinOps) 개념, 즉 클라우드 지출의 측정 및 제어 분야와 밀접한 관련이 있습니다. Agent 시스템에서는 단일 비즈니스 프로세스에 여러 계층의 중첩된 모델 호출이 포함될 수 있기 때문에 과제가 더 세밀합니다.
효과적인 Agent 비용 기록에는 다음이 포함되어야 합니다:
- 시작한 사용자 또는 워크플로우
- 관련된 Agent 및 하위 Agent
- 선택한 모델
- 입력/출력 토큰 수
- 작업 중 호출된 도구
- 공급업체 가격
- 재시도 및 실패한 호출 횟수
- 총 비용 및 소요 시간
Qingcheng Technology는 ATM을 이러한 새로운 워크로드 유형을 위한 토큰 중심의 FinOps 계층으로 포지셔닝합니다.
Qingcheng Technology가 중립성을 강조하는 이유
원본 기사에 따르면 중립성은 Qingcheng Technology의 핵심 강점 중 하나입니다.
대규모 클라우드 컴퓨팅 및 하드웨어 기업은 자연스럽게 자체 플랫폼, 파트너 또는 투자 대상을 우선시하는 경향이 있습니다. 따라서 혼합 클러스터를 운영하는 조직은 여러 경쟁 가속기 및 서비스 제공업체를 지원하는 독립 소프트웨어 공급업체를 선호합니다.
Qingcheng Technology는 자사 플랫폼이 단일 칩 공급업체에 종속되지 않는다고 주장합니다.
이 철학은 Chitu의 다양한 하드웨어 환경 지원 능력과 AI Ping의 다중 공급업체 라우팅 모델에 반영됩니다.
중립성은 실제로 검증되어야 합니다. 고객은 다음 요소를 검토해야 합니다:
- 지원되는 하드웨어 및 소프트웨어 버전
- 라우팅 규칙
- 비즈니스 파트너십
- 벤치마킹 방법론
- 데이터 보존 정책
- 공급업체 선택 옵션
- 장애 조치 및 폴백 메커니즘
이 회사의 기술적 배경은 또 다른 포지셔닝 장점을 구성합니다.
Qingcheng Technology는 2023년 12월에 설립되었으며, 핵심 팀은 칭화대학교 컴퓨터 과학과 고성능 컴퓨팅 연구소 출신입니다.
회사에 따르면 이 팀은 이전에 슈퍼컴퓨팅 센터 및 지능형 컴퓨팅 센터를 위한 성능 평가 및 최적화 작업을 수행했습니다.
국산 컴퓨팅 파워를 수출 가능한 토큰 서비스로 전환
Qingcheng AI는 또한 토큰 서비스를 국내 컴퓨팅 파워가 해외 사용자에게 도달할 수 있는 실행 가능한 경로로 보고 있습니다.
그 논리는 다음과 같습니다: 개발자는 응답을 생성한 가속기가 무엇인지 알 필요가 없습니다. 개발자는 모델 API를 구매하고 토큰을 받습니다.
국산 하드웨어가 경쟁력 있는 모델을 안정적이고 효율적으로 지원할 수 있다면, 그 출력은 통합 API를 통해 판매될 수 있으며, 해외 고객은 기본 하드웨어 아키텍처를 배포하거나 알 필요가 없습니다.
Qingcheng AI는 토큰 서비스를 전 세계적으로 국내 컴퓨팅 파워를 유통하는 방법으로 봅니다.
원본 보고서에 따르면 해외 개발 트래픽의 피크 시간대는 일반적으로 베이징 시간 기준 오후 10시부터 다음 날 오전 8시까지입니다.
이는 활용 기회를 창출합니다. 국내 비수기 시간대에 유휴 상태인 컴퓨팅 파워를 다른 시간대의 사용자에게 서비스하는 데 사용할 수 있습니다.
문서에 설명된 워크플로는 다음과 같습니다:
- 국산 가속기가 Chitu를 통해 토큰을 생성합니다.
- AI Ping이 서비스 품질을 측정하고 요청을 스케줄링합니다.
- 파트너가 서비스를 해외 개발자에게 배포합니다.
- 사용자가 표준 API를 통해 모델을 사용합니다.
이로 인해 국제 서비스 제공의 일반적인 요구사항이 사라지는 것은 아닙니다. 서비스 제공업체는 여전히 지연 시간, 규정 준수, 데이터 거버넌스, 모델 라이선스, 과금, 기술 지원 및 지역별 가용성 등을 처리해야 합니다.
Agent 경제를 위한 기반 마련
AI 전시회에서 가장 눈에 띄는 제품은 일반적으로 모델과 애플리케이션입니다.
인프라는 사용자 인터페이스 아래에서 대부분의 작업이 이루어지기 때문에 상대적으로 주목을 덜 받습니다. 인프라는 모델이 안정적으로 실행될 수 있는지, Agent가 작업을 완료할 수 있는지, 최종 비용이 명확하게 이해 가능한지 여부를 결정합니다.
칭청 AI의 '전점후장(前店後廠)' 개념은 세 가지 문제를 연결합니다:
- 토큰을 어떻게 효율적으로 생산할 것인가?
- 토큰을 어떻게 안정적으로 라우팅할 것인가?
- 토큰을 어떻게 Agent가 소비하고 관리할 것인가?
'후장(後廠)'은 하드웨어, Chitu 및 Bagualu를 결합합니다. '전점(前店)'은 AI Ping을 사용하여 모델 서비스를 평가하고 라우팅합니다. 애플리케이션 노드는 Agent Store와 ATM을 사용하여 Agent를 배포하고 토큰 사용량을 관리합니다.
전력망 비유는 기술 표준은 아니지만, 기업이 풀스택 아키텍처를 이해하는 실용적인 관점을 제공합니다.
해당 아키텍처는 각 모델 API, 가속기 클러스터 및 Agent를 독립된 제품으로 보지 않고, 토큰 공급망에서 상호 연결된 구성 요소로 간주합니다.
자주 묻는 질문
칭청 AI의 토큰 '전점후장' 아키텍처란 무엇인가요?
이는 토큰 생산, API 라우팅 및 Agent 애플리케이션을 포괄하는 3계층 AI 인프라 모델입니다. '후장'은 컴퓨팅 파워 하드웨어, Chitu 및 Bagualu를 사용하고, 중간 계층은 AI Ping을 사용하며, 애플리케이션 계층은 Agent Store와 ATM을 포함합니다.
Chitu 추론 엔진이란 무엇인가요?
Chitu는 프로덕션 환경을 위한 오픈소스 대규모 모델 추론 프레임워크입니다. 다양한 국산 및 국제 가속기 플랫폼, 다양한 배포 규모, 저정밀 추론 및 OpenAI 호환 HTTP 서비스 인터페이스를 지원합니다.
Chitu가 모든 DeepSeek 배포 비용을 75% 절감했나요?
일반적인 75% 비용 절감 약속은 공개되지 않았습니다. 해당 데이터는 특정 FP4 배포 시나리오에서 비롯되었습니다. 해당 구성에서 서버 요구 사항이 4대에서 1대로 줄어들어 머신 수가 75% 감소했습니다.
Chitu를 Docker로 배포할 수 있나요?
네. Chitu 공식 저장소는 이미昇腾, 海光, MetaX 등 다양한 하드웨어 환경에 맞는 Dockerfile을 제공하며, 일반 설치 및 배포 문서도 함께 제공됩니다.
AI Ping의 용도는 무엇인가요?
AI Ping은 모델 API 서비스를 모니터링하고 비교하며, 비용, 속도, 안정성 또는 품질 등의 목표에 따라 요청을 라우팅합니다. 여러 서비스 제공업체 위에 통합 API를 제공합니다.
Agent Token Manager란 무엇인가요?
Agent Token Manager(약칭 ATM)는 칭청 AI가 Agent 시스템을 위해 설계한 토큰 거버넌스 도구로, 사용량 추적, 비용 분배, 자격 증명 관리, 한도 설정, 워크로드 격리 및 비정상적인 소비 발생 시 팀에 경고를 보내는 기능을 제공합니다.
Bagualu는 추론 엔진인가요?
Bagualu는 추론 엔진에 국한되지 않고 더 광범위한 소프트웨어 스택입니다. 훈련, 추론 배포, 스케줄링, 모니터링, 애플리케이션 전달 및 클러스터 운영을 포괄하며, Chitu는 핵심 모델 추론 계층을 담당합니다.
'비용 75% 절감' 결과는 독립적으로 검증되었나요?
해당 결과는 칭청 AI 및 원본 보고서에서 제공되었습니다. 독립적인 재현에 필요한 구체적인 배포 세부 사항은 아직 완전히 공개되지 않았으므로, 독자께서는 자체 모델, 하드웨어 및 워크로드에서 직접 테스트해 보시기 바랍니다.
관련 도구
- Chitu: 대규모 언어 모델 및 이기종 하드웨어를 위한 오픈소스 프로덕션급 추론 프레임워크.
- AI Ping: 칭청 AI가 운영하는 모델 서비스 평가 및 지능형 API 라우팅 플랫폼.
- Bagualu: 칭청 AI가 출시한 모델 훈련, 추론, 배포 및 클러스터 운영을 위한 소프트웨어 스택.
- vLLM: 널리 사용되는 고처리량 대규모 모델 서비스 오픈소스 엔진.
- SGLang: 언어 모델 및 멀티모달 모델을 위한 오픈소스 서비스 프레임워크.
- DeepSeek: 배포 사례에서 논의된 DeepSeek 모델 시리즈의 공식 플랫폼.
- OpenAI API 규격: 대부분의 모델 서비스 엔진이 애플리케이션 호환성을 위해 사용하는 API 형식.
관련 링크
- 칭청 AI 공식 홈페이지: Chitu, Bagualu 및 AI Ping의 공식 제품 및 회사 정보.
- Chitu GitHub 저장소: 소스 코드, Dockerfile, 지원 모델, 버전 릴리스, 벤치마크 및 배포 문서 포함.
- Chitu 제품 페이지: 칭청 AI의 지원 하드웨어, 모델, 인터페이스 및 성능 주장 개요.
- Bagualu 제품 페이지: 훈련 및 인프라 관련 공식 정보.
- AI Ping: 공식 모델 평가 및 통합 API 라우팅 플랫폼.
- 과학기술일보 보도: 칭청 AI의 엔드투엔드 토큰 솔루션 및 AI Ping 지표를 다룬 독립 보도.
- Inspur Yuan Brain Bagualu 장치: 공동 최적화된 Chitu 및 Bagualu 엔터프라이즈급 장치 테스트 세부 사항 발표.
요약
2026년 세계 인공지능 대회에서 칭청 AI는 모델 추론, API 라우팅, Agent 배포 및 비용 거버넌스를 연결하는 3계층 토큰 인프라를 시연했습니다.
백엔드 팩토리 계층은 Chitu와 Bagualu를 사용하여 이기종 컴퓨팅 하드웨어에서 모델 배포를 최적화합니다. 회사 보고서에 따르면 FP4 DeepSeek 구성에서 필요한 머신 수가 4대에서 1대로 줄어들어 75%의 비용 절감 효과를 보였습니다.
AI Ping은 중간 라우팅 계층을 구성하고, Agent Store와 ATM은 Agent 배포 및 토큰 재무 운영을 담당합니다. 각 제품은 단일 하드웨어 또는 API 제공업체에 의존하지 않고 토큰 공급을 더욱 안정적이고 정량화 가능하게 만드는 데 기여합니다.
핵심 개념은 간단명료합니다. AI Agent에는 모델만 필요한 것이 아닙니다. 소비하는 모든 토큰을 생성, 라우팅, 측정 및 제어할 수 있는 인프라 계층이 필요합니다.