Qingcheng.ai costruisce una 'super griglia' di token al WAIC 2026, affermando una riduzione del 75% dei costi di implementazione di DeepSeek

Alla Conferenza Mondiale sull'Intelligenza Artificiale del 2026, le aziende di modelli riempiono le sale espositive con il numero di parametri, mentre i fornitori di infrastrutture mostrano cluster di calcolo sempre più grandi. Tuttavia, nello stand di Qingcheng.ai, l'attrazione principale non è un singolo modello o server, ma un diagramma completo che mostra come i token vengono prodotti, instradati, distribuiti, misurati e governati durante l'intero ciclo di vita degli agenti AI. Qingcheng.ai definisce questo modello come **'negozio anteriore e fabbrica posteriore' dei token**. Il framework comprende tre livelli: 1.

发布于 2026年7月23日generalGEO 评分: 02 次阅读
Cover image for “Qingcheng.ai costruisce una 'super griglia' di token al WAIC 2026, affermando una riduzione del 75% dei costi di implementazione di DeepSeek”

Qingcheng.ai costruisce una 'super griglia' di token al WAIC 2026, affermando una riduzione del 75% dei costi di implementazione di DeepSeek

Introduzione

Alla fiera WAIC 2026, le aziende di modelli riempivano i padiglioni con il numero di parametri, mentre i fornitori di infrastrutture mostravano cluster di calcolo sempre più grandi. Tuttavia, il protagonista dello stand di Qingcheng Intelligence non era un singolo modello o server.

Bensì un diagramma completo che mostrava come i Token vengono prodotti, instradati, distribuiti, misurati e governati durante l'intero ciclo di vita di un Agente AI.

Qingcheng Intelligence ha chiamato questo modello "Negozio dietro la Fabbrica" dei Token. Questa struttura integra tre livelli:

  1. Livello di produzione dei Token (back-end)
  2. Livello di instradamento e servizio (intermedio)
  3. Livello delle applicazioni Agente e governance

L'azienda descrive la propria architettura come il sistema elettrico dell'era dell'intelligenza artificiale. L'hardware di calcolo e il software di inferenza fungono da centrali elettriche, AI Ping assume il ruolo di rete elettrica, mentre gli strumenti Agente sono i dispositivi che consumano elettricità.

Lo stand di Qingcheng Intelligence mostrava il flusso di lavoro completo di produzione, instradamento e governance dei Token.

Secondo il rapporto originale, il sistema è progettato per risolvere tre problemi ricorrenti: instabilità delle API dei modelli, basso utilizzo degli acceleratori eterogenei nazionali e mancanza di una chiara contabilizzazione dei Token nelle distribuzioni su larga scala degli Agenti.

Collo di Bottiglia dei Token prima delle Applicazioni Agente su Larga Scala

Con il passaggio degli Agenti AI dalla fase dimostrativa all'ambiente produttivo, una singola richiesta utente può innescare più chiamate al modello.

Un Agente potrebbe dover recuperare un file, cercare in un database, chiamare uno strumento, generare codice, valutare risultati, rivedere piani e quindi chiamare un altro Agente. La risposta che l'utente vede è solo il passo finale. Dietro le quinte, il sistema potrebbe consumare una grande quantità di Token attraverso più servizi.

L'articolo originale evidenzia tre problemi infrastrutturali che peggiorano man mano che i flussi di lavoro si espandono.

Fornitura Instabile di Token

La capacità delle API dei modelli può fluttuare durante i picchi di domanda.

La stessa richiesta potrebbe essere rapida in un momento e lenta o non disponibile in un altro. Nei scenari di conversazione informale, un breve ritardo potrebbe essere accettabile, ma in un flusso di lavoro multi-step di un Agente, dove ogni passo dipende dalla risposta del precedente, questo ritardo può causare un'interruzione del processo.

Pertanto, i sistemi aziendali non hanno solo bisogno di accedere a un modello. Hanno bisogno di latenza, throughput, affidabilità e qualità di output prevedibili.

Difficoltà nell'Utilizzo Efficiente degli Acceleratori Nazionali

Molte istituzioni hanno acquistato una combinazione eterogenea di GPU, NPU e server di calcolo intelligente nazionali. L'hardware potrebbe essere già installato, ma è ancora difficile distribuire modelli di grandi dimensioni in modo efficiente su di esso.

Framework di inferenza popolari come vLLM erano originariamente ottimizzati per l'ecosistema NVIDIA e CUDA. Sebbene supportino un numero crescente di dispositivi, richiedono comunque un notevole lavoro di ingegneria per adattare ogni funzione e ottimizzazione a diverse architetture di acceleratori.

Qingcheng Intelligence ritiene che un motore di inferenza nativo e uno stack software con consapevolezza hardware possano estrarre più output di Token utilizzabili da questi cluster.

Difficoltà nel Tracciare la Spesa degli Agenti

Quando un'azienda gestisce più Agenti, la fattura mensile del modello non sempre mostra quale flusso di lavoro ha generato i costi.

Un singolo Agente potrebbe chiamare più modelli, utilizzare più fornitori, avviare sotto-agenti e funzionare per ore. Senza un tracciamento dettagliato, l'organizzazione potrebbe avere difficoltà a rispondere a domande di base:

  • Quale Agente ha consumato i Token?
  • Quale modello e fornitore ha chiamato?
  • Quale strumento o passo ha causato il costo maggiore?
  • Un determinato flusso di lavoro ha superato il budget previsto?
  • La richiesta potrebbe essere instradata a un servizio più economico?

Qingcheng Intelligence posiziona la sua architettura a tre livelli come un'infrastruttura integrata che collega produzione, distribuzione, applicazione e fatturazione.

L'immagine mostra l'area AI Ping Token Store di Qingcheng Intelligence al WAIC 2026. Il negozio è caratterizzato da toni verdi e rosa, con cartelli che indicano "AI Ping Token Store", "AI Ping Token: Più, Veloce, Buono, Economico" e "Agent Store". Sul bancone sono esposti vari prodotti, come quaderni e chiavette USB, e sotto il bancone c'è un cartello "Compra Token su aiping.cn". Sullo sfondo ci sono anche cartelli come "Token Factory" e "LTHPC", oltre a un cartello con la scritta "Il 30.000° sostenitore dei Token Nazionali". L'immagine presenta visivamente i prodotti e i contenuti promozionali relativi ad AI Ping Token mostrati da Qingcheng Intelligence in fiera.

Il progetto dell'esposizione descrive il flusso di lavoro dal calcolo di base alle applicazioni Agente.

Architettura a Tre Livelli "Negozio dietro la Fabbrica"

L'architettura è costruita attorno a una semplice analogia industriale.

La fabbrica posteriore trasforma l'hardware di calcolo in Token. Il negozio aggrega e instrada i servizi di Token. I nodi applicativi distribuiscono gli Agenti e controllano il modo in cui i Token vengono consumati.

L'architettura di Qingcheng Intelligence collega la produzione di Token, l'instradamento dei servizi e la governance degli Agenti.

Questi tre livelli sono progettati per funzionare insieme, non come prodotti isolati.

Fabbrica Posteriore: Livello di Produzione dei Token

La fabbrica posteriore si occupa di trasformare le risorse di calcolo fisiche in capacità di inferenza dei modelli standardizzate.

I suoi componenti principali includono:

  • Partner hardware e di calcolo
  • Motore di inferenza Chitu
  • Stack software intelligente Bagua Lu

Qingcheng Intelligence paragona questo livello a una centrale elettrica. Il suo obiettivo è generare il maggior numero possibile di Token stabili e utilizzabili dall'hardware disponibile, riducendo al contempo la complessità di distribuzione.

Chitu: Motore di Inferenza Orientato alla Produzione

Chitu è il framework di inferenza ad alte prestazioni open source di Qingcheng Intelligence.

Il repository ufficiale lo descrive come un motore orientato alla produzione, che privilegia efficienza, flessibilità e usabilità. Supporta la distribuzione da CPU e singoli acceleratori a cluster su larga scala ed è ottimizzato per più piattaforme hardware nazionali.

Il progetto supporta anche modelli come DeepSeek, Qwen, GLM e Kimi, oltre a interfacce HTTP standard compatibili con OpenAI.

L'immagine mostra le informazioni relative al fornitore di servizi Token all-in-one di Qingcheng Intelligence. Lo sfondo è un gradiente blu-bianco, con il logo e il nome di Qingcheng Intelligence nell'angolo in alto a sinistra. Al centro, un grande titolo "Qingcheng Intelligence: Fornitore di Servizi Token All-in-One" viene presentato, seguito da una descrizione che lo definisce un fornitore professionale di soluzioni Token all-in-one a catena completa. Si basa sul motore di inferenza di grandi modelli sviluppato internamente e su algoritmi di instradamento intelligenti per migliorare l'efficienza dell'uso del calcolo intelligente, fornendo al settore servizi Token di modelli di grandi dimensioni di alta qualità e a basso costo. In basso, ci sono tre identificatori di servizio: "Motore di Inferenza Chitu", "Piattaforma di Servizi Token All-in-One AI Ping" e "Serie Software Bagua Lu". Nell'angolo in alto a destra c'è un codice QR che invita a seguire l'account ufficiale di Qingcheng Intelligence.

Chitu è utilizzato per migliorare le capacità di inferenza dei grandi modelli su piattaforme di calcolo eterogenee.

Qingcheng Intelligence ritiene che adattare un framework progettato attorno a un singolo ecosistema hardware possa essere come usare lo strumento sbagliato. L'analogia dell'azienda è: un forno progettato per cuocere il pane può essere modificato per cuocere... i ravioli al vapore, ma un cestello per la cottura a vapore dedicato potrebbe utilizzare più efficacemente il calore esistente.

Sebbene il paragone sia semplificato, i problemi di ingegneria alla base sono reali. Le architetture degli acceleratori differiscono per memoria, comunicazione, operatori, formati numerici, compilazione e comportamento di scheduling.

Chitu include ottimizzazioni specifiche per l'hardware e supporto per inferenze a bassa precisione, incluse le configurazioni FP4 e FP8.

Dichiarazione sul Costo di DeepSeek del 75%

Il rapporto originale afferma che il modello DeepSeek distribuito con FP4 ha ridotto l'hardware necessario da quattro macchine a una.

In questa configurazione specifica, la riduzione da quattro macchine a una equivale a una riduzione del 75% del numero di macchine necessarie. L'articolo ha convertito questa riduzione in un risparmio sui costi del 75%.

Il rapporto attribuisce la distribuzione di DeepSeek da quattro macchine a una all'ottimizzazione FP4.

Questo risultato non deve essere interpretato come una garanzia di una riduzione universale del 75% dei costi per ogni distribuzione di DeepSeek.

Il risparmio effettivo dipende dai seguenti fattori:

  • Modello DeepSeek selezionato e schema di quantizzazione
  • Tipo di acceleratore e capacità di memoria
  • Configurazione del server
  • Lunghezza del contesto
  • Dimensione del batch e concorrenza
  • Obiettivo di latenza
  • Requisiti di precisione
  • Versione del software
  • Costi energetici e operativi

Chitu open source

Il repository sottolinea inoltre che i risultati delle prestazioni possono variare in base all'hardware, al software e al carico di prova.

Bagua Furnace: Nascosta la complessità dell'infrastruttura

Bagua Furnace è lo stack software utilizzato da Qingcheng.ai per l'addestramento dei modelli, l'inferenza, la distribuzione, la pianificazione e la manutenzione operativa.

L'azienda lo presenta come un modo per trasformare il complesso lavoro infrastrutturale in una piattaforma di livello enterprise più gestibile.

Bagua Furnace si basa su hardware eterogeneo, fornendo strumenti di distribuzione e manutenzione.

Bagua Furnace mira a ridurre il carico di lavoro manuale necessario nei seguenti ambiti:

  • Gestione delle risorse del cluster
  • Distribuzione di modelli e applicazioni
  • Addestramento distribuito
  • Ottimizzazione dell'inferenza
  • Valutazione delle prestazioni
  • Consegna delle applicazioni
  • Monitoraggio e manutenzione

Qingcheng.ai ha inoltre collaborato con Inspur Information per lanciare il MetaBrain Bagua Furnace All-in-One ottimizzato congiuntamente. In un test pubblicato con Qwen3-32B, i partner hanno riportato un aumento del throughput totale di inferenza fino a 14,45 volte dopo l'ottimizzazione Chitu, e un miglioramento delle prestazioni end-to-end di circa 10 volte dopo l'ottimizzazione full-stack.

Questi dati provengono dall'ambiente di test interno delle aziende partner e non sono equivalenti al caso DeepSeek FP4 descritto al WAIC.

Ottimizzazione dei cluster eterogenei

Il livello backend della fabbrica è progettato per gestire più tipi di acceleratori.

Una delle strategie menzionate nel rapporto originale è

quella di separare i carichi di lavoro di prefill e decoding.

Nella fase di prefill, il sistema elabora i prompt di input e costruisce la cache interna del modello. Nella fase di decoding, il sistema genera gradualmente i token di output. Queste due fasi differiscono in termini di memoria, larghezza di banda e caratteristiche computazionali.

I cluster eterogenei possono assegnare ciascuna fase all'hardware più efficiente per gestirla. Questa pratica è talvolta chiamata "separazione prefill-decoding".

L'obiettivo non è rendere tutti gli acceleratori uniformi, ma far sì che hardware diverso gestisca la parte del carico di lavoro più adatta alle proprie caratteristiche.

Negozio: AI Ping come hub di routing dei token

Una volta generati i token, le applicazioni necessitano ancora di un modo stabile per ottenerli.

Il livello intermedio è AI Ping, la piattaforma di valutazione dei servizi modello e routing delle API di Qingcheng Zhìyùn.

AI Ping monitora costantemente i servizi modello e fornisce un'interfaccia unificata sopra più fornitori di servizi.

Questa è un'immagine promozionale relativa alla piattaforma di servizi Token一站式的 AI Ping di Qingcheng.ai. Le funzionalità principali della piattaforma includono un'interfaccia unificata per collegare più servizi modello, la valutazione della qualità e delle prestazioni dei Token, e una funzione di routing intelligente, che aiuta gli utenti a scegliere servizi Token più convenienti. L'immagine mostra che la piattaforma può collegare modelli mainstream come DeepSeek, Owen, MiniMax, GLM, Kimi, e presenta anche risultati di test reali, con annotazioni che indicano che l'utilizzo della piattaforma può portare a una riduzione dei costi superiore al 37%, un aumento del throughput superiore al 90% e una riduzione della latenza superiore al 20%. Ai lati dell'immagine sono presenti codici QR per unirsi al gruppo tramite Feishu e per seguire la valutazione dei servizi modello di grandi dimensioni. L'URL della piattaforma è aiping.cn.

AI Ping valuta le API dei modelli e instrada le richieste tra i fornitori di servizi.

Il rapporto originale indica che AI Ping monitora i seguenti aspetti:

  • Oltre 30 fornitori di servizi
  • Oltre 600 interfacce di servizio modello
  • Latenza
  • Throughput
  • Affidabilità
  • Tasso di cache hit
  • Qualità dei token
  • Prezzi e disponibilità del servizio

La piattaforma mira a ridurre la necessità per gli sviluppatori di creare account, gestire diversi formati API e confrontare manualmente i vari fornitori di servizi.

Gli utenti possono dare priorità a obiettivi specifici, come:

  • Ridurre i costi
  • Accelerare i tempi di risposta
  • Aumentare l'affidabilità
  • Migliorare la qualità dell'output

Se non viene specificata alcuna preferenza, AI Ping può utilizzare la sua logica di routing per selezionare un servizio disponibile.

Routing dinamico in caso di congestione del servizio

L'integrazione statica invia ogni richiesta allo stesso fornitore di servizi fino a quando lo sviluppatore non modifica la configurazione.

Il routing dinamico è diverso. Se un fornitore di servizi rallenta o diventa non disponibile, il livello di routing può indirizzare le richieste successive verso altri fornitori che in quel momento offrono prestazioni migliori.

Ciò è utile per i carichi di lavoro degli agenti, poiché un'interruzione può causare il fallimento di attività lunghe.

Il ciclo di feedback previsto dalla piattaforma è il seguente:

  1. AI Ping misura continuamente la qualità del servizio.
  2. Le decisioni di routing utilizzano i dati di misurazione più recenti.
  3. Il traffico utente reale fornisce ulteriori dati sulle prestazioni.
  4. I nuovi dati migliorano la valutazione e il routing futuri.

Qingcheng Zhìyùn afferma che l'API unificata consente ai team più piccoli di accedere a capacità di routing e monitoraggio che normalmente richiederebbero un team di piattaforma interno.

L'azienda ha riportato separatamente i miglioramenti medi in termini di costi, throughput e latenza ottenuti tramite AI Ping. Queste percentuali sono i risultati pubblicati dalla piattaforma; i risultati effettivi possono variare a seconda del modello selezionato, del fornitore di servizi, del modello di traffico e della strategia di routing.

Nodo applicativo: Negozio di agenti e ATM

L'ultimo livello si concentra su come gli agenti...

distribuiscano i loro Token e le regole di governance d'uso.

Il sistema è composto da due componenti principali:

  • Negozio di Agenti
  • ATM (Gestore Token Agente)

Negozio di Agenti

Il Negozio di Agenti è posizionato come un livello di distribuzione e riutilizzo per agenti generici e specifici del settore.

Il suo valore principale risiede nel collegare gli sviluppatori di agenti con le organizzazioni che necessitano di flussi di lavoro distribuibili, consentendo al contempo a questi agenti di accedere a un'infrastruttura di Token più ampia.

Il rapporto originale lo paragona a un mercato di elettrodomestici collegato a una rete elettrica condivisa. Al momento della redazione di questo documento, la documentazione pubblica sulla strategia di prezzo del Negozio di Agenti, sugli standard di revisione, sui formati di distribuzione e sui termini commerciali è ancora molto limitata.

ATM: Gestore Token Agente

ATM sta per Gestore Token Agente.

Qingcheng Technology lo ha presentato al WAIC 2026 come uno strumento di gestione e governance dei Token localizzato per sistemi multi-agente.

Questo strumento offre le seguenti funzionalità:

  • Gestione unificata delle credenziali API
  • Tracciamento dell'utilizzo dei Token
  • Contabilità della ripartizione dei costi
  • Controllo dei limiti di consumo
  • Cambio fornitore e ripristino da guasto
  • Isolamento delle risorse per più agenti
  • Avvisi di utilizzo anomalo
  • Monitoraggio localizzato/sensibile alla privacy

La documentazione originale indica che ATM può osservare l'attività degli agenti attraverso meccanismi come hook comportamentali, scansione di file locali e gateway per la privacy.

In pratica, ATM è simile a un "contatore elettrico" per i carichi di lavoro di IA. Il suo obiettivo è associare la fatturazione dei Token all'agente, all'operazione, al modello e allo strumento che hanno generato tale consumo.

Ciò è strettamente correlato al concetto di gestione dei costi del cloud (FinOps) – la disciplina di misurazione e controllo della spesa cloud. Nei sistemi di agenti, la sfida è più complessa, poiché un singolo processo aziendale può contenere più livelli di chiamate di modello annidate.

Una registrazione efficace dei costi degli agenti deve includere:

  1. Utente o flusso di lavoro iniziatore
  2. Agente e sotto-agenti coinvolti
  3. Modello selezionato
  4. Numero di token di input/output
  5. Strumenti chiamati nell'attività
  6. Prezzi del fornitore
  7. Numero di tentativi e chiamate fallite
  8. Costo totale e tempo impiegato

Qingcheng Technology posiziona ATM come un livello FinOps orientato ai Token per questo nuovo tipo di carico di lavoro.

Perché Qingcheng Technology sottolinea la neutralità

L'articolo originale afferma che la neutralità è uno dei punti di forza principali di Qingcheng Technology.

I grandi provider cloud e le aziende hardware sono naturalmente portati a promuovere le proprie piattaforme, partner o progetti di investimento. Pertanto, le organizzazioni che gestiscono cluster eterogenei preferiscono scegliere fornitori di software indipendenti che supportano più acceleratori concorrenti e fornitori di servizi.

Qingcheng Technology afferma che la sua piattaforma non è legata a un unico fornitore di chip.

Questo concetto si riflette nella capacità di Chitu di supportare diversi ambienti hardware e nel modello di routing multi-fornitore di AI Ping.

La neutralità deve ancora essere verificata nella pratica. I clienti dovrebbero esaminare i seguenti elementi:

  • Versioni hardware e software supportate
  • Regole di routing
  • Partnership commerciali
  • Metodologia di benchmarking
  • Politiche di conservazione dei dati
  • Opzioni di selezione del fornitore
  • Meccanismi di failover e fallback

Il background tecnico dell'azienda costituisce un altro vantaggio posizionale.

Qingcheng Technology è stata fondata nel dicembre 2023, con un team principale proveniente dall'Istituto di Calcolo ad Alte Prestazioni del Dipartimento di Informatica dell'Università di Tsinghua.

L'azienda afferma che il team ha precedentemente condotto valutazioni delle prestazioni e lavori di ottimizzazione per centri di supercalcolo e centri di calcolo intelligente.

Trasformare la potenza di calcolo nazionale in un servizio Token esportabile

Qingcheng AI considera anche il servizio Token come un percorso fattibile per far sì che la potenza di calcolo nazionale raggiunga utenti internazionali.

La logica è la seguente: lo sviluppatore non ha bisogno di sapere quale acceleratore ha generato la risposta. Lo sviluppatore acquista l'API del modello e ottiene i Token.

Se l'hardware nazionale può supportare modelli competitivi in modo stabile ed efficiente, allora i suoi output possono essere venduti tramite un'API unificata e i clienti esteri non devono distribuire o comprendere l'architettura hardware sottostante.

Qingcheng AI considera il servizio Token come un modo per distribuire la potenza di calcolo nazionale a livello globale.

Il rapporto originale indica che il picco di traffico degli sviluppatori internazionali si verifica solitamente tra le 22:00 e le 8:00 del giorno successivo, ora di Pechino.

Questo crea una potenziale opportunità di utilizzo. La potenza di calcolo inutilizzata durante le ore non di punta in Cina può essere impiegata per servire utenti in altri fusi orari.

Il flusso di lavoro descritto nell'articolo è:

  1. L'acceleratore nazionale genera token tramite Chitu.
  2. AI Ping misura la qualità del servizio e gestisce le richieste.
  3. I partner distribuiscono il servizio agli sviluppatori internazionali.
  4. Gli utenti utilizzano il modello tramite API standard.

Ciò non elimina i requisiti consueti per l'erogazione di servizi internazionali. I fornitori devono comunque gestire latenza, conformità, governance dei dati, licenze dei modelli, fatturazione, supporto tecnico e disponibilità regionale.

Preparare il terreno per l'economia degli agenti

Alle mostre di IA, i prodotti più visibili sono spesso modelli e applicazioni.

Le infrastrutture ricevono meno attenzione, poiché la maggior parte del loro lavoro avviene sotto l'interfaccia utente. Determinano se un modello può funzionare stabilmente, se un agente può completare un'attività e se i costi finali sono chiari e comprensibili.

Il concetto "negozio davanti, fabbrica dietro" di Qingcheng AI collega tre questioni:

  • Come produrre token in modo efficiente?
  • Come instradare i token in modo affidabile?
  • Come vengono consumati e gestiti i token dagli agenti?

La "fabbrica dietro" combina hardware, Chitu e Bagualu. Il "negozio davanti" utilizza AI Ping per valutare e instradare i servizi dei modelli. Il nodo applicativo utilizza Agent Store e ATM per distribuire gli agenti e gestire il loro consumo di token.

L'analogia con la rete elettrica non è uno standard tecnico, ma offre alle aziende una prospettiva pratica per comprendere l'architettura full-stack.

Questa architettura non considera ogni API di modello, cluster di acceleratori e agente come prodotti isolati, ma come componenti interconnessi nella catena di fornitura dei token.

Domande frequenti

Cos'è l'architettura "negozio davanti, fabbrica dietro" dei token di Qingcheng AI?

È un modello infrastrutturale a tre livelli per l'IA che copre produzione di token, routing API e applicazioni agent. La "fabbrica dietro" usa hardware di calcolo, Chitu e Bagualu; il livello intermedio usa AI Ping; il livello applicativo include Agent Store e ATM.

Cos'è il motore di inferenza Chitu?

Chitu è un framework open-source per l'inferenza di modelli di grandi dimensioni progettato per ambienti di produzione. Supporta varie piattaforme di acceleratori nazionali e internazionali, diverse scale di distribuzione, inferenza a bassa precisione e interfacce HTTP compatibili con OpenAI.

Interfacce.

Chitu ha ridotto del 75% i costi di distribuzione di tutti i modelli DeepSeek?

Non è stata pubblicata una promessa generica di riduzione del 75%. Il dato proviene da uno specifico scenario di distribuzione FP4, in cui il numero di server è passato da quattro a uno, con una riduzione del 75% del numero di macchine.

Chitu può essere distribuito tramite Docker?

Sì. Il repository ufficiale di Chitu fornisce Dockerfile per ambienti hardware come Ascend, Haiguang, MetaX e altri, con documentazione generale per installazione e distribuzione.

A cosa serve AI Ping?

AI Ping monitora e confronta i servizi API dei modelli, instradando le richieste in base a obiettivi di costo, velocità, affidabilità o qualità. Offre un'API unificata su più fornitori di servizi.

Cos'è Agent Token Manager?

Agent Token Manager (ATM) è uno strumento di gestione dei token progettato da Qingcheng AI per i sistemi di agenti. Traccia l'uso, ripartisce i costi, gestisce le credenziali, imposta limiti, isola i carichi di lavoro e invia avvisi ai team in caso di consumi anomali.

Bagualu è un motore di inferenza?

Bagualu è uno stack software più ampio, non solo un motore di inferenza. Copre formazione, distribuzione dell'inferenza, scheduling, monitoraggio, distribuzione di applicazioni e gestione dei cluster, mentre Chitu gestisce il livello di inferenza del modello.

Il risultato di "riduzione del 75% dei costi" è stato verificato in modo indipendente?

Il risultato è stato fornito da Qingcheng AI e dal rapporto originale. I dettagli specifici di distribuzione necessari per una replica indipendente non sono ancora stati completamente divulgati. Si consiglia ai lettori di testare sui propri modelli, hardware e carichi di lavoro.

Strumenti correlati

  • Chitu: Framework di inferenza open-source per modelli di grandi dimensioni e hardware eterogeneo, pensato per ambienti di produzione.
  • AI Ping: Piattaforma di valutazione dei servizi modello e routing API intelligente gestita da Qingcheng AI.
  • Bagualu: Stack software di Qingcheng AI per formazione, inferenza, distribuzione e gestione dei cluster di modelli.
  • vLLM: Motore open-source ampiamente utilizzato per il servizio di modelli di grandi dimensioni ad alta produttività.
  • SGLang: Framework di servizio open-source per modelli linguistici e multimodali.
  • DeepSeek: Piattaforma ufficiale della serie di modelli DeepSeek discussa nel caso di distribuzione.
  • Specifica API OpenAI: Formato API utilizzato dalla maggior parte dei motori di servizio dei modelli per la compatibilità delle applicazioni.

Link correlati

Stack software.

Riepilogo

Alla World AI Conference 2026, Qingcheng AI ha presentato un'infrastruttura di token a tre livelli progettata per collegare inferenza dei modelli, routing API, distribuzione degli agenti e gestione dei costi.

Il livello "fabbrica dietro" utilizza Chitu e Bagualu per ottimizzare la distribuzione dei modelli su hardware di calcolo eterogeneo. Secondo il rapporto aziendale, nella configurazione FP4 DeepSeek, il numero di macchine necessarie è passato da quattro a una, con una riduzione del 75% dei costi.

AI Ping costituisce il livello di routing intermedio, mentre Agent Store e ATM coprono la distribuzione degli agenti e la gestione finanziaria dei token. Ciascun prodotto contribuisce a rendere la fornitura di token più stabile e misurabile, senza dipendere da un unico fornitore di hardware o API.

Il concetto centrale è semplice: gli agenti AI non hanno bisogno solo di modelli — hanno bisogno di un livello infrastrutturale in grado di generare, instradare, misurare e controllare ogni token consumato.

Qingcheng.ai 在 WAIC 2026 构建代币“超级网格”,声称 DeepSeek 部署成本降低 75%