Guida al deployment di Qwen-AgentWorld: esegui localmente il modello linguistico del mondo aperto da 35B
Una guida pratica in italiano a Qwen-AgentWorld, il modello linguistico del mondo di Alibaba Qwen per agenti IA. Scopri la sua progettazione in sette domini, la pipeline di addestramento, i risultati di AgentWorldBench, i comandi di deployment con SGLang e vLLM, l’inferenza locale con Transformers, le chiamate API, il flusso di valutazione e le opzioni di fine-tuning.

Qwen-AgentWorld è un modello del mondo linguistico rilasciato dal team Qwen per simulare ambienti di agenti. Invece di limitarsi a rispondere alle domande come un normale modello di chat, è progettato per prevedere cosa restituirebbe un ambiente dopo che un agente ha eseguito un’azione.
Questo lo rende particolarmente rilevante per la ricerca sugli agenti IA, l’apprendimento per rinforzo simulato, la valutazione tramite benchmark e gli esperimenti locali relativi ad ambienti di terminale, ingegneria del software, ricerca, MCP, web, sistemi operativi e in stile Android.
Questo articolo è una versione leggermente riscritta e tradotta dell’articolo originale in cinese. La struttura, il flusso tecnico, i comandi, le tabelle e le idee principali sono stati mantenuti, mentre il linguaggio è stato adattato per una lettura più scorrevole in inglese e per la pubblicazione SEO.
Nota sulla fonte: L’articolo originale è stato pubblicato su CSDN e dichiara di seguire la licenza CC BY-SA 4.0. Fonte originale: Qwen-AgentWorld完整部署指南:免费开源,性能超GPT-5.4,5分钟跑起来. Nota di verifica: Le pagine ufficiali di Qwen confermano il rilascio pubblico dei pesi del modello
Qwen-AgentWorld-35B-A3Be diAgentWorldBench. Il modello più grandeQwen-AgentWorld-397B-A17Bè incluso nei risultati ufficiali dei benchmark, ma la pagina pubblica del modello e la release su GitHub rimandano principalmente ai pesi del modello 35B-A3B.
1. Contesto: perché abbiamo bisogno di un modello del mondo linguistico?
Negli ultimi due anni, gli agenti IA sono passati rapidamente da semplici assistenti conversazionali a strumenti in grado di operare su siti web, eseguire comandi da terminale, controllare app mobili e completare attività di ingegneria del software.
Ma addestrare un agente potente è costoso. Spesso richiede grandi volumi di interazione con ambienti reali, e questo crea diversi problemi pratici:
Costruire e mantenere gli ambienti è noioso.
La raccolta dei dati è lenta e difficile da scalare.
Gli ambienti reali comportano rischi, soprattutto quando si testano casi di errore o si introducono interruzioni controllate.
Un Language World Model, o LWM, è progettato per risolvere questo problema. L’idea è semplice ma potente: far sì che un modello svolga il ruolo dell’ambiente. Data un’azione dell’agente e la cronologia dell’interazione, il modello prevede il successivo stato dell’ambiente.
Con questa configurazione, gli agenti possono essere addestrati e valutati in simulazione invece di fare sempre affidamento su sistemi reali.
Il 24/06/2026, il team Qwen ha rilasciato Qwen-AgentWorld, un modello del mondo linguistico nativo che unifica sette domini di interazione degli agenti in un unico modello. È stato rilasciato anche il benchmark complementare, AgentWorldBench.
Risorse ufficiali:
GitHub: QwenLM/Qwen-AgentWorld
2. Idea centrale: cosa lo rende un modello del mondo “nativo”?
La parola nativo è importante in questo contesto. Qwen-AgentWorld non è semplicemente un LLM general-purpose adattato dopo l’addestramento per imitare un ambiente. Il suo obiettivo di modellazione del mondo è integrato nel processo di addestramento fin dall’inizio.
Dimensione di confronto | Approccio tradizionale | Qwen-AgentWorld |
Punto di partenza dell'addestramento | Fine-tuning di un LLM generico | Considerare la modellazione dell'ambiente come obiettivo fin dalla CPT |
Processo di addestramento | Di solito solo SFT o RL | CPT → SFT → RL |
Conoscenza dell'ambiente | Aggiunta tramite dati extra o adattamento | Interiorizzata durante l'addestramento |
Uno o pochi domini | Sette domini in un unico modello |
In altre parole, Qwen-AgentWorld non è semplicemente un modello generale avvolto da prompt. È addestrato fin dagli strati inferiori della pipeline per prevedere lo stato successivo di un ambiente.
Questo conferisce al modello una comprensione più strutturata delle dinamiche dell’ambiente, soprattutto quando simula lunghe traiettorie di interazione.
3. Sette domini: ambienti testuali e GUI in un unico modello
Qwen-AgentWorld suddivide gli scenari di interazione degli agenti in due grandi gruppi: ambienti basati su testo e ambienti basati su GUI.
┌──────────────────────────────────────────┐
│ Qwen-AgentWorld │
│ │
│ Ambienti testuali Ambienti GUI │
│ ┌──────────┐ ┌──────────────────┐ │
│ │ MCP │ │ Web │ │
│ │ Ricerca │ │ OS │ │
│ │ Terminale│ │ Android │ │
│ │ SWE │ └──────────────────┘ │
│ └──────────┘ │
└──────────────────────────────────────────┘Dominio | Tipo | Descrizione |
MCP | Testo | Chiamata degli strumenti e interazioni con il Model Context Protocol |
Ricerca | Testo | Interazione con il motore di ricerca e comportamento di recupero |
Terminale | Testo | Esecuzione di comandi nel terminale Linux |
SWE | Testo | Attività di ingegneria del software, come correzioni del codice |
Web | GUI | Interazione con browser e pagine web |
OS | GUI | Interazione con il sistema operativo desktop |
Android | GUI | Interazione con app mobili e interfacce utente in stile Android |
Per i tre domini GUI, le osservazioni sono rappresentate come codice renderizzabile anziché come frame di pixel grezzi. Questo consente a un modello del mondo basato su testo di coprire ambienti visivi senza elaborare direttamente sequenze complete di immagini.
Il modello è stato addestrato su oltre 10 milioni di traiettorie di interazione reali nei sette domini.
4. Pipeline di addestramento in tre fasi
Qwen-AgentWorld utilizza una pipeline di addestramento collegata in tre fasi: CPT → SFT → RL.
Fase 1: CPT — Iniezione della conoscenza dell’ambiente
Durante il pre-addestramento continuo, il modello apprende da traiettorie di interazione con ambienti reali su larga scala. Questa fase incorpora le dinamiche dell’ambiente nei pesi del modello.
L’articolo originale menziona anche una maschera di perdita informativo-teorica a livello di turno. L’obiettivo è identificare quali turni di dialogo trasportano effettivamente informazioni sullo stato dell’ambiente e ridurre il rumore dei turni meno utili.
Fase 2: SFT — Attivazione del ragionamento chain-of-thought
Il fine-tuning supervisionato trasforma la previsione dello stato successivo in uno schema di ragionamento in stile chain-of-thought.
Invece di produrre direttamente un risultato previsto, il modello impara a ragionare sul perché uno stato dovrebbe cambiare prima di generare l’osservazione successiva.
Fase 3: RL — Perfezionamento della fedeltà della simulazione
La fase di apprendimento per rinforzo utilizza segnali di ricompensa ibridi, incluso l’algoritmo GSPO, per migliorare la qualità dell’output.
L’ottimizzazione si concentra su:
Correttezza del formato
Accuratezza fattuale
Coerenza del contesto
Realismo
Qualità complessiva della simulazione
Comportamenti emergenti menzionati nell’articolo originale: Qwen-AgentWorld mostra, secondo quanto riportato, comportamenti di autocorrezione, prevenzione della fuga di informazioni negli scenari di ricerca e ragionamento causale multi-step per alcune previsioni di output dei comandi.
5. Elenco dei modelli open source
Versione | Parametri | Parametri attivati | Lunghezza del contesto | Posizionamento |
Qwen-AgentWorld-35B-A3B | 35B | 3B | 256K token | Modello aperto pubblico ed efficiente |
Qwen-AgentWorld-397B-A17B | 397B | 17B | Non indicato chiaramente nella tabella originale | Modello benchmark di punta |
AgentWorldBench | — | — | — | Benchmark di valutazione |
Dettagli dell’architettura 35B-A3B
Modello base: Qwen3.5-35B-A3B-Base
Tipo di modello: modello linguistico causale / modello del mondo linguistico
Stile architetturale: attenzione lineare ibrida + MoE
Dimensione nascosta: 2048
Layer: 40 layer
Layout dei layer: gruppi ripetuti con componenti Gated DeltaNet, Gated Attention e MoE
Esperti: 256 esperti
Esperti attivati: 8 esperti instradati + 1 esperto condiviso
Lunghezza del contesto: 262.144 token
Contesto minimo consigliato: 128K token per una migliore qualità della simulazione di traiettorie lunghe
La documentazione ufficiale di Hugging Face rileva inoltre che il modello è compatibile con Transformers, vLLM e SGLang.
6. Confronto delle prestazioni: risultati di AgentWorldBench
AgentWorldBench valuta ciascun modello in cinque dimensioni: Formato, Fattualità, Coerenza, Realismo e Qualità. I punteggi sono normalizzati su una scala da 0 a 100, dove un valore più alto è migliore.
Classifica completa per punteggio complessivo
Modello | MCP | Ricerca | Terminale | SWE | Android | Web | SO | Complessivo |
Qwen-AgentWorld-397B-A17B | 68.24 | 37.82 | 57.73 | 68.49 | 60.20 | 50.98 | 67.89 | 58.71 |
GPT-5.4 | 70.10 | 37.26 | 53.69 | 66.29 | 60.00 | 51.80 | 68.58 | 58.25 |
Claude Opus 4.6 | 69.90 | 29.30 | 57.51 | 64.55 | 61.74 | 51.42 | 70.20 | 57.80 |
Claude Opus 4.8 | 54.93 | 35.14 | 59.18 | 64.10 | 61.50 | 54.66 | 66.62 | 56.59 |
Qwen-AgentWorld-35B-A3B | 64.79 | 36.69 | 53.96 | 65.63 | 58.17 | 49.55 | 65.92 | 56.39 |
Claude Sonnet 4.6 | 70.00 | 28.79 | 56.98 | 64.52 | 58.03 | 50.78 | 63.17 | 56.04 |
Qwen3.5-397B-A17B | 68.31 | 30.81 | 55.30 | 64.44 | 54.90 | 48.55 | 54.74 | |
Gemini 3.1 Pro | 59.07 | 30.21 | 52.47 | 59.07 | 61.40 | 52.83 | 66.92 | 54.57 |
DeepSeek-V4-Pro | 63.27 | 27.61 | 51.26 | 59.44 | 55.17 | 50.32 | 63.70 | 52.97 |
Qwen3.5-35B-A3B | 57.87 | 25.98 | 46.13 | 47.58 | 53.18 | 47.10 | 56.27 | 47.73 |
Punti chiave dell'articolo originale:
Qwen-AgentWorld-397B-A17Braggiunge un punteggio complessivo di 58.71 e si classifica al primo posto nella tabella AgentWorldBench elencata.Qwen-AgentWorld-35B-A3Bmigliora di +8.66 punti rispetto al modello di baseQwen3.5-35B-A3B.
Nota pratica: Considera i numeri dei benchmark come dati di riferimento provenienti dalla configurazione ufficiale del benchmark. I risultati reali dipenderanno dall'hardware, dalla progettazione dei prompt, dal framework di serving, dalla lunghezza del contesto e dall'ambiente simulato.
7. Quattro pattern applicativi e risultati sperimentali
Pattern 1: espansione generalizzabile di ambienti OOD
L'articolo originale descrive l'uso di Qwen-AgentWorld-397B-A17B per l'apprendimento per rinforzo simulato in 4.000 ambienti OpenClaw fuori distribuzione, seguito dalla verifica della generalizzazione zero-shot in nuovi domini.
Metodo di addestramento | Claw-Eval | QwenClawBench |
SFT di base | 65.4 | 47.9 |
RL simulato con un simulatore di modello generale | 66.7 | 47.8 |
RL simulato con il simulatore Qwen-AgentWorld | 69.7 | 55.0 |
Miglioramento | +4.3 | +7.1 |
Schema 2: Simulazione controllabile — Perturbazione mirata MCP
Le perturbazioni controllate possono mettere in luce i punti deboli di un agente in modo più efficace rispetto all’addestramento standard in ambiente reale.
Configurazione | Tool Decathlon | MCPMark |
SFT di base | 32.4 | 21.5 |
Sim RL senza controllo | 31.5 | 24.6 |
Sim RL con controllo | 36.1 | 33.8 |
Miglioramento | +3.7 | +12.3 |
Schema 3: Costruzione di un mondo fittizio — Dominio di ricerca
L’esperimento nel dominio di ricerca utilizza per l’addestramento un mondo di ricerca fittizio ma coerente internamente, quindi valuta la generalizzazione su compiti di ricerca reali.
Configurazione | WideSearch F1 Item | WideSearch F1 Row |
SFT di base, 35B | 34.02 | 13.72 |
+ mondo fittizio Sim RL | 50.31 | 24.21 |
Miglioramento | +16.29 | +10.49 |
Schema 4: Modello fondamentale per agenti — Trasferimento del riscaldamento RL LWM
L'articolo descrive inoltre il warm-up RL di LWM come un modo per migliorare le prestazioni degli agenti downstream senza ulteriore fine-tuning RL su quei compiti specifici.
Metrica | Terminal-Bench 2.0 | SWE-Bench Verified | SWE-Bench Pro | WideSearch F1 | Claw-Eval | BFCL v4 |
SFT di base | 33.25 | 64.47 | 42.18 | 33.38 | 53.60 | 62.29 |
+ riscaldamento LWM RL | 39.55 | 67.86 | 47.42 | 46.17 | 64.88 | 71.25 |
Miglioramento | +6.30 | +3.39 | +5.24 | +12.79 | +11.28 | +8.96 |
In evidenza: I dati di riscaldamento provengono da traiettorie a turno singolo e non agentiche, eppure il miglioramento si trasferisce a compiti agentici più complessi di chiamata di strumenti multi-turno. Ciò suggerisce che la conoscenza di modellazione del mondo può trasferirsi oltre il suo formato di addestramento originale.
8. Guida rapida alla distribuzione
Metodo 1: Distribuire con SGLang
SGLang è consigliato nell'articolo originale per un serving rapido.
pip install sglangpython -m sglang.launch_server \
--model-path Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tp-size 4 \
--context-length 262144 \
--reasoning-parser qwen3Dopo l'avvio, l'endpoint API compatibile con OpenAI è:
http://localhost:8000/v1Metodo 2: Distribuire con vLLM
pip install vllmvllm serve Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--trust-remote-codeNota della documentazione ufficiale: L'attuale scheda del modello su Hugging Face consiglia anche di usare
--language-model-onlycon vLLM perché l'architettura del modello include definizioni di componenti visive mentre il checkpoint contiene i pesi del modello linguistico. Se l'inizializzazione di vLLM non riesce, prova ad aggiungere questo flag.
vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
--port 8000 \
--tensor-parallel-size 4 \
--max-model-len 262144 \
--reasoning-parser qwen3 \
--language-model-only \
--trust-remote-codeMetodo 3: Inferenza locale con Transformers
from transformers import AutoModelForCausalLM, AutoTokenizer
model_name = "Qwen/Qwen-AgentWorld-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
model_name,
torch_dtype="auto",
device_map="auto",
)
# Esempio nel dominio del terminale: chiedi al modello di prevedere l'output del comando.
messages = [
{
"role": "system",
"content": "Sei un modello linguistico del mondo che simula un ambiente terminale Linux. "
"Dato il comando dell'utente, prevedi l'output del terminale."
},
{
"role": "user",
"content": "Azione: execute_bash\nComando: ls -la /home/user/project/"
}
]
text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.6)
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)
print(response)Metodo 4: chiamata tramite un'API compatibile con OpenAI
Questo metodo funziona dopo aver servito il modello tramite SGLang o vLLM.
from openai import OpenAI
client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")
messages = [
{
"role": "system",
"content": "Sei un modello linguistico del mondo che simula un ambiente terminale Linux."
},
{
"role": "user",
"content": "Azione: execute_bash\nComando: pwd"
}
]
response = client.chat.completions.create(
model="Qwen/Qwen-AgentWorld-35B-A3B",
messages=messages,
max_tokens=32768,
temperature=0.6,
)
print(response.choices[0].message.content)Buone pratiche
Campionamento consigliato:
temperature=0.6,top_p=0.95,top_k=20
Lunghezza di output consigliata: circa 32,768 token per la maggior parte delle osservazioni lunghe
Usa i prompt di sistema specifici per dominio dalla directory
prompts/del repository per una migliore qualità della simulazioneMantieni la lunghezza del contesto ad almeno
128Kquando possibile; il contesto predefinito del modello è256K
9. Flusso di lavoro di valutazione di AgentWorldBench
Se vuoi testare il tuo modello del mondo su AgentWorldBench, l’articolo originale propone un flusso di lavoro in tre passaggi.
# 1. Clona il repository di valutazione
git clone https://github.com/QwenLM/Qwen-AgentWorld.git
cd Qwen-AgentWorld
# 2. Scarica il dataset di valutazione
huggingface-cli download Qwen/AgentWorldBench --repo-type dataset --local-dir ./AgentWorldBench
# 3. Installa le dipendenze
pip install openai
cd eval
# Passaggio 1: inferenza del modello del mondo
python eval.py infer \
--data-dir ../AgentWorldBench \
--model-base-url http://localhost:8000/v1 \
--model-name Qwen/Qwen-AgentWorld-35B-A3B \
--output-dir ./results
# Passaggio 2: valutazione tramite giudice LLM. Richiede una chiave API OpenAI.
export OPENAI_API_KEY="your-api-key"
python eval.py judge \
--predictions ./results/predictions.jsonl \
--judge-base-url https://api.openai.com/v1 \
--judge-model gpt-5.2-2025-12-11 \
--output-dir ./results
# Passaggio 3: aggrega i punteggi
python eval.py score --predictions ./results/judged.jsonlOgni campione di test include dati di osservazione di riferimento ottenuti dall’esecuzione in un ambiente reale. Il benchmark valuta la capacità di modellazione del mondo in termini di formato, factualità, coerenza, realismo e qualità.
10. Suggerimenti per il fine-tuning
Se desideri personalizzare Qwen-AgentWorld per un dominio specifico, l'articolo originale consiglia tre framework comuni per il fine-tuning.
Framework | Punto di forza | Scenario adatto |
Elevata integrazione con ModelScope | Esperimenti rapidi e flussi di lavoro nell’ecosistema Alibaba | |
Community attiva e ampio supporto alle strategie di training | Implementazione ingegneristica pratica | |
Forte ottimizzazione della memoria | Fine-tuning con risorse limitate |
11. Note sulle fonti e gestione delle immagini
L’articolo originale include diverse immagini relative ai domini di Qwen-AgentWorld e ai risultati dei benchmark. Queste sono state mantenute nelle sezioni pertinenti.
Le icone della piattaforma CSDN, i moduli promozionali, i blocchi di abbonamento all’autore, i codici QR, i pulsanti di ricompensa e le immagini di raccomandazione non correlate sono stati rimossi in base ai requisiti di pubblicazione.
FAQ
Che cos’è Qwen-AgentWorld?
Qwen-AgentWorld è un modello linguistico del mondo sviluppato dal team Qwen. Prevede il prossimo stato dell’ambiente dopo che un agente compie un’azione, rendendolo utile per la simulazione, l’addestramento e la valutazione degli agenti.
Qwen-AgentWorld è uguale a un normale modello di chat?
No. Un normale modello di chat è ottimizzato principalmente per la conversazione e l’esecuzione di istruzioni. Qwen-AgentWorld è addestrato come simulatore di ambienti, quindi il suo principale caso d’uso è prevedere le osservazioni negli ambienti di interazione degli agenti.
Quale modello Qwen-AgentWorld è disponibile pubblicamente?
Le pagine ufficiali indicano Qwen-AgentWorld-35B-A3B come peso del modello rilasciato pubblicamente. Anche AgentWorldBench è disponibile come benchmark di valutazione. Il modello più grande da 397B compare nelle tabelle dei benchmark, ma il rilascio pubblico del modello rimanda principalmente alla versione 35B-A3B.
Qwen-AgentWorld può essere distribuito con vLLM?
Sì. La scheda del modello su Hugging Face include un esempio di serving con vLLM. Se riscontri problemi di inizializzazione, la scheda ufficiale del modello consiglia di aggiungere --language-model-only perché il checkpoint contiene i pesi del modello linguistico.
Qwen-AgentWorld può essere distribuito con SGLang?
Sì. SGLang è una delle opzioni di serving consigliate e può esporre un endpoint API compatibile con OpenAI. Il modello può quindi essere richiamato tramite richieste API locali.
Perché Qwen-AgentWorld ha bisogno di una finestra di contesto lunga?
La simulazione degli ambienti degli agenti dipende spesso da lunghe cronologie di interazione. Una finestra di contesto più breve può perdere informazioni di stato importanti, quindi le linee guida ufficiali consigliano di mantenere almeno 128K token quando possibile.
A cosa serve AgentWorldBench?
AgentWorldBench è il benchmark rilasciato con Qwen-AgentWorld. Valuta i modelli linguistici del mondo in sette domini usando dimensioni quali formato, accuratezza fattuale, coerenza, realismo e qualità.
Qwen-AgentWorld è adatto all’uso in produzione?
Può essere utile per ricerca, valutazione, simulazione ed esperimenti interni. Per i sistemi in produzione, è comunque necessario valutare latenza, costo dell’hardware, sicurezza, affidabilità dei prompt e se i risultati simulati corrispondono abbastanza fedelmente al tuo ambiente reale.
Strumenti correlati
Qwen-AgentWorld GitHub: Repository ufficiale per il codice, i prompt e il flusso di lavoro di valutazione di Qwen-AgentWorld.
Qwen-AgentWorld-35B-A3B su Hugging Face: Pagina ufficiale del modello per i pesi pubblici 35B-A3B.
AgentWorldBench: Dataset di benchmark ufficiale per valutare i modelli linguistici del mondo.
SGLang: Un framework di serving rapido per modelli linguistici di grandi dimensioni.
vLLM: Un motore di inferenza ad alto throughput per il serving di LLM.
Transformers: Libreria di Hugging Face per il caricamento e l’inferenza di modelli in locale.
OpenAI Python SDK: Client Python in grado di chiamare server di modelli locali compatibili con OpenAI.
ms-swift: il framework di addestramento e fine-tuning di ModelScope per i flussi di lavoro LLM.
Link correlati
Rapporto tecnico Qwen-AgentWorld: il paper ufficiale su arXiv che introduce il modello, il benchmark e la configurazione di addestramento.
Blog ufficiale Qwen-AgentWorld: il post ufficiale di rilascio del progetto da parte di Qwen.
Repository GitHub di Qwen-AgentWorld: fonte principale per prompt, script di valutazione e documentazione del progetto.
Scheda del modello Qwen-AgentWorld-35B-A3B: pagina ufficiale di Hugging Face con esempi di distribuzione e inferenza.
Dataset AgentWorldBench: dataset di benchmark ufficiale utilizzato per la valutazione del modello.
Documentazione SGLang: documentazione per servire LLM con SGLang.
Documentazione vLLM: documentazione per l’inferenza LLM ad alto throughput e il serving compatibile con OpenAI.
LLaMA-Factory: Framework open source popolare per esperimenti di fine-tuning e distribuzione di LLM.