Guida al deployment di Qwen-AgentWorld: esegui localmente il modello linguistico del mondo aperto da 35B

Una guida pratica in italiano a Qwen-AgentWorld, il modello linguistico del mondo di Alibaba Qwen per agenti IA. Scopri la sua progettazione in sette domini, la pipeline di addestramento, i risultati di AgentWorldBench, i comandi di deployment con SGLang e vLLM, l’inferenza locale con Transformers, le chiamate API, il flusso di valutazione e le opzioni di fine-tuning.

发布于 2026年7月5日generalGEO 评分: 5510 次阅读
Qwen-AgentWorldDistribuzione di Qwen AgentWorldmodello del mondo linguisticosimulatore di agenti IAAgentWorldBenchQwen 35B A3BSGLang Qwen AgentWorldvLLM Qwen AgentWorldinferenza locale con Transformersmodello del mondo linguistico Qwensimulazione dell'ambiente degli agentiagente MCPbenchmark per agenti SWEaddestramento di agenti IA
Una copertina pulita in formato 16:9 per un blog tech, con sfondo scuro di infrastruttura IA, un nodo centrale Qwen-AgentWorld, sette domini di agenti collegati e un piccolo pannello terminale di deployment. Minimale, moderna e incentrata sulla simulazione di agenti IA.

Qwen-AgentWorld è un modello del mondo linguistico rilasciato dal team Qwen per simulare ambienti di agenti. Invece di limitarsi a rispondere alle domande come un normale modello di chat, è progettato per prevedere cosa restituirebbe un ambiente dopo che un agente ha eseguito un’azione.

Questo lo rende particolarmente rilevante per la ricerca sugli agenti IA, l’apprendimento per rinforzo simulato, la valutazione tramite benchmark e gli esperimenti locali relativi ad ambienti di terminale, ingegneria del software, ricerca, MCP, web, sistemi operativi e in stile Android.

Questo articolo è una versione leggermente riscritta e tradotta dell’articolo originale in cinese. La struttura, il flusso tecnico, i comandi, le tabelle e le idee principali sono stati mantenuti, mentre il linguaggio è stato adattato per una lettura più scorrevole in inglese e per la pubblicazione SEO.

Nota sulla fonte: L’articolo originale è stato pubblicato su CSDN e dichiara di seguire la licenza CC BY-SA 4.0. Fonte originale: Qwen-AgentWorld完整部署指南:免费开源,性能超GPT-5.4,5分钟跑起来. Nota di verifica: Le pagine ufficiali di Qwen confermano il rilascio pubblico dei pesi del modello Qwen-AgentWorld-35B-A3B e di AgentWorldBench. Il modello più grande Qwen-AgentWorld-397B-A17B è incluso nei risultati ufficiali dei benchmark, ma la pagina pubblica del modello e la release su GitHub rimandano principalmente ai pesi del modello 35B-A3B.


1. Contesto: perché abbiamo bisogno di un modello del mondo linguistico?

Negli ultimi due anni, gli agenti IA sono passati rapidamente da semplici assistenti conversazionali a strumenti in grado di operare su siti web, eseguire comandi da terminale, controllare app mobili e completare attività di ingegneria del software.

Ma addestrare un agente potente è costoso. Spesso richiede grandi volumi di interazione con ambienti reali, e questo crea diversi problemi pratici:

  • Costruire e mantenere gli ambienti è noioso.

  • La raccolta dei dati è lenta e difficile da scalare.

  • Gli ambienti reali comportano rischi, soprattutto quando si testano casi di errore o si introducono interruzioni controllate.

Un Language World Model, o LWM, è progettato per risolvere questo problema. L’idea è semplice ma potente: far sì che un modello svolga il ruolo dell’ambiente. Data un’azione dell’agente e la cronologia dell’interazione, il modello prevede il successivo stato dell’ambiente.

Con questa configurazione, gli agenti possono essere addestrati e valutati in simulazione invece di fare sempre affidamento su sistemi reali.

Il 24/06/2026, il team Qwen ha rilasciato Qwen-AgentWorld, un modello del mondo linguistico nativo che unifica sette domini di interazione degli agenti in un unico modello. È stato rilasciato anche il benchmark complementare, AgentWorldBench.

Risorse ufficiali:

GitHub: QwenLM/Qwen-AgentWorld


2. Idea centrale: cosa lo rende un modello del mondo “nativo”?

La parola nativo è importante in questo contesto. Qwen-AgentWorld non è semplicemente un LLM general-purpose adattato dopo l’addestramento per imitare un ambiente. Il suo obiettivo di modellazione del mondo è integrato nel processo di addestramento fin dall’inizio.

Dimensione di confronto

Approccio tradizionale

Qwen-AgentWorld

Punto di partenza dell'addestramento

Fine-tuning di un LLM generico

Considerare la modellazione dell'ambiente come obiettivo fin dalla CPT

Processo di addestramento

Di solito solo SFT o RL

CPT → SFT → RL

Conoscenza dell'ambiente

Aggiunta tramite dati extra o adattamento

Interiorizzata durante l'addestramento

Uno o pochi domini

Sette domini in un unico modello

In altre parole, Qwen-AgentWorld non è semplicemente un modello generale avvolto da prompt. È addestrato fin dagli strati inferiori della pipeline per prevedere lo stato successivo di un ambiente.

Questo conferisce al modello una comprensione più strutturata delle dinamiche dell’ambiente, soprattutto quando simula lunghe traiettorie di interazione.


3. Sette domini: ambienti testuali e GUI in un unico modello

Qwen-AgentWorld suddivide gli scenari di interazione degli agenti in due grandi gruppi: ambienti basati su testo e ambienti basati su GUI.

┌──────────────────────────────────────────┐
│             Qwen-AgentWorld              │
│                                          │
│  Ambienti testuali    Ambienti GUI       │
│  ┌──────────┐       ┌──────────────────┐ │
│  │  MCP     │       │  Web             │ │
│  │  Ricerca │       │  OS              │ │
│  │  Terminale│      │  Android         │ │
│  │  SWE     │       └──────────────────┘ │
│  └──────────┘                            │
└──────────────────────────────────────────┘

Dominio

Tipo

Descrizione

MCP

Testo

Chiamata degli strumenti e interazioni con il Model Context Protocol

Ricerca

Testo

Interazione con il motore di ricerca e comportamento di recupero

Terminale

Testo

Esecuzione di comandi nel terminale Linux

SWE

Testo

Attività di ingegneria del software, come correzioni del codice

Web

GUI

Interazione con browser e pagine web

OS

GUI

Interazione con il sistema operativo desktop

Android

GUI

Interazione con app mobili e interfacce utente in stile Android

Per i tre domini GUI, le osservazioni sono rappresentate come codice renderizzabile anziché come frame di pixel grezzi. Questo consente a un modello del mondo basato su testo di coprire ambienti visivi senza elaborare direttamente sequenze complete di immagini.

Il modello è stato addestrato su oltre 10 milioni di traiettorie di interazione reali nei sette domini.


4. Pipeline di addestramento in tre fasi

Qwen-AgentWorld utilizza una pipeline di addestramento collegata in tre fasi: CPT → SFT → RL.

Fase 1: CPT — Iniezione della conoscenza dell’ambiente

Durante il pre-addestramento continuo, il modello apprende da traiettorie di interazione con ambienti reali su larga scala. Questa fase incorpora le dinamiche dell’ambiente nei pesi del modello.

L’articolo originale menziona anche una maschera di perdita informativo-teorica a livello di turno. L’obiettivo è identificare quali turni di dialogo trasportano effettivamente informazioni sullo stato dell’ambiente e ridurre il rumore dei turni meno utili.

Fase 2: SFT — Attivazione del ragionamento chain-of-thought

Il fine-tuning supervisionato trasforma la previsione dello stato successivo in uno schema di ragionamento in stile chain-of-thought.

Invece di produrre direttamente un risultato previsto, il modello impara a ragionare sul perché uno stato dovrebbe cambiare prima di generare l’osservazione successiva.

Fase 3: RL — Perfezionamento della fedeltà della simulazione

La fase di apprendimento per rinforzo utilizza segnali di ricompensa ibridi, incluso l’algoritmo GSPO, per migliorare la qualità dell’output.

L’ottimizzazione si concentra su:

  • Correttezza del formato

  • Accuratezza fattuale

Coerenza del contesto

Realismo

Qualità complessiva della simulazione

Comportamenti emergenti menzionati nell’articolo originale: Qwen-AgentWorld mostra, secondo quanto riportato, comportamenti di autocorrezione, prevenzione della fuga di informazioni negli scenari di ricerca e ragionamento causale multi-step per alcune previsioni di output dei comandi.


5. Elenco dei modelli open source

Versione

Parametri

Parametri attivati

Lunghezza del contesto

Posizionamento

Qwen-AgentWorld-35B-A3B

35B

3B

256K token

Modello aperto pubblico ed efficiente

Qwen-AgentWorld-397B-A17B

397B

17B

Non indicato chiaramente nella tabella originale

Modello benchmark di punta

AgentWorldBench

Benchmark di valutazione

Dettagli dell’architettura 35B-A3B

  • Modello base: Qwen3.5-35B-A3B-Base

  • Tipo di modello: modello linguistico causale / modello del mondo linguistico

  • Stile architetturale: attenzione lineare ibrida + MoE

  • Dimensione nascosta: 2048

  • Layer: 40 layer

  • Layout dei layer: gruppi ripetuti con componenti Gated DeltaNet, Gated Attention e MoE

  • Esperti: 256 esperti

Esperti attivati: 8 esperti instradati + 1 esperto condiviso

Lunghezza del contesto: 262.144 token

  • Contesto minimo consigliato: 128K token per una migliore qualità della simulazione di traiettorie lunghe

La documentazione ufficiale di Hugging Face rileva inoltre che il modello è compatibile con Transformers, vLLM e SGLang.


6. Confronto delle prestazioni: risultati di AgentWorldBench

AgentWorldBench valuta ciascun modello in cinque dimensioni: Formato, Fattualità, Coerenza, Realismo e Qualità. I punteggi sono normalizzati su una scala da 0 a 100, dove un valore più alto è migliore.

Classifica completa per punteggio complessivo

60.85

Modello

MCP

Ricerca

Terminale

SWE

Android

Web

SO

Complessivo

Qwen-AgentWorld-397B-A17B

68.24

37.82

57.73

68.49

60.20

50.98

67.89

58.71

GPT-5.4

70.10

37.26

53.69

66.29

60.00

51.80

68.58

58.25

Claude Opus 4.6

69.90

29.30

57.51

64.55

61.74

51.42

70.20

57.80

Claude Opus 4.8

54.93

35.14

59.18

64.10

61.50

54.66

66.62

56.59

Qwen-AgentWorld-35B-A3B

64.79

36.69

53.96

65.63

58.17

49.55

65.92

56.39

Claude Sonnet 4.6

70.00

28.79

56.98

64.52

58.03

50.78

63.17

56.04

Qwen3.5-397B-A17B

68.31

30.81

55.30

64.44

54.90

48.55

54.74

Gemini 3.1 Pro

59.07

30.21

52.47

59.07

61.40

52.83

66.92

54.57

DeepSeek-V4-Pro

63.27

27.61

51.26

59.44

55.17

50.32

63.70

52.97

Qwen3.5-35B-A3B

57.87

25.98

46.13

47.58

53.18

47.10

56.27

47.73

Punti chiave dell'articolo originale:

  • Qwen-AgentWorld-397B-A17B raggiunge un punteggio complessivo di 58.71 e si classifica al primo posto nella tabella AgentWorldBench elencata.

  • Qwen-AgentWorld-35B-A3B migliora di +8.66 punti rispetto al modello di base Qwen3.5-35B-A3B.

Nota pratica: Considera i numeri dei benchmark come dati di riferimento provenienti dalla configurazione ufficiale del benchmark. I risultati reali dipenderanno dall'hardware, dalla progettazione dei prompt, dal framework di serving, dalla lunghezza del contesto e dall'ambiente simulato.


7. Quattro pattern applicativi e risultati sperimentali

Pattern 1: espansione generalizzabile di ambienti OOD

L'articolo originale descrive l'uso di Qwen-AgentWorld-397B-A17B per l'apprendimento per rinforzo simulato in 4.000 ambienti OpenClaw fuori distribuzione, seguito dalla verifica della generalizzazione zero-shot in nuovi domini.

Metodo di addestramento

Claw-Eval

QwenClawBench

SFT di base

65.4

47.9

RL simulato con un simulatore di modello generale

66.7

47.8

RL simulato con il simulatore Qwen-AgentWorld

69.7

55.0

Miglioramento

+4.3

+7.1

Schema 2: Simulazione controllabile — Perturbazione mirata MCP

Le perturbazioni controllate possono mettere in luce i punti deboli di un agente in modo più efficace rispetto all’addestramento standard in ambiente reale.

Configurazione

Tool Decathlon

MCPMark

SFT di base

32.4

21.5

Sim RL senza controllo

31.5

24.6

Sim RL con controllo

36.1

33.8

Miglioramento

+3.7

+12.3

Schema 3: Costruzione di un mondo fittizio — Dominio di ricerca

L’esperimento nel dominio di ricerca utilizza per l’addestramento un mondo di ricerca fittizio ma coerente internamente, quindi valuta la generalizzazione su compiti di ricerca reali.

Configurazione

WideSearch F1 Item

WideSearch F1 Row

SFT di base, 35B

34.02

13.72

+ mondo fittizio Sim RL

50.31

24.21

Miglioramento

+16.29

+10.49

Schema 4: Modello fondamentale per agenti — Trasferimento del riscaldamento RL LWM

L'articolo descrive inoltre il warm-up RL di LWM come un modo per migliorare le prestazioni degli agenti downstream senza ulteriore fine-tuning RL su quei compiti specifici.

Metrica

Terminal-Bench 2.0

SWE-Bench Verified

SWE-Bench Pro

WideSearch F1

Claw-Eval

BFCL v4

SFT di base

33.25

64.47

42.18

33.38

53.60

62.29

+ riscaldamento LWM RL

39.55

67.86

47.42

46.17

64.88

71.25

Miglioramento

+6.30

+3.39

+5.24

+12.79

+11.28

+8.96

In evidenza: I dati di riscaldamento provengono da traiettorie a turno singolo e non agentiche, eppure il miglioramento si trasferisce a compiti agentici più complessi di chiamata di strumenti multi-turno. Ciò suggerisce che la conoscenza di modellazione del mondo può trasferirsi oltre il suo formato di addestramento originale.


8. Guida rapida alla distribuzione

Metodo 1: Distribuire con SGLang

SGLang è consigliato nell'articolo originale per un serving rapido.

pip install sglang
python -m sglang.launch_server \
    --model-path Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tp-size 4 \
    --context-length 262144 \
    --reasoning-parser qwen3

Dopo l'avvio, l'endpoint API compatibile con OpenAI è:

http://localhost:8000/v1

Metodo 2: Distribuire con vLLM

pip install vllm
vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --trust-remote-code

Nota della documentazione ufficiale: L'attuale scheda del modello su Hugging Face consiglia anche di usare --language-model-only con vLLM perché l'architettura del modello include definizioni di componenti visive mentre il checkpoint contiene i pesi del modello linguistico. Se l'inizializzazione di vLLM non riesce, prova ad aggiungere questo flag.

vllm serve Qwen/Qwen-AgentWorld-35B-A3B \
    --port 8000 \
    --tensor-parallel-size 4 \
    --max-model-len 262144 \
    --reasoning-parser qwen3 \
    --language-model-only \
    --trust-remote-code

Metodo 3: Inferenza locale con Transformers

from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen-AgentWorld-35B-A3B"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype="auto",
    device_map="auto",
)

# Esempio nel dominio del terminale: chiedi al modello di prevedere l'output del comando.
messages = [
    {
        "role": "system",
        "content": "Sei un modello linguistico del mondo che simula un ambiente terminale Linux. "
                   "Dato il comando dell'utente, prevedi l'output del terminale."
    },
    {
        "role": "user",
        "content": "Azione: execute_bash\nComando: ls -la /home/user/project/"
    }
]

text = tokenizer.apply_chat_template(messages, tokenize=False, add_generation_prompt=True)
inputs = tokenizer([text], return_tensors="pt").to(model.device)
outputs = model.generate(**inputs, max_new_tokens=2048, temperature=0.6)
response = tokenizer.decode(outputs[0][inputs.input_ids.shape[-1]:], skip_special_tokens=True)
print(response)

Metodo 4: chiamata tramite un'API compatibile con OpenAI

Questo metodo funziona dopo aver servito il modello tramite SGLang o vLLM.

from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

messages = [
    {
        "role": "system",
        "content": "Sei un modello linguistico del mondo che simula un ambiente terminale Linux."
    },
    {
        "role": "user",
        "content": "Azione: execute_bash\nComando: pwd"
    }
]

response = client.chat.completions.create(
    model="Qwen/Qwen-AgentWorld-35B-A3B",
    messages=messages,
    max_tokens=32768,
    temperature=0.6,
)

print(response.choices[0].message.content)

Buone pratiche

  • Campionamento consigliato: temperature=0.6, top_p=0.95, top_k=20

Lunghezza di output consigliata: circa 32,768 token per la maggior parte delle osservazioni lunghe

  • Usa i prompt di sistema specifici per dominio dalla directory prompts/ del repository per una migliore qualità della simulazione

  • Mantieni la lunghezza del contesto ad almeno 128K quando possibile; il contesto predefinito del modello è 256K


9. Flusso di lavoro di valutazione di AgentWorldBench

Se vuoi testare il tuo modello del mondo su AgentWorldBench, l’articolo originale propone un flusso di lavoro in tre passaggi.

# 1. Clona il repository di valutazione
git clone https://github.com/QwenLM/Qwen-AgentWorld.git
cd Qwen-AgentWorld

# 2. Scarica il dataset di valutazione
huggingface-cli download Qwen/AgentWorldBench --repo-type dataset --local-dir ./AgentWorldBench

# 3. Installa le dipendenze
pip install openai

cd eval

# Passaggio 1: inferenza del modello del mondo
python eval.py infer \
    --data-dir ../AgentWorldBench \
    --model-base-url http://localhost:8000/v1 \
    --model-name Qwen/Qwen-AgentWorld-35B-A3B \
    --output-dir ./results

# Passaggio 2: valutazione tramite giudice LLM. Richiede una chiave API OpenAI.
export OPENAI_API_KEY="your-api-key"
python eval.py judge \
    --predictions ./results/predictions.jsonl \
    --judge-base-url https://api.openai.com/v1 \
    --judge-model gpt-5.2-2025-12-11 \
    --output-dir ./results

# Passaggio 3: aggrega i punteggi
python eval.py score --predictions ./results/judged.jsonl

Ogni campione di test include dati di osservazione di riferimento ottenuti dall’esecuzione in un ambiente reale. Il benchmark valuta la capacità di modellazione del mondo in termini di formato, factualità, coerenza, realismo e qualità.


10. Suggerimenti per il fine-tuning

Se desideri personalizzare Qwen-AgentWorld per un dominio specifico, l'articolo originale consiglia tre framework comuni per il fine-tuning.

Framework

Punto di forza

Scenario adatto

ms-swift

Elevata integrazione con ModelScope

Esperimenti rapidi e flussi di lavoro nell’ecosistema Alibaba

LLaMA-Factory

Community attiva e ampio supporto alle strategie di training

Implementazione ingegneristica pratica

Unsloth

Forte ottimizzazione della memoria

Fine-tuning con risorse limitate


11. Note sulle fonti e gestione delle immagini

L’articolo originale include diverse immagini relative ai domini di Qwen-AgentWorld e ai risultati dei benchmark. Queste sono state mantenute nelle sezioni pertinenti.

Le icone della piattaforma CSDN, i moduli promozionali, i blocchi di abbonamento all’autore, i codici QR, i pulsanti di ricompensa e le immagini di raccomandazione non correlate sono stati rimossi in base ai requisiti di pubblicazione.


FAQ

Che cos’è Qwen-AgentWorld?

Qwen-AgentWorld è un modello linguistico del mondo sviluppato dal team Qwen. Prevede il prossimo stato dell’ambiente dopo che un agente compie un’azione, rendendolo utile per la simulazione, l’addestramento e la valutazione degli agenti.

Qwen-AgentWorld è uguale a un normale modello di chat?

No. Un normale modello di chat è ottimizzato principalmente per la conversazione e l’esecuzione di istruzioni. Qwen-AgentWorld è addestrato come simulatore di ambienti, quindi il suo principale caso d’uso è prevedere le osservazioni negli ambienti di interazione degli agenti.

Quale modello Qwen-AgentWorld è disponibile pubblicamente?

Le pagine ufficiali indicano Qwen-AgentWorld-35B-A3B come peso del modello rilasciato pubblicamente. Anche AgentWorldBench è disponibile come benchmark di valutazione. Il modello più grande da 397B compare nelle tabelle dei benchmark, ma il rilascio pubblico del modello rimanda principalmente alla versione 35B-A3B.

Qwen-AgentWorld può essere distribuito con vLLM?

Sì. La scheda del modello su Hugging Face include un esempio di serving con vLLM. Se riscontri problemi di inizializzazione, la scheda ufficiale del modello consiglia di aggiungere --language-model-only perché il checkpoint contiene i pesi del modello linguistico.

Qwen-AgentWorld può essere distribuito con SGLang?

Sì. SGLang è una delle opzioni di serving consigliate e può esporre un endpoint API compatibile con OpenAI. Il modello può quindi essere richiamato tramite richieste API locali.

Perché Qwen-AgentWorld ha bisogno di una finestra di contesto lunga?

La simulazione degli ambienti degli agenti dipende spesso da lunghe cronologie di interazione. Una finestra di contesto più breve può perdere informazioni di stato importanti, quindi le linee guida ufficiali consigliano di mantenere almeno 128K token quando possibile.

A cosa serve AgentWorldBench?

AgentWorldBench è il benchmark rilasciato con Qwen-AgentWorld. Valuta i modelli linguistici del mondo in sette domini usando dimensioni quali formato, accuratezza fattuale, coerenza, realismo e qualità.

Qwen-AgentWorld è adatto all’uso in produzione?

Può essere utile per ricerca, valutazione, simulazione ed esperimenti interni. Per i sistemi in produzione, è comunque necessario valutare latenza, costo dell’hardware, sicurezza, affidabilità dei prompt e se i risultati simulati corrispondono abbastanza fedelmente al tuo ambiente reale.


Strumenti correlati

  • Qwen-AgentWorld GitHub: Repository ufficiale per il codice, i prompt e il flusso di lavoro di valutazione di Qwen-AgentWorld.

  • Qwen-AgentWorld-35B-A3B su Hugging Face: Pagina ufficiale del modello per i pesi pubblici 35B-A3B.

  • AgentWorldBench: Dataset di benchmark ufficiale per valutare i modelli linguistici del mondo.

  • SGLang: Un framework di serving rapido per modelli linguistici di grandi dimensioni.

  • vLLM: Un motore di inferenza ad alto throughput per il serving di LLM.

  • Transformers: Libreria di Hugging Face per il caricamento e l’inferenza di modelli in locale.

  • OpenAI Python SDK: Client Python in grado di chiamare server di modelli locali compatibili con OpenAI.

  • ms-swift: il framework di addestramento e fine-tuning di ModelScope per i flussi di lavoro LLM.


Link correlati

  • LLaMA-Factory: Framework open source popolare per esperimenti di fine-tuning e distribuzione di LLM.