Poolside Laguna S 2.1: modello di codifica open-source da 118B con contesto di 1 milione di token

Poolside ha rilasciato Laguna S 2.1 , il suo modello di codifica più potente attualmente disponibile pubblicamente.

发布于 2026年7月22日generalGEO 评分: 02 次阅读
Immagine di copertina dell’articolo “Poolside Laguna S 2.1: modello di codifica open-source da 118B con contesto di 1 milione di token”

Poolside Laguna S 2.1: modello di codifica open-source da 118B con contesto di 1 milione di token

Introduzione

Poolside ha rilasciato Laguna S 2.1, il suo modello di codifica più potente attualmente disponibile pubblicamente.

Questo modello è progettato per l'ingegneria del software basata su agenti e attività a ciclo lungo. Dispone di 118 miliardi di parametri totali, con circa 8 miliardi di parametri attivati per ogni token, e supporta una finestra di contesto fino a 1.048.576 token sia in modalità di pensiero che in modalità senza pensiero.

Poolside ha pubblicato i pesi del modello con licenza OpenMDW-1.1. L'azienda ha inoltre reso disponibili diversi checkpoint ufficiali e formati quantizzati tramite Hugging Face, mentre OpenCode offre una versione hostata gratuitamente per un periodo limitato.

Questi dettagli rendono Laguna S 2.1 un rilascio eccezionale. È progettato per offrire prestazioni elevate come agente di codifica senza dover attivare tutti i 118 miliardi di parametri per ogni token, e può essere distribuito privatamente da team dotati di hardware sufficientemente potente.

Allo stesso tempo, diverse dichiarazioni relative a questo rilascio vanno inquadrate nel contesto appropriato. I punteggi dei benchmark sono riportati principalmente da Poolside, non tutti i provider di hosting espongono la piena capacità di 1 milione di token, e l'affermazione "abbastanza piccolo da funzionare su un DGX Spark" non significa che il modello possa funzionare agevolmente su un normale laptop da sviluppatore.

Cos'è Laguna S 2.1?

Laguna S 2.1 è un modello base text-to-text, specificamente addestrato per ingegneria del software, attività da terminale, uso di strumenti e flussi di lavoro con agenti di codifica.

Si colloca tra altri due modelli di Poolside:

Modello Parametri totali Parametri attivati per token Finestra di contesto Posizionamento
Laguna XS 2.1 33B 3B 256K Codifica locale più rapida e a ciclo breve
Laguna S 2.1 118B ~8B 1M Codifica con agenti più potente per cicli lunghi
Laguna M.1 225B 23B 256K Modello più grande per attività complesse con agenti

Poolside afferma che Laguna S 2.1 è passato dall'inizio dell'addestramento al rilascio in meno di nove settimane. È addestrato sulla stessa serie di dati di pre-addestramento di Laguna XS 2.1, con miglioramenti delle prestazioni ottenuti tramite scaling, correzioni del codice di addestramento, modifiche alle ricette e nuovo lavoro di post-addestramento.

L'azienda descrive S 2.1 come il suo modello attualmente più forte per lo sviluppo quotidiano di funzionalità, modifiche multi-file, attività da terminale e sessioni di codifica più lunghe.

Specifiche principali del modello

La scheda ufficiale del modello elenca la seguente architettura:

Specifica Laguna S 2.1
Architettura Mixture of Experts
Parametri totali 118B
Parametri attivati ~8B per token
Numero di layer 48
Layer di attenzione globale 12
Layer a finestra scorrevole 36
Dimensione finestra scorrevole 512 token
Numero di esperti instradati 256
Esperti selezionati Top 10
Esperti condivisi 1
Finestra di contesto 1.048.576 token
Modalità Input e output di testo
Ragionamento Pensiero interleaved, controllabile per richiesta
Dimensione vocabolario 100.352 token

Il modello utilizza Grouped Query Attention e una combinazione di attenzione globale e a finestra scorrevole. Poolside fornisce anche un modello draft DFlash addestrato per la decodifica speculativa.

Il modello draft DFlash per decodifica speculativa

Quando lo stack di inferenza lo supporta, questo modello riduce la latenza del servizio.

Come funziona il design Mixture of Experts (MoE)

Laguna S 2.1 contiene 118 miliardi di parametri, ma non tutti vengono attivati per ogni token.

Il suo router seleziona un sottoinsieme di esperti per ogni token, con circa 8 miliardi di parametri effettivamente coinvolti nel calcolo. Questo è il motivo principale per cui Poolside afferma che il modello è più efficiente rispetto a un modello denso di dimensioni simili.

Tabella di confronto semplificata:

Modello denso Modello MoE
La maggior parte dei parametri partecipa per ogni token Solo gli esperti selezionati partecipano
Il costo computazionale cresce con la scala totale Il costo computazionale può essere molto inferiore alla scala totale
Comportamento di routing semplice Routing e servizio più complessi
La memoria dipende dai pesi completi del modello La memoria dipende ugualmente dai pesi completi e dalla precisione scelta

Non confondere il vantaggio di efficienza con un basso consumo di memoria.

Anche se solo 8 miliardi di parametri vengono attivati per token, il sistema deve comunque avere accesso ai pesi completi di tutti gli esperti. I file GGUF ufficiali mostrano le dimensioni reali:

File GGUF ufficiale Dimensioni approssimative
F16 235 GB
Q8_0 128 GB
Q4_K_M 75 GB
Modello draft DFlash BF16 2,2 GB

La versione quantizzata a 4 bit è più gestibile del modello a piena precisione, ma 75 GB richiedono comunque una workstation con memoria unificata molto elevata o memoria accelerata, oltre a spazio aggiuntivo per la cache di contesto e il runtime.

Finestra di contesto da un milione di token

Il modello base supporta una lunghezza massima del contesto di 1.048.576 token.

Per gli agenti di codifica, una finestra di contesto ampia è utile per:

  • Grandi codebase
  • Numerosi file sorgente correlati
  • Cronologia lunga del terminale
  • Log di build e test
  • Documentazione API
  • Note di architettura
  • Decisioni precedenti dell'agente
  • Output di più strumenti
  • Lavori di refactoring a lungo termine

Il limite di un milione di token non significa che ogni richiesta debba riempire l'intera finestra.

Contesti lunghi aumentano l'uso della memoria, il tempo di pre-riempimento e il costo del servizio. Possono anche introdurre informazioni irrilevanti, rendendo più difficile il lavoro del modello. Un buon framework per agenti di codifica necessita comunque di funzionalità di selezione dei file, recupero, riepilogo, caching e gestione del contesto.

Le piattaforme di hosting possono esporre limiti di contesto inferiori a quelli supportati dal modello sottostante. L'annuncio di OpenCode menziona il supporto per 100K di contesto, ma prima di progettare flussi di lavoro attorno al valore massimo, gli utenti dovrebbero controllare le voci correnti del modello e le politiche del fornitore. Gli endpoint gratuiti o in anteprima potrebbero modificare i limiti di contesto e la disponibilità in qualsiasi momento.

Modalità con pensiero e senza pensiero

Laguna S 2.1 supporta sia la modalità con ragionamento abilitato che la modalità senza pensiero.

Nelle API di inferenza supportate, la modalità di ragionamento può essere controllata per richiesta tramite l'opzione enable_thinking.

Le due modalità sono adatte a compiti diversi:

Modalità con pensiero

Questa modalità è adatta per lavori che richiedono pianificazione e ragionamento intermedio, come:

  • Debug di guasti complessi
  • Coordinamento di modifiche su più file
  • Progettazione di piani di migrazione
  • Studio di una codebase sconosciuta
  • Esecuzione di una serie di strumenti da terminale
  • Risoluzione di problemi con più approcci fattibili

Modalità senza pensiero

La modalità senza pensiero è più adatta per:

  • Modifiche di piccole dimensioni
  • Generazione diretta di codice
  • Adeguamenti di formato
  • Trasformazioni semplici
  • Completamenti a bassa latenza
  • Lavori ripetitivi ad alta frequenza

La modalità di ragionamento non è automaticamente adatta a tutti i compiti. Generalmente consuma più token e richiede più tempo. I team dovrebbero valutare entrambe le modalità sulla propria codebase e misurarne l'efficacia in base al tasso di completamento delle attività, non solo alla qualità percepita dell'output.

Risultati dei benchmark riportati da Poolside

Poolside ha pubblicato i seguenti risultati per Laguna S 2.1:

Benchmark Punteggio riportato
Terminal-Bench 2.1 70,2%
SWE-Bench multilingua 78,5%
SWE-Bench Pro (dataset pubblico) 59,4%
DeepSWE 40,4%
SWE Atlas (Q&A su codebase) 46,2%
Toolathlon Verified 49,7%

Poolside afferma che la maggior parte dei punteggi si basa sulla metrica pass@1 e viene calcolata come media su più esecuzioni. Il loro archivio pubblico di traiettorie mostra

Ecco la traduzione in italiano del contenuto fornito:

Il registro di esecuzione di Terminal-Bench 2.1 permette agli sviluppatori di comprendere più chiaramente il processo con cui l'agente gestisce compiti specifici.

I risultati mostrano che Laguna S 2.1 è competitivo rispetto a modelli con un numero totale di parametri significativamente maggiore.

Tuttavia, è necessario interpretare con cautela le tabelle dei benchmark.

I risultati dei benchmark non sono classifiche di prodotti generiche

I risultati possono variare a causa dei seguenti fattori:

  • Framework dell'agente
  • Prompt di sistema
  • Definizione degli strumenti
  • Impostazioni di timeout
  • Numero di tentativi
  • Parametri di campionamento
  • Versione del test
  • Configurazione del repository
  • Precisione di inferenza
  • Configurazione del contesto
  • Fonte del punteggio (sviluppatore del modello vs valutatore indipendente)

La pagina del modello Poolside spiega che la sua tabella comparativa potrebbe utilizzare i dati più elevati dei modelli concorrenti provenienti da report dei fornitori, classifiche di benchmark o classifiche di terze parti. Questo approccio è adatto per confronti a livello macro, ma è diverso dal testare tutti i modelli con una configurazione di valutazione uniforme.

La conclusione più sicura è: Laguna S 2.1 mostra buone prestazioni nella sua categoria di parametri effettivi. I team che scelgono un modello di codifica di livello produttivo dovrebbero comunque testare utilizzando i propri set di problemi, repository, toolchain e standard di revisione.

Pesi open-source basati su licenza OpenMDW-1.1

Poolside ha rilasciato Laguna S 2.1 con la licenza OpenMDW-1.1, una licenza per materiali modello mantenuta dal progetto OpenMDW.

Questa licenza concede agli utenti ampi diritti di utilizzare, modificare e ridistribuire gratuitamente i materiali del modello, a condizione che vengano rispettati i termini. In caso di ridistribuzione, è obbligatorio conservare la licenza e le relative dichiarazioni di copyright o di origine.

Inoltre, i contenuti generati utilizzando il modello non sono soggetti a restrizioni di licenza.

In pratica, gli sviluppatori devono distinguere tra i seguenti termini:

  • Pesi open-source: È possibile scaricare i parametri del modello addestrato.
  • Software open-source: Il codice sorgente è rilasciato secondo una licenza software conforme agli standard open-source.
  • Modello aperto: Termine generico che può riguardare pesi, architettura, documentazione, dati di addestramento e codice di addestramento.

Laguna S 2.1 è chiaramente un rilascio di pesi open-source. Poolside e OpenCode sono impegnati insieme a promuovere lo sviluppo e l'applicazione della tecnologia dell'intelligenza artificiale.

I materiali di rilascio utilizzano un termine "open-source" più forte, ma le organizzazioni, prima di ridistribuire o implementare commercialmente, dovrebbero esaminare il testo effettivo di OpenMDW-1.1, le linee guida per l'uso responsabile di Poolside, le dipendenze di terze parti e i propri requisiti legali.

La licenza fornisce i materiali del modello "così come sono", senza alcuna garanzia. Gli utenti sono comunque responsabili del test dell'accuratezza, della sicurezza, dell'idoneità e della conformità.

Laguna S 2.1 gratuitamente a tempo limitato su OpenCode

OpenCode ha annunciato che, durante il periodo promozionale, Laguna S 2.1 è disponibile gratuitamente tramite OpenCode Zen, senza costi di utilizzo del modello.

Ciò offre agli utenti un modo a basso costo per testare, senza dover scaricare file checkpoint da 75-235 GB o eseguire hardware di inferenza locale.

La documentazione di OpenCode evidenzia due dettagli importanti:

  1. La disponibilità gratuita è temporanea.
  2. Gli input e output del servizio Laguna S 2.1 gratuito potrebbero essere raccolti e utilizzati per migliorare il modello.

Pertanto, gli utenti dovrebbero evitare di inviare:

  • Codice sorgente proprietario.
  • Dati dei clienti.
  • Informazioni sulle credenziali.
  • Chiavi private.
  • Documenti di architettura riservati.
  • Log sensibili per la sicurezza.
  • Dati regolamentati o personali.

L'anteprima gratuita è adatta per repository di codice pubblico, progetti sintetici e valutazioni a basso rischio. Il test con codice aziendale privato dovrebbe essere effettuato solo dopo aver esaminato le politiche attuali dei dati della piattaforma, i termini di conservazione, i controlli dell'area di lavoro e le opzioni a pagamento o self-hosted disponibili.

Come provare Laguna S 2.1

Opzione 1: utilizzare il modello gratuito di OpenCode

OpenCode può essere installato tramite il suo programma di installazione ufficiale:

curl -fsSL https://opencode.ai/install | bash

Una volta completata l'installazione, connettiti a OpenCode Zen e seleziona il modello gratuito Laguna S 2.1 attualmente elencato.

Durante l'anteprima, il nome esatto del modello, i limiti di contesto, i limiti di utilizzo e la disponibilità potrebbero cambiare. Prima di avviare attività a lungo termine, controlla la documentazione di OpenCode Zen e il selettore del modello.

Opzione 2: eseguire il modello base con Docker Model Runner

La scheda ufficiale del modello su Hugging Face fornisce il seguente comando:

docker model run hf.co/poolside/Laguna-S-2.1

La dimensione del download e la quantità di memoria necessaria dipendono dal formato scelto in fase di esecuzione. Prima di scaricare i file del modello sulla tua workstation o server, controlla i file del modello.

Opzione 3: utilizzare llama.cpp per fornire la quantizzazione GGUF ufficiale

Poolside fornisce un repository GGUF ufficiale e un fork di llama.cpp compatibile con Laguna.

git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build -j

./build/bin/llama-server \
  -hf poolside/Laguna-S-2.1-GGUF:Q4_K_M \
  --jinja \
  --port 8000

La dimensione del file Q4_K_M è di circa 75 GB. Il sistema necessita anche di memoria per l'overhead di runtime e la cache KV, specialmente quando si utilizzano contesti lunghi.

Opzione 4: aggiungere la decodifica speculativa DFlash

Le istruzioni ufficiali includono un modello bozza DFlash opzionale:

./build/bin/llama-server \
  -m laguna-s-2.1-Q4_K_M.gguf \
  -md laguna-s-2.1-DFlash-BF16.gguf \
  --spec-type draft-dflash \
  --spec-draft-n-max 15 \
  -fa on \
  --jinja \
  --port 8000

La decodifica speculativa può aumentare la velocità di generazione, ma i risultati dipendono dall'hardware, dalla forma del prompt, dalla lunghezza del contesto, dalla configurazione di build, ecc.

Configurazione e tasso di accettazione del modello bozza.

Può davvero funzionare su un singolo NVIDIA DGX Spark?

Poolside sostiene che Laguna S 2.1 sia abbastanza piccolo da funzionare su un singolo NVIDIA DGX Spark.

Per un checkpoint quantizzato appropriato, questo è fattibile, poiché DGX Spark è progettato attorno a una grande configurazione di memoria unificata. Tuttavia, ciò non significa che ogni formato di modello, dimensione del contesto o modalità di servizio si adatti immediatamente.

Gli utenti dovrebbero porsi quattro domande separatamente:

  1. I pesi possono essere caricati?
  2. Dopo l'overhead di runtime, quale lunghezza del contesto può essere supportata?
  3. Quale velocità di generazione dei token si può raggiungere?
  4. Quante sessioni agente può servire contemporaneamente il sistema?

Un modello teoricamente caricabile potrebbe comunque essere troppo lento per la codifica interattiva con lunghezze di contesto estreme. Throughput, tempo di generazione del primo token, consumo energetico e carichi di lavoro concorrenti richiedono misurazioni separate.

Report della community sulle implementazioni locali

Il rapporto iniziale di AIBase citava test della community su un sistema Apple M3 Max con 128 GB di memoria unificata e il fork llama.cpp di Poolside.

Il checkpoint Q4_K_M da 75 GB rende tecnicamente credibile tale implementazione, ma l'esperienza può variare notevolmente a seconda di:

  • Pressione sulla memoria.
  • Dimensione del contesto.
  • Livello di quantizzazione.
  • Lunghezza del prompt.
  • Offload CPU e GPU.
  • Limiti termici.
  • Decodifica speculativa.
  • Altre applicazioni che utilizzano memoria unificata.

I report della community non dovrebbero essere considerati raccomandazioni hardware affidabili. Gli sviluppatori dovrebbero fare riferimento alle dimensioni ufficiali dei file e预留 un margine di memoria sufficiente prima di scaricare il modello.

Perché Laguna S 2.1 è cruciale per la codifica agentiva

Laguna S 2.1 riflette diversi cambiamenti più ampi nel campo dei modelli di codifica.

Le dimensioni computazionali attive più piccole stanno diventando più importanti

Un numero totale di parametri enorme può fornire capacità, mentre l'attivazione sparsa aiuta a controllare la quantità di calcolo per singolo token.

L'architettura MoE è particolarmente interessante per gli agenti di codifica che potrebbero funzionare per minuti o ore.

Il contesto lungo sta entrando nei modelli a pesi aperti

Le finestre da milioni di token erano principalmente associate a modelli proprietari ospitati. La loro comparsa nei modelli di codifica a pesi aperti offre ai team un maggiore controllo sugli esperimenti con repository lunghi e sulle distribuzioni private.

I framework per agenti sono essenziali

Poolside addestra i modelli Laguna all'interno del proprio framework per agenti e afferma che questi modelli funzionano al meglio in tale ambiente o in client compatibili con il protocollo Agent Client Protocol (ACP).

I benchmark di codifica misurano il sistema composto dal modello e dall'agente, non solo la capacità grezza di previsione del token successivo. L'uso di strumenti, la selezione del contesto, la logica di ripetizione, l'accesso al terminale e l'applicazione di patch influenzano sostanzialmente le prestazioni.

I pesi aperti ampliano le opzioni di distribuzione

Le organizzazioni possono ispezionare i file, scegliere il proprio runtime, quantizzare il modello, distribuirlo su infrastrutture private e collegarlo ad agenti di codifica interni.

Questa flessibilità è preziosa per ambienti con codice sorgente sensibile alla privacy e accesso di rete limitato.

Limitazioni da considerare prima dell'uso in produzione

Modalità solo testo

La scheda ufficiale del modello descrive Laguna S 2.1 come un modello testo-testo. Non è nativamente un modello per immagini, audio o video.

Elevati requisiti di memoria

Il numero di parametri attivi è relativamente piccolo, ma il modello completo, con tutti i pesi, è ancora grande. I normali laptop non sono adatti per il formato ufficiale di alta qualità.

Il contesto lungo può essere costoso

La capacità massima di un milione di token non equivale a un'elaborazione efficiente di un milione di token nell'uso quotidiano. La latenza di precompilazione e la memoria della cache KV possono diventare considerevoli.

I benchmark richiedono una validazione interna

Un punteggio di programmazione pubblico eccezionale non garantisce buone prestazioni sul mix linguistico, sul sistema di build, sugli standard di codifica o sul framework privato di un'azienda.

L'accesso gratuito ospitato ha implicazioni sui dati

La documentazione per il periodo gratuito di OpenCode indica che gli input e gli output raccolti potrebbero essere utilizzati per il miglioramento del modello. Non inviare codice riservato senza una politica approvata.

La programmazione tramite agente può modificare sistemi reali

Qualsiasi agente di programmazione, quando dispone di ampi permessi, può eliminare file, eseguire comandi, modificare dipendenze o introdurre vulnerabilità di sicurezza.

Utilizzo:

  • Controllo di versione.
  • Workspace isolati.
  • Credenziali con privilegi minimi.
  • Revisione umana.
  • Ambienti di test.
  • Backup.
  • Approvazione dei comandi.

Chi dovrebbe valutare Laguna S 2.1?

Laguna S 2.1 è più adatto per:

  • Team che costruiscono agenti di programmazione autonomi.
  • Sviluppatori che valutano alternative alle API di programmazione proprietarie.
  • Organizzazioni che necessitano di distribuzioni di modelli privati.
  • Ricercatori che studiano l'ingegneria del software su cicli lunghi.
  • Team infrastrutturali con workstation o server con molta memoria.
  • Costruttori di strumenti che utilizzano client agent compatibili con OpenAI o basati su ACP.

Potrebbe essere meno adatto per:

  • Flussi di lavoro leggeri solo su laptop.
  • Completamento semplice.
  • Distribuzioni mobili.
  • Team senza infrastruttura per eseguire modelli di 75 GB o più grandi.
  • Automazione di produzione ad alto rischio senza forte sandboxing.
  • Carichi di lavoro che richiedono input multimodali nativi.

Domande frequenti

Cos'è Poolside Laguna S 2.1?

Laguna S 2.1 è un modello Mixture of Experts (MoE) da 118 miliardi di parametri, progettato per la programmazione tramite agente e attività di ingegneria del software su cicli lunghi. Attiva circa 8 miliardi di parametri per token e supporta una finestra di contesto fino a 1.048.576 token.

Laguna S 2.1 è completamente open source?

I suoi pesi sono pubblicamente disponibili sotto la licenza OpenMDW-1.1, quindi "pesi aperti" è la descrizione più chiara. Gli utenti devono rivedere la licenza, la documentazione del modello, le linee guida per l'uso accettabile e qualsiasi componente di terze parti prima di ridistribuire o distribuire commercialmente.

Laguna S 2.1 è gratuito su OpenCode?

OpenCode attualmente offre un'opzione gratuita per Laguna S 2.1 per un periodo limitato. Disponibilità, limiti di contesto, limiti di velocità e termini di utilizzo dei dati possono cambiare, quindi verifica la documentazione corrente di OpenCode Zen prima di fare affidamento su di essa.

La versione gratuita di OpenCode ha la finestra di contesto da un milione di token?

L'annuncio di OpenCode pubblicizza il contesto da un milione, in linea con la capacità massima del modello base. Gli endpoint ospitati potrebbero implementare limiti diversi, quindi verifica la configurazione del modello attivata in OpenCode prima di inviare contesti estremamente lunghi.

Laguna S 2.1 può funzionare su Mac?

Rapporti dalla comunità indicano che le versioni quantizzate possono funzionare su sistemi Apple Silicon con molta memoria, incluse configurazioni M3 Max da 128 GB. Le prestazioni e il contesto utilizzabile dipendono dal metodo di quantizzazione, dall'ambiente runtime, dalla memoria disponibile e dal carico di sistema.

Laguna S 2.1 può funzionare su un singolo DGX Spark?

Poolside afferma che una versione adatta può funzionare su un singolo NVIDIA DGX Spark. La lunghezza del contesto realizzabile, la velocità dei token e la concorrenza dipendono dal formato del checkpoint e dalla configurazione del servizio.

Quali sono i punteggi di benchmark di Laguna S 2.1?

Poolside riporta il 70,2% su Terminal-Bench 2.1, il 78,5% su SWE-Bench Multilingual, il 59,4% sul dataset pubblico SWE-Bench Pro e il 40,4% su DeepSWE. Questi dati dovrebbero essere valutati insieme ai metodi di test dell'azienda e a test indipendenti.

Laguna S 2.1 supporta il controllo del ragionamento?

Sì. La scheda ufficiale del modello mostra che supporta il pensiero interleaved e consente di abilitare o disabilitare il ragionamento per richiesta in sistemi di servizio compatibili.

Strumenti correlati

  • Poolside: L'azienda che sviluppa la famiglia di modelli base Laguna per la programmazione intelligente.
  • OpenCode: Un agente di codifica open source che attualmente offre accesso gratuito limitato nel tempo a Laguna S 2.1.
  • Hugging Face: Repository ufficiale per pesi, documentazione, formati e guide all'uso di Laguna S 2.1.
  • llama.cpp: Un runtime di inferenza locale che supporta costantemente i modelli Laguna in formato GGUF.
  • Docker Model Runner: Strumento Docker per scaricare e servire modelli locali supportati.
  • OpenRouter: Opzione API ospitata per accedere ai modelli Poolside tramite un'interfaccia compatibile con OpenAI.

Link correlati

Catalogo modelli Poolside: Confronto ufficiale tra Laguna S 2.1, XS 2.1 e l'intera famiglia di modelli Laguna.

Riepilogo

Poolside Laguna S 2.1 dispone di 118B parametri totali, circa 8B parametri attivi per token, una finestra di contesto di un milione di token, ragionamento controllabile e pesi aperti ufficialmente disponibili in vari formati.

Poolside riporta prestazioni elevate nei benchmark di terminale e ingegneria del software, tra cui il 70,2% su Terminal-Bench 2.1 e il 40,4% su DeepSWE. Questi risultati rendono il modello eccezionale nella sua categoria di dimensioni, sebbene i team debbano replicare le prestazioni nei propri repository e framework di agenti.

L'accesso gratuito a tempo limitato di OpenCode rende il modello facile da testare, mentre i pesi scaricabili consentono il dispiegamento privato, a costo però di enormi requisiti di memoria, modifiche alle politiche dei servizi di hosting e rischi operativi per agenti di codifica autonomi.

Laguna S 2.1 rappresenta un rilascio significativo di pesi aperti per compiti di codifica a lungo ciclo, ma il suo vero valore dipenderà dall'integrazione con agenti, dall'efficienza del dispiegamento e dalle prestazioni nel lavoro di sviluppo reale, non solo dall'etichetta "milione di token di contesto".

Poolside Laguna S 2.1: modello di codifica open-source da 118B con contesto di 1 milione di token