Poolside Laguna S 2.1:拥有1M上下文长度的118B开源编码模型

Poolside 发布了 Laguna S 2.1 ,这是迄今为止其公开可用的最强编码模型。

发布于 2026年7月22日generalGEO 评分: 0
《Poolside Laguna S 2.1:拥有1M上下文长度的118B开源编码模型》文章封面图

Poolside Laguna S 2.1:拥有1M上下文长度的118B开源编码模型

引言

Poolside 发布了 Laguna S 2.1,这是迄今为止其公开可用的最强编码模型。

该模型专为智能体软件工程和长周期任务而设计。它拥有 1180 亿总参数,每个 token 大约激活 80 亿参数,并且在思考模式和非思考模式下均支持高达 1,048,576 个 token 的上下文窗口。

Poolside 已根据 OpenMDW-1.1 许可证发布了模型权重。该公司还通过 Hugging Face 提供了几种官方检查点和量化格式,同时 OpenCode 在限定时间内提供了免费托管版本。

这些细节使 Laguna S 2.1 成为一个非同寻常的发布版本。它旨在提供强大的编码智能体性能,而无需每个 token 都通过完整 1180 亿参数的网络,并且可以由拥有足够强大硬件的团队进行私有部署。

与此同时,围绕此次发布的几项声明需要结合具体情况来看待。基准测试分数主要由 Poolside 报告,并非所有托管供应商都会暴露完整的 100 万 token 容量,而“小到可以在一台 DGX Spark 上运行”并不意味着该模型能够在一台普通的开发者笔记本电脑上流畅运行。

Laguna S 2.1 是什么?

Laguna S 2.1 是一个文本到文本的基础模型,专门为软件工程、终端工作、工具使用和编码智能体工作流而训练。

它位于 Poolside 其他两个模型之间:

模型 总参数 每个 token 激活参数 上下文窗口 定位
Laguna XS 2.1 33B 3B 256K 更快的本地和短周期编码
Laguna S 2.1 118B 约 8B 1M 更强的长周期智能体编码
Laguna M.1 225B 23B 256K 用于复杂智能体任务的更大模型

Poolside 表示,Laguna S 2.1 从训练开始到发布仅用了不到九周时间。它基于与 Laguna XS 2.1 相同的预训练数据系列进行训练,通过扩展、训练代码修复、配方更改以及新的后训练工作来实现性能提升。

该公司将 S 2.1 描述为其当前在每日功能开发、多文件更改、终端任务和更长编码会话方面最强的模型。

核心模型规格

官方模型卡列出了以下架构:

规格 Laguna S 2.1
架构 混合专家模型
总参数 118B
激活参数 每个 token 约 8B
层数 48
全局注意力层 12
滑动窗口层 36
滑动窗口大小 512 个 token
路由专家数 256
选择的专家数 前 10 个
共享专家数 1
上下文窗口 1,048,576 个 token
模态 文本输入和文本输出
推理 交错思考,可按请求控制
词表大小 100,352 个 token

该模型使用分组查询注意力和全局与滑动窗口注意力的混合。Poolside 还提供了一个训练好的...

投机解码的DFlash草稿模型

当推理堆栈支持时,该模型可降低服务延迟。

混合专家(MoE)设计方案的工作原理

Laguna S 2.1 包含1180亿个参数,但并非每个token都会激活全部参数。

其路由器会为每个token选择部分专家,实际参与计算的参数约80亿。这是Poolside称该模型相比同规模稠密模型更高效的主要原因。

简化版对比表如下:

稠密模型 混合专家模型
每个token多数参数参与 仅选定专家参与
计算量随总规模增长 计算量可远低于总规模
路由行为简单 路由与服务更复杂
内存依赖完整模型权重 内存同样依赖全重和所选精度

切勿将效率优势误解为内存占用小。

即便每个token仅激活80亿参数,系统仍需访问完整专家权重。官方GGUF文件展示了实际规模:

官方GGUF文件 近似大小
F16 235GB
Q8_0 128GB
Q4_K_M 75GB
DFlash BF16草稿模型 2.2GB

四比特量化版比全精度模型更易管理,但75GB仍需配备极高统一内存或加速内存的工作站,还需为上下文缓存和运行时额外预留空间。

百万token上下文窗口

基础模型支持1,048,576个token的最大上下文长度。

对于编码智能体,大上下文窗口在以下任务中发挥作用:

  • 大型代码仓库
  • 众多关联源文件
  • 长终端历史记录
  • 构建与测试日志
  • API文档
  • 架构说明
  • 先前智能体决策
  • 多工具输出
  • 长期重构工作

百万token限制并不意味着每次请求都应填满整个窗口。

长上下文会增加内存使用、预填充时间和服务成本。还可能引入无关信息,增加模型工作难度。优秀的编码智能体框架仍需文件选择、检索、摘要、缓存和上下文管理功能。

托管平台可能暴露低于底层模型支持的上下文限制。OpenCode发布公告宣称支持100万上下文,但在围绕最大值设计工作流前,用户应查看当前模型条目和供应商政策。免费或预览端点可能随时调整上下文限制和可用性。

思考模式与非思考模式

Laguna S 2.1支持推理启用和无思考两种模式。

在支持的推理API中,可通过enable_thinking选项按请求控制推理模式。

两种模式适用于不同任务:

思考模式

该模式适用于需要规划和中途推理的工作,例如:

  • 调试复杂故障
  • 协调多个文件的更改
  • 设计迁移方案

研究一个陌生的代码仓库。

  • 运行一系列终端工具。
  • 使用多种可行方法解决问题。

无思考模式

无思考模式更适合以下场景:

  • 小型修改。
  • 直接代码生成。
  • 格式调整。
  • 简单转换。
  • 低延迟补全。
  • 高重复性日常工作。

推理模式并不自动适用于所有任务。它通常会消耗更多令牌且耗时更长。团队应针对自身代码仓库评估两种模式,并通过任务完成率衡量效果,而非仅依赖主观输出质量。

Poolside 报告的基准测试结果

Poolside 公布 Laguna S 2.1 的测试结果如下:

基准测试 报告得分
Terminal-Bench 2.1 70.2%
SWE-Bench 多语言版 78.5%
SWE-Bench Pro(公开数据集) 59.4%
DeepSWE 40.4%
SWE Atlas(代码库问答) 46.2%
Toolathlon Verified 49.7%

Poolside 表示大多数得分基于 pass@1 指标并取多次测试平均值。其公开轨迹档案展示了 Terminal-Bench 2.1 的运行记录,让开发者更清晰了解代理处理具体任务的过程。

结果表明,Laguna S 2.1 与多个总参数量更大的模型相比具有竞争力。

但需谨慎解读基准测试表格。

基准测试结果并非通用产品排名

结果可能因以下因素而异:

  • 代理框架
  • 系统提示词
  • 工具定义
  • 超时设置
  • 尝试次数
  • 采样参数
  • 测试版本
  • 代码仓库配置
  • 推理精度
  • 上下文配置
  • 得分来源(模型开发商 vs 独立评估方)

Poolside 模型页面说明,其对比表格可能采用竞争模型在供应商报告、基准测试排行榜或第三方排行榜中的最高数据。这种方法适合宏观对比,但不同于在统一评估配置下测试所有模型。

最稳妥的结论是:Laguna S 2.1 在其有效参数类别中表现强劲。选择生产级编码模型的团队仍应使用自身的问题集、代码仓库、工具链和审查标准进行测试。

基于 OpenMDW-1.1 许可证的开源权重

Poolside 已通过 OpenMDW-1.1 许可证发布 Laguna S 2.1,该模型材料许可证由 OpenMDW 项目维护。

该许可证授予用户广泛权利,可在遵守条款条件下免费使用、修改和重新分发模型材料。重新分发时必须保留许可证及相关版权或来源声明。

此外,使用该模型产生的输出内容不受许可证限制。

实际应用中,开发者需区分以下术语:

  • 开源权重: 可下载已训练的模型参数。
  • 开源软件: 源代码依据符合开源标准的软件许可证发布。
  • 开放模型: 广义术语,可能涉及权重、架构、文档、训练数据和训练代码。

Laguna S 2.1 明确属于开源权重发布。Poolside 和 OpenCode 共同致力于推动人工智能技术的发展与应用。

发布材料中使用了更强的“开源”表述,但组织在重新分发或商业部署前,应审阅OpenMDW-1.1实际文本、Poolside的负责任使用指南、第三方依赖项以及自身法律要求。

该许可证同样按“现状”提供模型材料,不附带任何担保。用户仍须自行负责测试准确性、安全性、适用性及合规性。

Laguna S 2.1 在 OpenCode 限时免费提供

OpenCode 宣布,在推广期内,Laguna S 2.1 可通过 OpenCode Zen 免费使用,无需支付模型使用费。

这为用户提供了一种低门槛的测试方式,无需下载 75-235 GB 的检查点文件或运行本地推理硬件。

OpenCode 的文档指出了两个重要细节:

  1. 免费提供是临时性的
  2. 来自免费 Laguna S 2.1 服务的输入和输出可能被收集并用于改进模型。

因此,用户应避免发送:

  • 专有源代码。
  • 客户数据。
  • 凭证信息。
  • 私钥。
  • 机密架构文档。
  • 安全敏感日志。
  • 受监管或个人信息。

免费预览适用于公共代码库、合成项目和低风险评估。只有在审阅平台当前的数据策略、保留条款、工作空间控制以及可用的付费或自托管选项后,才应使用私有公司代码进行测试。

如何试用 Laguna S 2.1

选项 1:使用免费的 OpenCode 模型

OpenCode 可通过其官方安装程序进行安装:

curl -fsSL https://opencode.ai/install | bash

安装完成后,连接 OpenCode Zen,并选择当前列出的 Laguna S 2.1 免费模型。

在预览期间,确切的模型名称、上下文限制、使用上限和可用性可能会发生变化。在开始长期任务之前,请检查 OpenCode Zen 文档和模型选择器。

选项 2:使用 Docker 模型运行器运行基础模型

官方 Hugging Face 模型卡提供了以下命令:

docker model run hf.co/poolside/Laguna-S-2.1

所需的下载大小和内存量取决于运行时选择的格式。在将模型文件拉取至工作站或服务器之前,请先查看模型文件。

选项 3:使用 llama.cpp 提供官方 GGUF 量化服务

Poolside 提供了官方的 GGUF 仓库和一个与 Laguna 兼容的 llama.cpp 分支。

git clone --branch laguna https://github.com/poolsideai/llama.cpp
cd llama.cpp
cmake -B build
cmake --build build -j

./build/bin/llama-server \
  -hf poolside/Laguna-S-2.1-GGUF:Q4_K_M \
  --jinja \
  --port 8000

Q4_K_M 文件大小约为 75 GB。系统还需要内存用于运行时开销和 KV 缓存,尤其是在使用长上下文时。

选项 4:添加 DFlash 推测解码

官方说明中包含一个可选的 DFlash 草稿模型:

./build/bin/llama-server \
  -m laguna-s-2.1-Q4_K_M.gguf \
  -md laguna-s-2.1-DFlash-BF16.gguf \
  --spec-type draft-dflash \
  --spec-draft-n-max 15 \
  -fa on \
  --jinja \
  --port 8000

推测解码可以提高生成速度,但具体结果取决于硬件、提示形式、上下文长度、构建配置等因素。

配置及草稿模型接受率。

它真的能在单个 NVIDIA DGX Spark 上运行吗?

Poolside 声称,Laguna S 2.1 足够小,可以在单个 NVIDIA DGX Spark 上运行。

对于一个合适的量化检查点来说,这是可行的,因为 DGX Spark 围绕大型统一内存配置设计。但这并不意味着每种模型格式、上下文大小或服务模式都能立即适配。

用户应分别提出四个问题:

  1. 权重能否加载?
  2. 运行时开销后,能支持多长的上下文?
  3. 能达到什么样的令牌生成速度?
  4. 系统能同时服务多少个代理会话?

一个理论上能加载的模型,在极端上下文长度下,可能仍慢得无法用于交互式编码。吞吐量、首令牌生成时间、功耗和并发工作负载都需要独立的测量数据。

本地部署的社区报告

最初的 AIBase 报告引用了社区测试,使用的是配备 128 GB 统一内存的 Apple M3 Max 系统和 Poolside 的 llama.cpp 分支。

75 GB 的 Q4_K_M 检查点使这类部署在技术上可信,但体验会因以下因素而有很大差异:

  • 内存压力。
  • 上下文大小。
  • 量化级别。
  • 提示词长度。
  • CPU 和 GPU 卸载。
  • 散热限制。
  • 推测解码。
  • 使用统一内存的其他应用程序。

不应将社区报告视为可靠的硬件推荐。开发者应参考官方文件大小,并在下载模型前留出足够的内存余量。

为什么 Laguna S 2.1 对代理式编码至关重要

Laguna S 2.1 反映了编码模型领域的若干更广泛变化。

较小的活跃计算规模正变得更加重要

巨大的总参数量可以提供容量,而稀疏激活则有助于控制单次令牌计算量。

这使得 MoE 架构对那些可能运行数分钟或数小时的编码代理更具吸引力。

长上下文正融入开放权重模型

百万级令牌窗口曾主要与托管的专有模型相关联。它在开放权重编码模型中的出现,使团队在长仓库实验和私有部署方面拥有更多控制权。

代理框架至关重要

Poolside 在其自有代理框架内训练 Laguna 模型,并表示这些模型在该环境或其他兼容代理客户端协议(Agent Client Protocol)的客户端中表现最佳。

编码基准测试衡量的是模型加代理构成的系统,而不仅仅是原始的下一令牌预测能力。工具使用、上下文选择、重试逻辑、终端访问和补丁应用都会实质性地影响性能。

开放权重扩展了部署选择

组织可以检查文件、选择自有运行时、量化模型、将其部署到私有基础设施上,并将其连接到内部编码代理。

这种灵活性对于涉及隐私敏感的源代码和网络访问受限的环境非常有价值。

在生产环境中使用前需考虑的局限性

纯文本模态

官方模型卡将 Laguna S 2.1 描述为文本到文本模型。它并非原生的图像、音频或视频模型。

高内存需求

其活跃参数量相对较小,但

完整模型,但完整权重仍然很大。普通笔记本电脑将不适合官方高品质格式。

长上下文可能代价高昂

百万级token的最大容量并不等同于日常使用中高效的百万级token处理。预填充延迟和KV缓存内存可能变得相当可观。

基准测试需要内部验证

一项突出的公开编程分数并不能保证在公司的语言组合、构建系统、编码标准或私有框架上也能表现出色。

免费托管访问存在数据影响

OpenCode的免费期文档指出,收集的输入和输出可能用于模型改进。在没有批准的政策下,不应提交机密代码。

智能体编程可修改真实系统

任何编程代理在获得广泛权限时,都可能删除文件、执行命令、更改依赖项或引入安全漏洞。

使用:

  • 版本控制。
  • 隔离工作区。
  • 最小权限凭证。
  • 人工审查。
  • 测试环境。
  • 备份。
  • 命令审批。

谁应该评估 Laguna S 2.1?

Laguna S 2.1 最适用于:

  • 构建自主编程代理的团队。
  • 评估专有编程API替代方案的开发者。
  • 需要私有模型部署的组织。
  • 研究长周期软件工程的研究人员。
  • 拥有大内存工作站或服务器的基础设施团队。
  • 使用兼容OpenAI或基于ACP的代理客户端的工具构建者。

它可能不太适用于:

  • 仅限笔记本电脑的轻量级工作流程。
  • 简单的自动补全。
  • 移动端部署。
  • 没有基础设施来运行75 GB或更大模型的团队。
  • 缺乏强沙箱的高风险生产自动化。
  • 需要原生多模态输入的工作负载。

常见问题

什么是 Poolside Laguna S 2.1?

Laguna S 2.1 是一个拥有1180亿参数的混合专家模型,专为智能体编程和长周期软件工程任务设计。每个token激活约80亿参数,并支持高达1,048,576个token的上下文窗口。

Laguna S 2.1 是完全开源的吗?

其权重在OpenMDW-1.1许可下公开可用,因此“开放权重”是最清晰的描述。用户在重新分发或商业部署前,应审查许可协议、模型文档、可接受使用指南以及任何第三方组件。

Laguna S 2.1 在OpenCode上免费吗?

OpenCode目前限时提供免费的Laguna S 2.1选项。可用性、上下文限制、速率限制和数据使用条款可能会变更,因此在依赖它之前,请检查当前的OpenCode Zen文档。

免费版OpenCode是否拥有百万级token的上下文窗口?

OpenCode的公告宣传了百万级上下文,与基础模型的最大容量一致。托管端点可能实施不同的限制,因此在发送极长上下文之前,请验证OpenCode中激活的模型配置。

Laguna S 2.1 能在Mac上运行吗?

社区报告表明,量化版本可以在高内存的Apple Silicon系统上运行,包括128 GB的M3 Max配置。性能和可用上下文取决于量化方式、运行时环境、可用内存和系统负载。

Laguna S 2.1 能运行

一个DGX Spark上就能运行?

Poolside表示,合适的版本可以在单个NVIDIA DGX Spark上运行。可实现的上下文长度、Token速度和并发性取决于检查点格式和服务配置。

Laguna S 2.1的基准测试分数是多少?

Poolside报告称,在Terminal-Bench 2.1上达到70.2%,在SWE-Bench Multilingual上达到78.5%,在公开的SWE-Bench Pro数据集上达到59.4%,在DeepSWE上达到40.4%。这些数据应结合公司的测试方法和独立测试进行评估。

Laguna S 2.1支持推理控制吗?

支持。官方模型卡显示,它支持交错思考,并允许在兼容的服务系统中对每个请求启用或禁用推理。

相关工具

  • Poolside:开发Laguna系列基础模型用于智能编码的公司。
  • OpenCode:一个开源编码代理,目前提供限时免费的Laguna S 2.1访问权限。
  • Hugging Face:Laguna S 2.1权重、文档、格式和使用指南的官方仓库。
  • llama.cpp:一个本地推理运行时,持续支持Laguna系列GGUF模型。
  • Docker Model Runner:用于下载和服务受支持的本地模型的Docker工具。
  • OpenRouter:通过兼容OpenAI的接口访问Poolside模型的托管API选项。

相关链接

总结

Poolside Laguna S 2.1拥有118B总参数量,每个Token约8B活跃参数,一百万个Token的上下文窗口,可控推理,并以多种格式正式开放权重。

Poolside报告了在终端和软件工程基准测试中的强劲表现,包括Terminal-Bench 2.1上的70.2%和DeepSWE上的40.4%。这些成绩使得该模型在其尺寸级别中表现突出,不过团队应在其自有仓库和代理框架上复现性能。

OpenCode的限时免费访问使得模型易于测试,而可下载的

权重使得私有部署成为可能,但代价是巨大的内存需求、托管服务政策的变更,以及自主编码代理的正常运营风险。

Laguna S 2.1 是一次有意义的开源权重发布,适用于长周期编码任务,但其真正价值将取决于代理集成、部署效率以及在实际开发工作中的表现——而不仅仅是 100 万上下文标记这一标签。