Poolside 把 Laguna S 2.1 甩了出来:西方现在最能打的开放权重编程模型

一家叫 Poolside 的旧金山小实验室,周二把新模型 Laguna S 2.1 端上了台面。这事有意思的地方不在于它有多大,而在于它小到能塞进一台桌面级机器,却把好几款数倍于己的闭源模型比了下去。

九周造出来的小钢炮

Laguna S 2.1 总参数 1180 亿,但每次推理只激活 80 亿,上下文窗口拉到了 100 万 token。Poolside 说它从 5 月 22 日才开始预训练,用 4096 张 H200,不到九周就发布了。在长周期编程基准 Terminal-Bench 2.1 上拿到 70.2%,比 1.6 万亿参数的 DeepSeek-V4-Pro-Max(64.0%)和 5500 亿参数的英伟达 Nemotron 3 Ultra(56.4%)都高;SWE-Bench Multilingual 上它拿到 78.5%,SWE-Bench Pro 公开集 59.4%。不到三个月,Poolside 从 M.1 一路连发三款模型,节奏快得不像一家小实验室。

我们在这版模型上做的,不是堆更多智能,而是改进那些通向更强模型的行为:更多验证、更少想当然、不早早宣告胜利,也更持久。 —— Poolside 应用研究联合负责人 Pengming Wang

把权重敞开给人看

最关键的一点是,它是开放权重的,发布当天就挂在 Hugging Face 上,采用 OpenMDW-1.1 许可,连 BF16、FP8、INT4 各种量化版本都给了。模型小到能跑在单台英伟达 DGX Spark 上,也就是说企业可以把高频的编程智能体任务从按量计费的 API 搬到自己掌控的硬件里。

  • 1180 亿总参数、每次只激活 80 亿,上下文窗口 100 万 token
  • 开放权重,发布即上 Hugging Face,可本地跑在单台 DGX Spark
  • 西方近一年来首个有竞争力的开放权重编程模型

西方的开源空窗

Poolside 把这个发布摆进了一个更大的叙事里:过去一年,开发者明显转向能下载、能审查、能在自家基础设施上跑的开放权重系统,而这一类里能打的几乎都来自中国实验室——DeepSeek、通义千问、Kimi、智谱、MiniMax、腾讯混元。西方上一次放出开放权重,还是去年 8 月 OpenAI 的 gpt-oss-120b。联合 CEO Jason Warner 的话很直白:西方需要能信任、能运行、能在其上构建的开放权重模型。

顺带一提,Poolside 把评测的完整轨迹也公开了,算是给开放二字加了点诚意。对政府、国防这类高度监管的客户来说,能自托管意味着敏感代码和数据不出自己的环境,这正是 Poolside 这门生意的根基。

Poolside Laguna S 2.1 模型发布
Poolside 发布的 Laguna S 2.1 开放权重编程模型

📎 原文来源:Poolside 发布 Laguna S 2.1

评论

2 条对“Poolside 把 Laguna S 2.1 甩了出来:西方现在最能打的开放权重编程模型”的回复

  1. MWTAH51627 的头像
    MWTAH51627

    1180亿总参数但每次只激活80亿,这个稀疏架构挺聪明的。小团队真能在本地跑才是关键,现在不少开源模型名字喊得响,真部署起来动辄要几张卡,普通人根本玩不起。

  2. PRFKY42165 的头像
    PRFKY42165

    西方总算有个能打的开放权重编程模型了。不过光看跑分还不够,我更关心它在真实项目里改 bug 稳不稳,等社区真用起来的反馈再说。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注