
文章目录Qwen3.8-Max技术解析2.4T参数如何刷新开源编码与协作模型上限一、引言二、参数全景2.4T 背后是 95B 激活2.1 官方确认的核心规格三、编码能力从写函数转向连续十几天做项目3.1 自演化 Harness16 天、265 次提交3.2 从复现论文到改进论文3.3 官方基准并非“每项第一”四、协作能力模型开始为 Harness 和多 Agent 而训练4.1 真实工作强化学习4.2 330 个子 Agent 与 6000 次回测五、工程接入API、Codex 与 Qwen Code六、横向对比Qwen3.8-Max 的真正位置七、总结Qwen3.8-Max技术解析2.4T参数如何刷新开源编码与协作模型上限一、引言亲爱的朋友们创作不容易若对您有帮助的话请点赞收藏加关注哦您的关注是我持续创作的动力谢谢大家有问题请私信或联系邮箱jasonai.fngmail.com2026 年 8 月 3 日阿里通义千问正式上线Qwen3.8-Max。它拥有 2.4 万亿总参数、950 亿激活参数和 100 万 Token 上下文是 Qwen 家族迄今能力最强的模型也是阿里首次宣布开放 Max 级模型权重。但“发布”和“开源”需要分开理解Qwen3.8-Max 已可通过 QwenCloud API 使用官方计划在发布后一周开放权重。因此发布当天更准确的描述是首个确认开源计划的 Qwen Max 级模型已经上线开放权重仍需等待实际仓库、许可证与文件落地。它真正值得关注的也不只是 2.4T。Qwen 团队把训练目标从“回答一道题”推向“在真实工作环境里持续数天把复杂任务变成可验收交付物”。编码、办公、研究、视觉操作与多 Agent 协作被放进了同一套长程任务能力中。二、参数全景2.4T 背后是 95B 激活2.1 官方确认的核心规格维度Qwen3.8-Max发布时间2026 年 8 月 3 日总参数量2.4T即 2.4 万亿单次激活参数95B即 950 亿架构基础延续 Qwen3.5 的 MoE 架构基础上下文窗口1,000,000 Token最大输出官方 Codex/OpenClaw 配置示例标注 65,536 Token输入模态文本、图像当前入口QwenCloud API开放权重官方计划于发布后一周提供重点能力Coding、Work、Research、长程任务、多模态 Agent2.4T 不等于每生成一个 Token 都计算 2.4T 参数。MoE 会根据当前输入选择部分专家单步激活约 95B 参数。这样既保留超大参数池的知识容量又把计算量压到可部署范围。输入 Token │ ▼ 共享注意力与路由器 │ 为不同 Token 选择专家 ▼ 2.4T 总参数的专家池 │ 每步只激活约 95B ▼ 工具调用 / 代码 / 文档 / 多模态输出不过稀疏激活并不等于“小模型成本”。2.4T 权重仍对显存容量、跨卡通信、专家负载均衡和推理框架提出很高要求。权重开放后普通开发者更现实的使用方式仍可能是云 API、量化部署或由推理服务商托管而不是单机满血运行。三、编码能力从写函数转向连续十几天做项目3.1 自演化 Harness16 天、265 次提交Qwen 团队让模型从空目录创建oh-my-cli并运行一个能够吸收用户反馈、自测结果与社区实践的自演化 Harness。截至 2026 年 7 月 30 日官方记录给出的结果是指标结果连续自主运行约 16 天Git commits265Pull Requests127Issues151自动验证Build、Unit Test、E2E、Desktop Lifecycle任务状态ready - leased - active异常可回流修复这类案例的重点不是提交次数而是 Agent Harness 能否闭环需求先被规范成 Issue调度器分配任务Agent 写代码并执行测试监控器发现异常后再把问题送回修复队列。模型能力与工程外壳缺一不可。3.2 从复现论文到改进论文在另一项实验中Qwen3.8-Max 只拿到论文和 GPU没有初始代码。它连续工作约 125 小时写出约 7600 行代码完成 1100 多次操作与 33 轮 GPU 训练先复现论文的六项主要发现再提出并验证 18 个改进思路。最终方案在 AIME24 上从复现基线的 49.58% 提升到 52.29%增加 2.71 个百分点。这个过程呈现了研究 Agent 的基本循环阅读论文 - 搭建数据与训练管线 - 复现实验 ▲ │ └── 分析失败 - 运行验证 - 形成新假设需要注意这些数据来自 Qwen 官方案例不等同于第三方审计。真正的价值在于项目轨迹和代码可供社区检查而不是只看一张跑分图。3.3 官方基准并非“每项第一”Coding Agent 基准Qwen3.7-MaxQwen3.8-Max官方表中最高分Terminal Bench 2.174.586.6GPT-5.6 Sol88.8SWE-bench Pro60.667.7Fable 580.0DeepSWE 1.121.656.6GPT-5.6 Sol73.0FrontierSWE40.773.5Fable 588.8这张表给“开源最强”加了一条必要限定Qwen3.8-Max 在官方测试中实现了大幅代际提升并进入前沿梯队但没有包揽所有编码榜首。它的竞争力更集中在开放权重计划、超长上下文、多 Harness 适配和长程交付能力的组合。四、协作能力模型开始为 Harness 和多 Agent 而训练4.1 真实工作强化学习Qwen3.8-Max 的协作能力来自三条同时扩展的轴扩展轴从什么走向什么解决的问题Task单任务 - 多任务 - 多日任务模型能否持续推进Workspace单文件 - 多文件 - 异构目录模型能否理解真实项目Harness单一工具 - 多版本、多技能、多客户端模型能否跨工作台稳定执行官方说明提到训练覆盖 QwenWork、Claude Code、Codex、OpenClaw 和 Hermes 等 Harness并使用统一奖励系统同时评估代码执行、文本质量、渲染后的视觉结果和 Agent 检查结果。这意味着“协作模型”不是一句人格设定。模型需要学会拆任务、把任务变成可执行工作流、调度子 Agent、根据真实工具反馈改计划并对最终产物负责。4.2 330 个子 Agent 与 6000 次回测在量化研究案例中Qwen3.8-Max 将六类因子描述拆成约 300 个研究方向调度约 330 个子 Agent完成约 6000 次回测并在运行中根据结果修改工作流。主 Agent定义目标、约束、验收标准 ├── 子 Agent 组 A动量因子 ├── 子 Agent 组 B价值因子 ├── 子 Agent 组 C质量与投资因子 ├── 子 Agent 组 D低风险与情绪因子 └── 验证层回测、去冗余、多种子验证、汇总这类大规模协作的瓶颈会从“模型聪不聪明”转向“任务是否独立、状态是否持久、结果是否可验证”。没有数据隔离、停止条件和统一验收更多子 Agent 只会更快地产生更多噪声。五、工程接入API、Codex 与 Qwen CodeQwen 官方给出了 QwenCloud、Claude Code、Codex、Qoder CLI、Qwen Code 与 OpenClaw 等接入方式。以 OpenAI 兼容接口为例fromopenaiimportOpenAI clientOpenAI(api_keyyour_qwencloud_api_key,base_urlhttps://dashscope-intl.aliyuncs.com/compatible-mode/v1,)responseclient.responses.create(modelqwen3.8-max,inputInspect this repository, propose a plan, implement the fix, and run tests.,)print(response.output_text)生产接入不应只验证“API 能返回文本”还要观察检查项原因工具调用兼容性不同 Harness 对 Responses、流式事件和并行工具调用的实现不同长上下文有效性100 万窗口不代表所有信息都能被同等准确地检索费用与速率限制长程 Agent 会产生大量输入回放和工具结果中断与恢复多日任务必须保存检查点不能依赖一个永不掉线的会话权限与沙盒自主时间越长错误写入、凭据泄露和资源失控风险越高许可证权重开放后仍要确认具体许可证和商用边界六、横向对比Qwen3.8-Max 的真正位置维度Qwen3.8-Max顶级闭源模型中小型开源模型权重可得性已宣布一周后开放发布日尚未落地通常不开放已可下载规模2.4T 总参数、95B 激活参数通常不披露更容易本地部署编码前沿梯队部分公开基准仍落后领先闭源模型单项能力强、生态成熟成本低、可定制长程协作官方重点强调多日任务和多 Harness产品化与工具链较成熟取决于外部 Agent 框架上下文100 万 Token因模型而异通常更短私有化权重开放后具备可能性但部署门槛高主要通过 API最容易落地验证状态官方案例丰富仍需更多独立复测第三方评测较多社区可直接审计Qwen3.8-Max 的生态位不是“用一个榜单证明所有能力第一”而是把接近闭源前沿的编码与协作能力放进一个计划开放权重、可跨 Harness 使用的 Max 级模型中。对企业而言这提供了 API 托管与未来私有化之间的选择空间。七、总结维度核心判断参数2.4T 总参数、95B 激活体现超大规模 MoE 路线编码从函数生成跨到多日项目、自测、研究复现与持续修复协作训练目标覆盖多 Harness、多 Agent 和真实交付物开源是首个宣布开放权重的 Qwen Max 级模型但发布日权重尚未落地风险官方案例需独立复核部署成本、许可证和长程权限仍待验证Qwen3.8-Max 代表的变化是开源模型的竞争单位正在从“一个权重文件”升级为“模型 Harness 工具 验证循环”。2.4T 决定能力上限95B 激活决定计算现实而能否在十几天后仍保持目标、恢复错误并交付可用结果才决定它是否真的适合下一代 Agent 工作流。参考资料Qwen3.8-Max: A New Bar for Coding and Cowork — Qwen Team2026-08-03qwen-code-dev-bot/oh-my-cli — GitHubQwen3.8-Max 正式发布2.4T 规模自主编程 16 天完成 Hermes Agent — InfoQ