![]()
今天,千问正式发布 Qwen3.7-Max ——面向智能体时代的新一代旗舰模型,即将通过 API 提供服务。Qwen3.7-Max 致力于成为全能的智能体基座——无论是编写和调试代码、自动化办公流程,还是在跨越数百乃至数千步的长周期任务中持续自主执行,都能胜任。
Qwen3.7-Max 的核心优势在于智能体能力的广度与深度:编程方面,从前端原型开发到复杂的多文件工程均能驾驭;办公与生产力方面,通过 MCP 集成和多智能体协作实现工作流自动化;长周期自主执行方面,在一项长达 35 小时、超过 1000 次工具调用的全自主内核优化实验中保持了连贯推理,充分验证了其持久稳定的执行能力;此外,无论部署在 Claude Code、OpenClaw、Qwen Code 还是其他框架下,都能稳定发挥出色的跨框架泛化能力。
Qwen3.7-Max — 即将通过阿里云百炼提供服务:
前沿编程智能体:从前端原型到复杂软件工程
办公生产力与工作流自动化,支持 MCP 集成和多智能体协作
持续稳定的长周期自主执行能力
跨多种智能体框架的泛化能力
您可以通过 阿里云百炼 API 调用(即将上线)。
模型表现
![]()
在编程智能体方面,Qwen3.7-Max 在 SWE-Pro(60.6)、SWE-Multilingual(78.3)、SciCode(53.5)和 QwenSVG(1608)上均取得领先表现。在 Terminal Bench 2.0-Terminus(69.7)上超越 DS-V4-Pro Max(67.9)。在 SWE-Verified(80.4)上与 Opus-4.6 Max(80.8)和 DS-V4-Pro Max(80.6)表现相当。
在通用智能体方面,提升更为显著。Qwen3.7-Max 在 MCP-Mark(60.8 vs. GLM-5.1 的 57.5)、MCP-Atlas(76.4 vs. Opus-4.6 的 75.8)和 Skillbench(59.2 vs. K2.6 的 56.2)上表现突出,并在 Kernel Bench L3(1.98 倍中位数加速,96% 加速率)上展示了强大的 GPU 内核优化能力。在 BFCL-V4(75.0)、Qwenclaw(64.3)和 ClawEval(65.2)上同样表现出色,紧追 Opus-4.6 Max。在办公自动化基准 SpreadSheetBench-v1 上得分 87.0,处于顶尖水平。
在推理方面,Qwen3.7-Max 在 GPQA Diamond(92.4 vs. Opus-4.6 的 91.3)、HLE(41.4 vs. Opus-4.6 的 40.0)、HMMT 2026 Feb(97.1 vs. Opus-4.6 的 96.2)、IMOAnswerBench(90.0 vs. DS-V4-Pro 的 89.8)和 Apex(44.5 vs. DS-V4-Pro 的 38.3)上均取得领先成绩,在高难度推理基准上展现了强大实力。
在通用能力与多语言方面,Qwen3.7-Max 在 IFBench(79.1 vs. DS-V4-Pro 的 77.0)上表现突出,展示了精准的指令遵循能力。在 WMT24++(85.8)和 MAXIFE(89.2)上同样领先,表明其多语言理解和翻译质量处于一流水平。在 SuperGPQA(73.6)和 QwenWorldBench(57.3)上同样表现出色。
![]()
值得强调的是,上述评测分数来自多种不同的智能体框架。Qwen3.7-Max 并非针对某一特定框架优化,而是在 Claude Code、OpenClaw、Qwen Code 和各类自定义工具使用框架下都能稳定发挥,是各类智能体系统的可靠底座。
生产力助手
面向真实生产力场景,Qwen3.7-Max 将成为您的深度协作者。依托强大的智能体能力,全面重塑专业工作流:海量信息的全面研读与整合、复杂数据的深度分析与建模、出版级文档与可视化生成——精准承接高复杂度、高强度的企业级任务。
Qwen3.7-Max 原生适配主流智能体框架。面向长链路交付任务,支持长达数小时的自主规划与运行,通过上千次工具调用,数十轮版本迭代,持续提升交付物质量。以往需专业团队耗时一至两周的复杂项目,现由 Qwen3.7-Max 驱动的智能体即可在数小时内完成端到端交付闭环,推动生产力实现真实跃升。
智能体扩展
在 Qwen3.5 中引入的环境扩展方法基础上,Qwen3.7 进一步大幅扩展了智能体训练环境的质量与多样性。正如语言模型从多样化的预训练文本中获得泛化能力,我们发现智能体能力同样可以从多样化的训练环境中实现泛化。
如下图所示,这种环境扩展带来了清晰且稳定的性能提升轨迹,Qwen3.7-Max 在综合排名中位列前三,接近 Claude-4.6-Opus-Max 的水平。值得注意的是,我们评测中所有基准测试所涉及的环境均为训练中从未出现过的全新领域外环境。
我们还观察到扩展行为中一个显著的可预测性:任意基准子集上的性能增益高度一致,可以可靠地预测其余基准或整体平均值的相对增益,表明环境扩展驱动的是真正的能力泛化,而非针对特定基准的提升。关于扩展动态和方法论的进一步分析将在即将发布的技术报告中详细介绍。
![]()
跨框架泛化能力
我们的 Rollout 环境基础设施将每个训练实例解耦为三个正交组件——任务(Task)、运行框架(Harness)与验证器(Verifier),这些组件可自由重组。我们兼容多种运行框架及其迭代版本,并将环境立足于真实场景而非合成替代品。这种解耦设计实现了组合式扩展:同一任务能以极低的边际成本,与不同类型、不同版本的框架及验证器相匹配。更关键的是,它赋能了跨框架与跨验证器的强化学习(RL)训练——使模型在多变的框架配置下处理同源任务,从而迫使其学习具备泛化能力的解题策略,而非依赖特定框架的捷径。在 QwenClawBench 与 CoWorkBench 评测中,无论评估时使用何种运行框架,Qwen3.7-Max 均展现出强劲且一致的性能,显著超越 Qwen3.6 系列模型,证实了该模型已真正掌握了解决任务的能力,而非过拟合特定框架。
![]()
Qwen3.7-Max 可以无缝集成到主流智能体框架和编程助手中,包括Claude Code、OpenClaw、Qwen Code等。详细代码请访问技术博客查看。
实战1:35小时自主进化
Extend Attention 是 SGLang 中一个生产级的变长多头注意力算子。在当前测试场景中,它需要在最多 32K 条前缀 KV-cache 上计算新生成 token 的注意力分数——是 LLM 推理服务中一个访存密集、延迟敏感的关键 kernel。参考实现是 SGLang 官方的 Triton 实现。
我们让 Qwen3.7-Max 在配备 平头哥 真武 M890 PPUs 的 ECS 上优化该 kernel——这是一个训练过程中从未见过的硬件平台。模型没有该架构的性能分析数据、硬件文档或示例 kernel。它的起点仅有一个任务描述、一个现有 SGLang 的实现和一个评估脚本。
在随后约 35 小时的连续自主执行中,模型共产出 432 次 kernel 评估,跨越 1158 次工具调用。它完全自主地编写、编译、性能分a析并迭代改进 Extend Attention Kernel——诊断编译错误、修复正确性 bug、通过运行时测量定位性能瓶颈,并多次重新设计 kernel 架构。
最终结果:在多个工作负载上测量得出,相对 Triton 参考实现的几何平均加速比为 10.0x。优化轨迹显示,模型在最初几小时之后仍然持续取得实质性进展:在 30+ 小时后仍在发现有意义的改进,证明长程自主优化不仅可行,而且有效。
![]()
优化轨迹中的关键结构性跃迁
Split-K 并行化(0.33x → 2.58x,~2 小时):初始 kernel 仅启动 8 个线程块(4 token × 2 KV head × 1 batch),36 个 SM 大部分空闲。模型引入 Split-K 分区——将前缀 KV-cache 沿 token 维度划分到每个 query 的多个线程块——并实现了基于在线 softmax 重缩放的独立归约 kernel 来合并部分结果。
启动与分配开销消除(2.58x → 5.37x,~2.5 小时):模型系统性地移除了主机-设备同步开销:将逐次调用的cudaMalloc/cudaFree 替换为预分配的 torch::empty tensor,通过使用 tensor 元数据消除了用于查询前缀长度的同步 cudaMemcpy 调用,并将内循环 2 倍展开以摊薄循环控制开销并提升指令级并行度。
工作负载自适应 split 调优(5.37x → 6.85x,~3 小时):从固定的 split 除数演进为按工作负载规模自适应的启发式策略——对较小输入采用更激进的分割,并为每个工作负载规模调优 split 数量,以最大化 36-SM 架构上的 SM wave 占用率。
归约与批处理优化(6.85x → 8.50x,3–25 小时):消除共享内存屏障,改用寄存器直接加载 K/V 以提高 SM 占用率、使用持久化静态 tensor 存储部分结果以避免逐次调用的分配、对小输入采用更激进的 split 策略、以批量化 softmax 更新(4 次 expf 调用替代 6 次)降低逐 token 开销。Q 向量预乘 sm_scale 以消除 warp 归约后每次迭代的浮点乘法。
MTP γ=4 特化 kernel(8.50x → 10.0x,32–35 小时):最重要的架构重新设计——重构 kernel 以在每个线程块中同时处理全部 4 个 query token,跨 query 共享 K/V 加载以分摊访存开销。结合 __ldg 只读缓存内建函数处理 V 缓冲区加载、多 query 批量化合并注意力输出结果归约、寄存器压力优化以及重新调优的 split 策略,在运行的最后几小时内贡献了约 1.2 倍的最终提升。
我们也在相同条件下用多个其他模型运行了同一任务。GLM 5.1 达到 7.3x;Kimi K2.6 达到 5.0x;DeepSeek V4 Pro 达到 3.3x;Qwen3.6-Plus 达到 1.1x。提前停止的模型是因为连续五轮未发出任何工具调用——模型判断自身已无法继续取得进展,主动结束了任务。
除了在 PPU 上取得较好 kernel 生成结果,Qwen3.7-Max 在多种 NVIDIA GPU 上也能生成高质量生产级kernel,例如在 KernelBench L3 中 Qwen3.7-Max 能够对 96% 的场景写出有加速的 Kernel,而 Opus-4.6 为 98%, GLM 5.1 为 78%;Kimi K2.6 为 80%;DeepSeek V4 Pro 为 54%,Qwen3.6-Plus 为 48%。
这一结果凸显了 Qwen3.7-Max 作为长程自主智能体基础模型的两个特性:长程持续推理能力——模型在超过一千次工具调用中保持连贯的优化策略,不丢失上下文、不退化;以及强大的 In-context 泛化能力——能为从未见过的架构生成有竞争力的 kernel,依靠运行时反馈而非记忆中的硬件知识。
实战2:长程训练中的奖励作弊自主监控
我们将 Qwen3.7-Max 接入软件工程任务(SWE)的强化学习(RL)训练监控,成功构建了奖励作弊(Reward Hacking)的自我监测与规则自进化体系。在逾 80 小时的 RL 实验中,模型自主拉取训练轨迹并进行回放,累计执行超万次调用,系统归纳候选作弊模式(如通过各种方式访问 GitHub 的标准答案),并对检测规则进行验证、反例挖掘与迭代优化。
最终,Qwen3.7-Max 实现了规则的多轮自进化,新增 13 条启发式规则,精准识别出 1,618 个作弊案例,在保障我们 RL 实验奖励稳定性的同时,实现了模型作为软件工程智能体的持续自我提升。
![]()
实战3:企业管理中的长程规划与执行
我们在动态累积生存博弈框架下扩展了训练任务的时序复杂度,专项强化长程规划与执行能力,提升了智能体在超千步的连续决策中的策略一致性,包括持续构建假设、从反馈中动态调整策略、累积经验与记忆,并在漫长的时间跨度内维持稳定的执行节奏,不受上下文腐化和指令漂移问题的影响。
以模拟经营创业公司的 YC-Bench 为例,该基准测试模拟了跨越一整年的真实商业环境,涵盖数百轮决策涉及员工管理、合同筛选、恶意客户识别,以及在人力成本持续攀升中守住盈利底线。Qwen3.7-Max 的营收高达 2.08M 美元,是 Qwen3.6-Plus(1.05M 美元)的 2 倍,是 Qwen3.5-Plus(352K 美元)的 5.9 倍,累计完成任务 237 项。更值得关注的是,它展现出了跨上下文窗口的策略进化能力:主动探索客户、识别并拉黑恶意陷阱、聚焦可靠收入来源、从中期危机中自主恢复,并最终收敛至稳定的高效执行循环。
![]()
来吧,展示!
前端编程
Qwen3.7-Max 可以通过一条 prompt 生成丰富的交互式 Web 应用——包括 Three.js 3D 场景、Canvas 动画和完整页面布局。
演示1:Gesture Controlled Particles System
Prompt:
用Three.js创建一个实时交互的3D粒子系统网页。要求:1. 通过摄像头检测双手张合控制粒子群的收缩与扩散;2. 当手势为1时,粒子组成文字(hello, world),当手势为2时组成文字 (I’am Qwen);3.粒子需实时响应手势变化;4. 用html实现
Qwen3.7-Max:
演示2:
Fashion Magazine Page with Video-Generation
Prompt:
Build a “MONOLITH” luxury fashion magazine cover as an interactive web page. You have access to a video generation script at scripts/dashscope-video-gen.sh that can generate AI videos.
STEP 1 — Generate 3 custom videos by running these commands: bash scripts/dashscope-video-gen.sh “Extreme close-up cinematic portrait of a high fashion model, dramatic side lighting, black and white with crimson red lipstick, wind blowing hair slowly, Vogue cover aesthetic, shallow depth of field” assets/demo-videos/monolith-hero.mp4 9:16 5
bash scripts/dashscope-video-gen.sh “Cinematic slow-motion haute couture fashion runway walk, dramatic chiaroscuro spotlight, silhouette emerging from darkness, editorial magazine film look with grain” assets/demo-videos/monolith-knockout.mp4 9:16 5
bash scripts/dashscope-video-gen.sh “Overhead cinematic shot of luxury fashion magazine open pages being slowly turned, golden jewelry and perfume bottle on black marble, dramatic spotlight, editorial still life” assets/demo-videos/monolith-editorial.mp4 16:9 5
STEP 2 — Build the web page using the generated videos: HERO: Full-viewport portrait video (monolith-hero.mp4 as muted autoplay looping background) with duotone overlay. Knockout headline “MONOLITH” revealing monolith-knockout.mp4 playing through transparent text. EDITORIAL: Below-fold split layout with monolith-editorial.mp4 in a magazine-page container with page-curl hover effect, and pull-quotes with architectural line accents. DESIGN: Monochrome + crimson accent, grain overlay, minimal masthead, scroll-triggered animations, sticky top bar with issue number and date.
Do not ask follow-up questions. Do not wait for user input. Pick reasonable defaults and complete the artifact. Write all code to a single index.html file. Run the video generation commands first, wait for them to complete, then build the HTML.
Qwen3.7-Max:
演示3:Dragon Boat
Prompt:
生成一段 SVG 代码,用于表现一幅充满动感的龙舟竞渡矢量插画。画面的主体是一艘细长的龙舟,船上坐满了划手,他们身穿鲜亮的黄绿色上衣和白色帽子,整齐划一地挥动船桨。船桨切入浑浊的棕色河水中,激起白色水花。船尾站着一名指挥者,穿着色彩鲜艳的短裤;船头飘扬着一面蓝色旗帜,上面有黄色数字“15”。背景中,一座巨大的灰色混凝土桥横跨河面,远处在淡蓝色天空下可见朦胧的城市建筑和绿色树木。整体风格采用现代扁平化设计,色彩鲜明、轮廓清晰。请添加流畅的动画,以表现以下动态效果:划手整齐同步的划桨动作、龙舟轻微的上下起伏、旗帜随风飘动,以及水面的涟漪,从而营造出紧张激烈、充满能量的竞赛氛围。
Qwen3.7-Max:
办公助手
Qwen3.7-Max 可以通过工具集成充当智能办公助手。在以下示例中,它读取一份高校学位论文格式规范,自动修复一篇排版混乱的论文——包括页面布局、标题样式、字体字号、页边距、目录生成和参考文献格式——全程通过 office-cli 工具自主完成。(注:示例论文内容为大模型编造,仅用于演示)
Thesis Formatting with Office Tools
Prompt:
请完成一个论文格式修复任务。 ## 输入文件 - 格式规范说明文件: 研究生学位论文格式规范.docx - 格式混乱版论文(待修复): 论文_格式混乱版.docx ## 输出文件 - 论文_格式修复版.docx
Qwen3.7-Max:
![]()
(可上下滑动查看)
大模型驱动的物理世界智能体
Qwen3.7-Max 现已能够通过工具调用操控机器狗 —— 在物理环境中执行物理理解、规划、记忆与决策,Harness 由我们自研的导航基础模型 Qwen-RobotNav,具身智能体系统 Qwen-RobotClaw 驱动,以及基于Qwen-Plus构建的视觉工具提供支持。在下方演示视频中,左侧面板展示了智能体在物理世界中长达 20 分钟的工具调用交互流程;中间画面则呈现了四足机器人在行进轨迹中的第一人称视角。
总结
Qwen3.7-Max 是我们迄今最全面、最强大的智能体模型。从编程和办公自动化到长周期自主任务,它将前沿推理能力、跨框架泛化性和持续高效执行有机融合,为构建下一代 AI 智能体提供了坚实的基础。我们将持续优化模型,欢迎社区反馈,期待看到大家的创造,敬请关注!
![]()
特别声明:以上内容(如有图片或视频亦包括在内)为自媒体平台“网易号”用户上传并发布,本平台仅提供信息存储服务。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.