# 中国AI编程能力跻身全球前二,仅次于Claude
就在今天,Code Arena最新榜单出炉!
Qwen3.7-Max以1541分闯入全球前四,一举超越了GPT-5.5、Gemini 3.5 Flash等一众顶尖模型。
排在它前面的,只剩Claude Opus 4.7和Opus 4.6。


换句话说,在全球编程模型的竞技场上,阿里是唯一杀进这张牌桌的中国厂商,仅次于Anthropic,位列第二。
编程实测:Qwen3.7-Max的硬核表现
其实在Code Arena放榜之前,Qwen3.7-Max在海外开发者圈子里已经杀出了名声。Atomic Chat做了一场硬碰硬的对比,让Opus 4.7、GPT-5.5和Qwen3.7-Max同台竞技,任务是写一个能自我训练的俄罗斯方块AI。结果,Qwen3.7-Max不仅只用$1.32的token成本就把Opus 4.7和GPT-5.5都超越了,而且性能还提升了56%。
另一位海外开发者选择让Qwen3.7-Max构建了一个宇宙的3D模型,效果足以用震撼形容。
在「3D像素风微缩宝塔模型」的生成任务中,Qwen3.7-Max的输出速度和质量同样全面胜出。





开发者Paul Couvert更是盛赞,Qwen3.7-Max接入Hermes Agent和OpenCode之后,基本可以替掉GPT-5.5和Opus 4.7。
我们给Qwen3.7-Max安排了一场硬核的「赛车游戏」挑战。一段详细的Prompt丢进去,不一会儿功夫,Qwen3.7-Max直出一个可玩的HTML的文件。
第一版有个小bug,A/D转向键左右搞反了。但经过第二轮简单对话微调,一个体验完整的3D赛车游戏就跑了起来。
打开的瞬间,说实话,有点被惊到了。4车同台,3圈环形赛道竞速,赛道上散落着100多枚金币,碰到障碍物会减速、失控。赛后成绩面板,排名、用时、金币数、最快单圈,一项不缺。
但真正让人意外的,是两个只有Qwen3.7-Max做到的细节:开始界面和音效处理。
再看看其他选手的表现。Gemini 3.5 Flash的画面明显单薄了一档,UI布局也有问题。相比之下,Qwen3.7-Max的处理方式是把关键指标集中到画面中央,更符合玩家视线的自然落点。


Claude Opus 4.6的效果,有点让人一言难尽了。最后是GPT-5.5,画面质感确实比前两家强了不少,但金币被做成了黄色的「甜甜圈」。关键是,Gemini、Claude、ChatGPT三家都修了好几轮bug才跑通全部功能,只有Qwen3.7-Max首轮生成就基本可玩。
Agent时代的「基座」模型与核心技术
Qwen3.7-Max之所以能在最卷的编程擂台上打出如此水平,答案就藏在它的产品定位里。几天前,阿里发布Qwen3.7-Max的时候,给了它一个非常特殊的标签:Agent基座模型。
它生来,就是为长时间自主执行任务设计的模型。内测数据显示,在一次自主编程任务中,Qwen3.7-Max连续运行35个小时,执行1158次工具调用。最终生成的代码相较于Triton参考实现,达到了惊人的10倍几何平均加速。
更令人震撼的是它的「持久战」能力——在推演进行到第30个小时之后,模型依然保持敏锐,持续挖掘出新的优化空间。全程零上下文退化、零指令漂移、零死循环!
Qwen3.7-Max这波编程跃升,核心可能与两个训练方法的升级有关:第一个是环境扩展,第二个是长程自主执行。在训练中,团队引入了「动态累积生存博弈」框架,让模型在持续变化的模拟环境中做超过一千步的连续决策。


编程决赛,多了一个搅局者
Code Arena上线至今,考的从来都是硬活,多步推理、工具编排、完整项目交付,全是Agent级的真刀真枪。今天,Qwen3.7-Max凭借着1541分的成绩楔进了第四的位置,卡在Opus 4.6 Thinking和Opus 4.6之间。在这条Claude统治了大半年的赛道上,它给出了自己的回答,中国模型不只是追赶者,也可以是定义者。全球编程模型的竞赛,已经不再是硅谷的独角戏了。
来源:36氪热榜|原文链接