# 中国AI编程能力跻身全球前二,仅次于Claude

就在今天,Code Arena最新榜单出炉!

Qwen3.7-Max以1541分闯入全球前四,一举超越了GPT-5.5、Gemini 3.5 Flash等一众顶尖模型。

排在它前面的,只剩Claude Opus 4.7和Opus 4.6。

![](https://img.36krcdn.com/hsossms/20260527/v2_a678b8b10a504ae5a0ad16590ef4b6ea@5091053_oswg121379oswg1080oswg609_img_000?x-oss-process=image/format,jpg/interlace,1)
![](https://img.36krcdn.com/hsossms/20260527/v2_365ee5818e1b42f79dfaae481771d14a@5091053_oswg128976oswg1080oswg776_img_000?x-oss-process=image/format,jpg/interlace,1)

换句话说,在全球编程模型的竞技场上,阿里是唯一杀进这张牌桌的中国厂商,仅次于Anthropic,位列第二。

编程实测:Qwen3.7-Max的硬核表现

其实在Code Arena放榜之前,Qwen3.7-Max在海外开发者圈子里已经杀出了名声。Atomic Chat做了一场硬碰硬的对比,让Opus 4.7、GPT-5.5和Qwen3.7-Max同台竞技,任务是写一个能自我训练的俄罗斯方块AI。结果,Qwen3.7-Max不仅只用$1.32的token成本就把Opus 4.7和GPT-5.5都超越了,而且性能还提升了56%。

文章图片

另一位海外开发者选择让Qwen3.7-Max构建了一个宇宙的3D模型,效果足以用震撼形容。

文章图片

在「3D像素风微缩宝塔模型」的生成任务中,Qwen3.7-Max的输出速度和质量同样全面胜出。

![](https://img.36krcdn.com/hsossms/20260527/v2_ef4e55eb4583454883a2186b92120c18@5091053_oswg146096oswg912oswg636_img_000?x-oss-process=image/format,jpg/interlace,1)
![](https://img.36krcdn.com/hsossms/20260527/v2_b46a50634b0849549611b784bebffe7a@5091053_oswg676420oswg1080oswg675_img_000?x-oss-process=image/format,jpg/interlace,1)
![](https://img.36krcdn.com/hsossms/20260527/v2_8dc689e62aaf45d2864b44a91651a574@5091053_oswg675971oswg1080oswg675_img_000?x-oss-process=image/format,jpg/interlace,1)
![](https://img.36krcdn.com/hsossms/20260527/v2_61f4a1c6e89e403cabef48bcb7b69ee6@5091053_oswg271565oswg1080oswg675_img_000?x-oss-process=image/format,jpg/interlace,1)
![](https://img.36krcdn.com/hsossms/20260527/v2_66efaca2af4c492a9859ed389e2ecb4c@5091053_oswg174457oswg1080oswg662_img_000?x-oss-process=image/format,jpg/interlace,1)

开发者Paul Couvert更是盛赞,Qwen3.7-Max接入Hermes Agent和OpenCode之后,基本可以替掉GPT-5.5和Opus 4.7。

文章图片

我们给Qwen3.7-Max安排了一场硬核的「赛车游戏」挑战。一段详细的Prompt丢进去,不一会儿功夫,Qwen3.7-Max直出一个可玩的HTML的文件。

文章图片

第一版有个小bug,A/D转向键左右搞反了。但经过第二轮简单对话微调,一个体验完整的3D赛车游戏就跑了起来。

文章图片

打开的瞬间,说实话,有点被惊到了。4车同台,3圈环形赛道竞速,赛道上散落着100多枚金币,碰到障碍物会减速、失控。赛后成绩面板,排名、用时、金币数、最快单圈,一项不缺。

但真正让人意外的,是两个只有Qwen3.7-Max做到的细节:开始界面和音效处理。

文章图片

再看看其他选手的表现。Gemini 3.5 Flash的画面明显单薄了一档,UI布局也有问题。相比之下,Qwen3.7-Max的处理方式是把关键指标集中到画面中央,更符合玩家视线的自然落点。

![](https://img.36krcdn.com/hsossms/20260527/v2_a49ad72e789749cf87ea4777341ac89d@5091053_oswg157085oswg1080oswg687_img_000?x-oss-process=image/format,jpg/interlace,1)
![](https://img.36krcdn.com/hsossms/20260527/v2_a44cd7e522b74699916c5bc24bbbf09e@5091053_oswg319108oswg1080oswg575_img_000?x-oss-process=image/format,jpg/interlace,1)

Claude Opus 4.6的效果,有点让人一言难尽了。最后是GPT-5.5,画面质感确实比前两家强了不少,但金币被做成了黄色的「甜甜圈」。关键是,Gemini、Claude、ChatGPT三家都修了好几轮bug才跑通全部功能,只有Qwen3.7-Max首轮生成就基本可玩。

Agent时代的「基座」模型与核心技术

Qwen3.7-Max之所以能在最卷的编程擂台上打出如此水平,答案就藏在它的产品定位里。几天前,阿里发布Qwen3.7-Max的时候,给了它一个非常特殊的标签:Agent基座模型。

文章图片

它生来,就是为长时间自主执行任务设计的模型。内测数据显示,在一次自主编程任务中,Qwen3.7-Max连续运行35个小时,执行1158次工具调用。最终生成的代码相较于Triton参考实现,达到了惊人的10倍几何平均加速。

文章图片

更令人震撼的是它的「持久战」能力——在推演进行到第30个小时之后,模型依然保持敏锐,持续挖掘出新的优化空间。全程零上下文退化、零指令漂移、零死循环!

Qwen3.7-Max这波编程跃升,核心可能与两个训练方法的升级有关:第一个是环境扩展,第二个是长程自主执行。在训练中,团队引入了「动态累积生存博弈」框架,让模型在持续变化的模拟环境中做超过一千步的连续决策。

![](https://img.36krcdn.com/hsossms/20260527/v2_167ba8447022482596445062027180ad@5091053_oswg565076oswg1080oswg608_img_000?x-oss-process=image/format,jpg/interlace,1)
![](https://img.36krcdn.com/hsossms/20260527/v2_e757fa766de14a2cb8b9174fa00839de@5091053_oswg205201oswg1080oswg647_img_000?x-oss-process=image/format,jpg/interlace,1)

编程决赛,多了一个搅局者

Code Arena上线至今,考的从来都是硬活,多步推理、工具编排、完整项目交付,全是Agent级的真刀真枪。今天,Qwen3.7-Max凭借着1541分的成绩楔进了第四的位置,卡在Opus 4.6 Thinking和Opus 4.6之间。在这条Claude统治了大半年的赛道上,它给出了自己的回答,中国模型不只是追赶者,也可以是定义者。全球编程模型的竞赛,已经不再是硅谷的独角戏了。


来源:36氪热榜|原文链接