# Nous Research发布开源编程模型NousCoder-14B

文章图片

由加密风投公司Paradigm支持的开源人工智能初创公司Nous Research,于周一发布了一款全新的竞争性编程模型。据称,该模型仅使用48块英伟达最新的B200图形处理器,在四天内训练完成,其性能足以媲美甚至超越多个大型专有系统。

这款名为NousCoder-14B的模型是AI编程助手领域的新成员。它的发布正值一个关键时刻:竞争对手Anthropic推出的智能编程工具Claude Code自元旦以来在社交媒体上引发了热烈讨论,开发者们对其能力赞不绝口。这些同步发展的动态凸显了AI辅助软件开发进化的速度,以及大大小小的公司为了争夺这一被视为软件编写基础技术的领域所展开的激烈竞争。

根据Nous Research随发布一同公布的技术报告,NousCoder-14B在LiveCodeBench v6(一项针对2024年8月至2025年5月间发布的竞争性编程问题进行测试的标准化评估)上达到了67.87%的准确率。这一数据较其基础模型——阿里巴巴的Qwen3-14B——提升了7.08个百分点。

追求透明度与可复现的开源路径

NousCoder-14B与许多竞争对手发布的产品不同之处在于其彻底的开放性。Nous Research不仅发布了模型权重,还公开了完整的强化学习环境、基准测试套件以及基于公司Atropos框架构建的训练工具,这使得任何拥有足够算力的研究人员都能复现或扩展这项工作。

该模型由Nous Research驻场研究员、前竞争性程序员Joe Li训练。Li的技术报告揭示了一个意想不到的个人维度:他将模型的改进轨迹与自己在Codeforces(一个根据竞赛表现评级的竞争性编程平台)上的成长历程进行了对比。根据将LiveCodeBench分数映射到Codeforces评级的粗略估算,Li计算出NousCoder-14B的进步——从大约1600-1750的评级范围提升至2100-2200——相当于他本人在14岁到16岁之间近两年持续练习所取得的跨越。而该模型仅用了四天就完成了这一过程。

不过,Li也迅速指出了一个关于AI效率的重要警告:他在那两年里解决了大约1000个问题,而模型则需要24000个。至少在目前,人类仍然是样本效率高得多的学习者。

强化学习系统与24000个编程问题的训练

NousCoder-14B的训练过程展示了研究人员如何利用强化学习提升AI推理能力的复杂技术。该方法依赖于所谓的“可验证奖励”——即模型生成代码解决方案,这些方案在测试用例中运行,模型会收到一个简单的二进制信号:正确或错误。这种反馈循环虽然概念简单,但在大规模执行时需要强大的基础设施支持。

Nous Research使用了云计算平台Modal来并行运行沙盒代码执行。每个训练问题平均包含数百个测试用例,系统必须验证生成的代码是否能在时间(15秒)和内存(4GB)限制内产生正确输出。训练采用了名为DAPO(动态采样策略优化)的技术,研究人员发现其在实验中表现优于其他替代方案。此外,训练流水线将推理和验证重叠进行,即模型一旦生成解决方案,就会立即开始处理下一个问题,而前一个解决方案正在被检查。这种流水线处理与多模型实例并行工作的异步训练相结合,最大限度地提高了昂贵GPU集群的硬件利用率。

高质量训练数据的瓶颈与未来挑战

在Li的技术报告中,隐藏着一个对AI开发未来具有重大影响的发现:NousCoder-14B的训练数据集涵盖了“标准化数据集格式中所有现成、可验证的竞争性编程问题的很大一部分”。换句话说,对于这个特定领域,研究人员正在接近高质量训练数据的极限。

Li写道:“互联网上竞争性编程问题的总数大致处于同一个数量级。”这表明在竞争性编程领域,我们已经接近了高质量数据的极限。这一观察呼应了整个AI行业对数据限制日益增长的担忧。虽然算力继续按照既定的经济和工程原则扩展,但正如Li所言,训练数据正变得“越来越有限”。

他总结道:“未来需要进行的一些最重要的研究似乎将集中在合成数据生成以及数据高效算法和架构领域。”对于竞争性编程而言,这一挑战尤为严峻,因为该领域需要具有已知正确答案且能自动验证的问题。与自然语言任务不同,代码要么能运行,要么不能——这使得合成数据生成变得相当困难。


来源:VentureBeat AI|原文链接