Cognition发布的FrontierCode基准测试指出,当前主流AI编程模型生成的代码在真实维护者审核下的通过率极低,揭示了现有AI编程评估体系的局限性。


来源:X:阿易 AI Notes (@AYi_AInotes)|原文链接