32B 模型横扫 SWE 任务,这款代码智能体模型有点东西
发布时间:2025-07-16 编辑:游乐网
(PHP中文网报道)2025年不仅是智能体全面爆发的一年,也是AI在软件工程领域开启新纪元的起点。以人工智能为核心的自动化开发正以前所未有的速度重塑传统开发模式。
昆仑万维今日正式发布全球首个开源代码智能体Skywork-SWE-32B,该模型通过“轻量化参数”实现仓库级别的修复逻辑重构。
这是一场开源生态对抗闭源霸权的重要突破——Skywork-SWE-32B使得企业仅需消费级显卡即可部署AI工程师,大幅降低使用门槛。
在SWE-bench-Verified测试中(基于OpenHands代码辅助平台),该模型将修复准确率提升至47.0%,不仅超越了所有参数规模小于32B的开源模型,更逼近闭源模型Claude v3.7(56.0%)的性能极限。
摆脱闭源限制后,AI的角色也从“辅助工具”跃迁为“协作伙伴”,标志着软件工程真正迈入由智能体驱动的新时代。
目前,开发者已经可以在Hugging Face平台上下载这位“开源工程师”。
技术报告:https://www.php.cn/link/bb8054b490d695da02c573c665824b88
博客地址:https://www.php.cn/link/98be175f18ff12118f056c7e448ade23
模型权重:https://www.php.cn/link/1f3ecb87f576752202975d3e0b868bdc
01
SWE任务:对智能体能力的终极考验
对于有经验的程序员来说,软件工程(Software Engineering, SWE)任务远比一般代码生成更具挑战性。将大型语言模型作为智能体应用于真实软件工程项目,并非只是简单地执行“写代码”的指令。
即便是人类开发者,在面对陌生项目时,首次Bug修复成功率也不足70%。
如今,把一个SWE任务交给智能体模型,就相当于要求一位“AI工程师”在极短时间内快速适应新团队、接手庞大且不熟悉的遗留系统,准确理解一份描述模糊的Bug报告,找出根本问题,设计出符合团队规范且不影响其他功能的修复方案,并一次性提交正确的代码修改。
这样的“AI工程师”堪称稀缺资源。
远超传统代码生成的技术门槛
与传统意义上的代码生成相比,SWE任务对模型能力的要求可谓天差地别。任何一个环节的能力短板,都可能导致智能体在面对复杂工程现实时无从下手。
相关阅读
MORE
+- Excel怎么设置页眉页脚 Excel页眉页脚的设置步骤 07-17 Perplexity AI如何实现本地缓存 Perplexity AI离线查询方案 07-17
- Claude适合新手写论文用吗 写作辅助功能和引用管理说明 07-17 腾讯文档如何恢复历史版本 腾讯文档版本回退操作指南 07-17
- MicrosoftOffice怎么进行文档批注 07-17 腾讯新闻怎么发布自己的作品?腾讯新闻发布自己的作品的教程 07-17
- 华硕电脑USB-C接口功能及扩展设备连接教程 07-17 如何让豆包AI生成Python机器学习模型 07-17
- Gemini是否可以接入微信小程序 对接流程和兼容性说明 07-17 如何制作多系统启动U盘,实现不同系统自由切换? 07-17
- 囧次元动漫在线入口免费观看 囧次元动漫最新版免费观看入口 07-17 Memo AI 官方版 Memo AI官方下载教程 07-17
- mac怎么升级系统os11 07-17 mac录屏怎么带系统声音 07-17
- 双系统怎么删除一个mac 07-17 惠普笔记本电脑音频驱动安装及故障修复教程 07-17
- 系统安装盘制作失败如何排查问题及常见错误解决方案 07-17 DeepSeek写作助手使用详解,如何高效生成长文内容 07-17