OpenAI新开源GPT OSS实测,o1和GPT-4o已过时
OpenAI发布开源gpt-oss系列,含120B和20B两个版本,采用MoE架构,支持128k上下文,性能接近o4-mini与o3-mini,在工具调用与推理中超越o1和GPT-4o。本地部署需16GB内存,在线使用成本低廉。实测编程能力欠佳,数学推理优秀,复杂逻辑推理表现不理想。
欢迎查阅这份关于 OpenAI 全新开源模型 GPT-OSS 的完整教程。本文将从技术细节、部署方式到实际性能表现,为您提供一份硬核且易于理解的深度解析。
01|核心技术细节:gpt-oss 如何实现性能突破?
OpenAI 终于发布了自 GPT-2 以来首个开源的大语言模型——gpt-oss 系列。该系列包含两个版本:gpt-oss-120b 和 gpt-oss-20b,在性能方面展现了令人瞩目的实力。
模型性能与硬件门槛
- gpt-oss-120b:在核心推理基准测试中,成绩接近 OpenAI o4-mini,且仅需单张 80GB GPU 即可运行。
- gpt-oss-20b:在常见基准测试中接近 o3-mini 的水平,而运行内存需求仅为 16GB。
下图展示了各模型在多项基准测试中的表现对比(柱状图),从分数来看,gpt-oss-20b 已全面超越当前市面上主流的 7B、8B、14B 等开源模型。
为了让数据更加直观,以下是朋友整理的详细对比表格:
此外,这两款模型在 工具调用(搜索与 Python 代码执行)、少样本函数调用、思维链推理(Tau-Bench)以及 HealthBench 医疗基准测试中,均超过了 OpenAI 之前的 o1 与 GPT-4o 模型。
模型架构与训练细节
gpt-oss 系列均采用 专家混合系统(MoE) 的 Transformer 架构:
- gpt-oss-120b:每个 token 激活的参数量为 5.1B。
- gpt-oss-20b:每个 token 激活的参数量为 3.6B。
两个模型均支持 128k 上下文,并使用了与 GPT-3 同款的注意力模式(alternating dense and locally banded sparse attention patterns)。为了提升推理与内存效率,模型采用了 8 分组的多查询注意力机制。
在训练数据方面,模型主要使用英文纯文本,重点涵盖 STEM(科学、技术、工程、数学)、编程和通用知识。同时,OpenAI 还开源了配套的 Tokenizer(分词器)"o200k_harmony",该分词器是 o4-mini 与 gpt-4o 分词器的超集。
后训练阶段采用了与 o4-mini 相同的流程,包括 监督微调(SFT) 和 强化学习(RL)。与 API 版本的 OpenAI o 系列推理模型一样,gpt-oss 支持 三个推理级别(低、中、高),用户只需在系统提示语中通过简单的文字描述即可完成切换。
小提示:在 system prompt 中添加类似 "进行高推理级别" 的指令,即可让模型启用更深入的思考过程,但同时也会增加推理时间(如 20B 版本在 Apple M1 Pro 32GB 上约需 6.1 秒思考时长)。
02|体验方式:两步轻松用上 gpt-oss
目前有两种主流方式体验 gpt-oss 模型:
方式一:本地部署(推荐 Ollama)
使用 Ollama(访问 ollama.com)是本地运行的首选方式。我本人就是在 Apple M1 Pro 32GB 电脑上通过 Ollama 成功运行的 20B 版本。安装最新版 Ollama 后,其自带的 UI 页面会默认显示 gpt-oss-20b,您只需发送一条消息,系统即会自动完成模型下载并开始运行。
⚠️ 注意:本地部署 gpt-oss-20b 需要至少 16GB 的内存。如果硬件配置不足,建议直接使用云平台体验。
方式二:在线体验(推荐 OpenRouter)
如果本地硬件条件有限,可以前往 OpenRouter(openrouter.ai)在线体验。该平台不仅提供了 gpt-oss 模型,还同步上线了 Claude Opus 4.1 等热门模型。
从价格来看,gpt-oss 的使用成本仅为 OpenAI o3 的 7%,甚至比 DeepSeek R1 还要便宜。具体价格对比如下:
小提示:OpenRouter 也支持工具调用和函数调用功能,非常适合快速测试模型的真实业务能力。
03|真实性能:实地测试与对比分析
我们跳过简单的基准题,直接测试 gpt-oss 在编程、数学和复杂逻辑推理方面的真实表现。
编程能力测试
测试任务包括:制作一个完整的 3D 模拟、完整的 2D 游戏、天气组件。结果如下:
- gpt-oss-120b(思考 5 秒):表现不尽如人意。
- gpt-oss-20b(思考 9 秒):表现同样有待提升。
就目前的测试结果来看,gpt-oss 的代码生成能力尚未达到预期水准,相比之下,Claude 4.1 在这一领域优势更为明显。
数学推理测试
题目如下:C 给出了 11 个候选年龄:35、36、38、42、45、46、51、55、57、61、62,并将十位数告诉 A,个位数告诉 B。随后展开一段对话推断 C 的年龄。
- gpt-oss-120b(思考 4 秒):思路清晰,成功解题。
- gpt-oss-20b(思考 6 秒):同样正确解答。
好在数学题没有掉链子,两款模型都表现出色。
复杂逻辑推理测试
题目围绕七个小矮人的家乡、职业、饮料、帽子颜色、交通工具进行逻辑推理,最终需找出戴黑帽子的人。
- gpt-oss-120b(思考 61 秒):未能正确解答。
- gpt-oss-20b(思考 83 秒):开始出现重复生成问题,直至卡住不动。
常见问题:
Q:gpt-oss 在复杂推理任务中表现不理想,有什么解决办法?
A:针对极其复杂的逻辑推理题(如多变量约束求解),建议:1)将问题拆解为多个小步骤,逐步提问;2)使用高推理级别增加思考深度;3)尝试调用外部工具(如 Python 代码)辅助计算与验证。
总结与展望
gpt-oss 的开源标志着 OpenAI 在开放生态上迈出了关键一步,其 20B 版本在多数常见任务上已具备碾压同级开源模型的能力,而 120B 版本更是逼近商用旗舰性能。从本地到云端,从基础推理到工具调用,gpt-oss 都展现了极高的实用价值和性价比。后续我们将持续关注 GPT-5 的进展,并在项目级编程等深度场景中做更全面的测试。
小提示:如果想在当前体验最佳项目级编程能力,可以尝试将 gpt-oss 搭配 MCP 协议使用,或将其作为主力模型与 Claude Code 等工具配合,以弥补编程短板。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:OpenAI新开源GPT OSS实测,o1和GPT-4o已过时要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印
星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证
PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E
东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。
- 日榜
- 周榜
- 月榜
热点快看
