GPT-5发布全面领先,但并非AGI
GPT-5正式发布,在LMArena所有项目及多项权威基准测试中全面领先,数学、编程和创意写作均位列第一。API定价非常低廉,其智能路由系统可根据任务需求自动切换推理深度,实现性能与成本的最佳平衡。但需注意,它并非真正意义上的AGI,仍有局限。
备受期待的GPT-5,终于正式发布。
时隔两年半,OpenAI终于带来了这场真正意义上的大版本更新。从2023年3月14日GPT-4问世,到2025年8月7日GPT-5登场,全球用户等待了将近900天。
当前最智能的AI模型
Sam Altman在直播中多次强调,GPT-5是一个统一的智能系统,用户无需再手动切换不同模型,它能够自主判断何时需要启动深度思考模式。
根据Artificial Analysis获取的早期访问权限及完整基准测试结果,GPT-5如今已是业界领先的AI模型。在该机构的AI指数评测中,GPT-5(high版本)获得68分,位列第一。GPT-5(medium版本)获得67分,与Grok 4并列第二。作为对比,OpenAI o3得分67分,Google Gemini 2.5 Pro和DeepSeek R1均为65分,而Anthropic Claude 4 Opus则仅得59分。
LMArena全面登顶
过去几周,数百万用户在LMArena上以代号「summit」测试了GPT-5。结果显示:GPT-5在LMArena的所有评测项目中均排名第一。无论是数学、编程还是创意写作,均位列榜首。在Text、WebDev和Vision Arena等专项领域,也同样独占鳌头。在Hard Prompts、Coding、Math、Creativity、Long Queries等所有细分赛道中,它依然保持着第一名的位置。
GPT-5目前保持着Arena平台有史以来的最高得分记录。
尤为令人印象深刻的是,GPT-5能够同时胜任高级数学与编程任务。有人让它「制作一个中心极限定理应用于具有相同均值的独立但非同分布变量的交互式动画可视化」,它一次性就成功完成了。
各项评测全面领先
直播中展示了更为详尽的性能数据:
SWE-bench Verified达到74.9%,软件工程能力远超OpenAI o3的52.8%和GPT-4o的30.8%。AIME 2025数学竞赛成绩为94.6%(使用Python工具时可达100%),而GPT-4o仅为42.1%。GPQA Diamond达到88.4%,博士级科学问题测试创下新高,GPT-5 Pro版本更是达到89.4%。「人类最后的考试」成绩为42%,GPT-5 Pro使用工具时为42%,不使用工具则为30.7%。MMMU多模态理解能力达84.2%,视觉理解能力显著提升。HealthBench达到67.2%,HealthBench Hard达到46.2%,幻觉率仅3.6%。
马斯克表示:我不服
对于GPT-5的表现,马斯克表示不服,并公开回应:
Grok 4在ARC-AGI上击败了GPT-5
对GPT-5略显失望的网友也立即跟着起哄,有人问「Grok 5什么时候发布?」,还有人建议「是时候让所有用户免费使用Grok 4了」。
定价极具竞争力
GPT-5在API定价方面,可以用极其便宜来形容。GPT-5-mini每百万输入token仅需0.25美元,以低价策略直接碾压了Google的Gemini 2.5 Flash(0.30美元)。GPT-5 Standard每百万输入token为1.25美元,与Google的Gemini 2.5 Pro完全一致。
但对比Anthropic就显得格外残酷——Claude 4 Opus每百万输入token要价15美元,而GPT-5 Standard只需1.25美元。整整便宜了12倍。
在访问方式上:免费用户可以使用GPT-5(含推理功能),但有使用额度限制,超出后会降级为GPT-5 mini(一个速度更快但规模更小的版本)。Plus用户(每月20美元)可获得更高的使用额度,默认使用GPT-5,不易触发降级。Pro用户则可专属访问GPT-5 Pro(推理更深、能力更强),拥有最高级别的智能。Team / Enterprise / Edu客户将于8月14日全面开放,按企业级套餐计费。
智能路由模型系统
OpenAI在Progress页面上展示了从GPT-3到GPT-5的进化路径。这条路径清晰展示了每一代模型的巨大飞跃,而GPT-5则标志着又一个重要里程碑:统一的智能系统。
用户不再需要手动选择模型,GPT-5将自行决定何时需要深度思考。GPT-5不再是一个单一模型,而是一个模型系统:
自动切换器判断用户查询意图
简单问题路由到聊天版本(极速响应)
复杂问题路由到推理版本(深度思考)
256k token上下文窗口,支持文本和图像输入,支持函数调用和结构化输出。四个推理努力级别:high、medium、low、minimal,token使用量差异可达23倍,成本也随之相应变化。
主动性强如真人
GPT-5的早期体验者Ethan Mollick表示:
我获得了GPT-5的访问权限。我认为这意义重大,因为它非常聪明,能够主动为你工作。这是「制作一个程序化粗野主义建筑生成器,让我能以酷炫的方式拖拽和编辑建筑」以及多次要求「让它更好」的结果。我全程没有触碰任何代码。
当他只是简单说「让它更好」时,GPT-5主动添加了:霓虹灯、街道上的汽车、立面编辑、预设建筑类型、戏剧性相机角度,甚至完整的保存系统。「就像在看别人的想象力在工作。」
写作与健康领域表现
在创意写作方面,GPT-5展现出深厚的文学深度,能处理结构模糊的任务。在官方诗歌对比中,GPT-5使用了更具冲击力的意象:「黑色旗帜,一个不再存在的国家」。
在健康领域,GPT-5同样表现卓越。Sam Altman强调,这是他们迄今为止最好的健康模型,能够像思维伙伴一样主动标记潜在问题。
极低的幻觉率
GPT-5变得更加诚实。当任务无法完成时,其欺骗率仅为2.1%(o3为4.8%)。当研究人员移除CharXiv测试中的所有图像时,OpenAI o3仍会对不存在的图像自信作答(错误率86.7%),而GPT-5的错误率仅为9%。
图表中的小bug……
有眼尖的网友发现了图表中的bug。Joseph Thacker问道:
52怎么会比69高?
莫非是GPT-5学会了0.9大于0.11的逻辑,反而搞错了69.1小于52.8?
而有看完发布会后感到失望的网友,已经开始催促GPT-6了。我也准备先洗洗睡了。
你是一名 AI 行业编辑,请围绕下面这条热点输出一份资讯解读:
热点:GPT-5发布全面领先,但并非AGI要求:
1. 先用一句话解释这条热点在讲什么
2. 再总结它为什么重要
3. 说明会影响哪些 AI 产品或内容方向
4. 最后给出 3 个适合资讯站使用的标题
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
相关热点在COMPUTEX2026展会上,技嘉展示了AORUSGeForceRTX5080INFINITYWOOD显卡和AORUSX870EINFINITYNEXT主板。RTX5080显卡采用白色主题与木色元素装饰,设计独特;X870E主板则以蝴蝶翅膀为灵感,采用类蜂窝结构和金属3D打印
星际荣耀公司近日成功完成SQX-3运载火箭海上回收高精度导航系统的无人机挂飞试验。该试验在广东阳江海域进行,采用创新的半实物动态模拟方案,全面验证了导航系统在复杂海况下的性能。结果表明,系统各项指标均优于设计要求,能够稳定提供火箭与回收船之间的高精度相对导航信息。这标志着该核心系统已完成全部地面验证
PC内存厂商OriginCode近日分别针对英特尔和AMD平台推出专项优化内存。面向英特尔平台的CQDIMM内存,通过与技嘉合作验证了256GB8000MT s的高带宽套条,旨在为本地AI、视频渲染等重载任务提供强大数据吞吐能力,并计划在2026年台北电脑展展出。针对AMD平台,则推出多款支持E
东风本田公布5月销量达18563台,环比增长20%,其中CR-V销量增长显著。品牌同步推出6月限时购车权益,涵盖CR-V、英仕派、HR-V及思域等多款车型,权益价最低至9 79万元起,并可叠加国家以旧换新补贴及原厂配置加装优惠,为近期有购车计划的消费者提供了具体的价格参考与增值选择。
- 日榜
- 周榜
- 月榜
热点快看
