当前位置: 首页
AI教程
GPT-5.6竟在后台执行rm -rf命令

GPT-5.6竟在后台执行rm -rf命令

热心网友 时间:2026-07-22
转载

昨天GPT 5 6正式公开,某知名社交平台上瞬间刷满了“牛批”“卧槽”“吊打Fable 5”,不少号主也跟着吹了一波。但发布当天就有分析指出:这版效果可能没那么好。结果才过了一天多,风向就开始变了。 原本没收到Sol的推送,所以先测了Terra。发布时官方口径大致是:Terra能力跟GPT-5 5差

昨天GPT 5.6正式公开,某知名社交平台上瞬间刷满了“牛批”“卧槽”“吊打Fable 5”,不少号主也跟着吹了一波。但发布当天就有分析指出:这版效果可能没那么好。结果才过了一天多,风向就开始变了。

原本没收到Sol的推送,所以先测了Terra。发布时官方口径大致是:Terra能力跟GPT-5.5差不多,更省token。之前也按这个理解它——Terra是5.5的省流版。

离谱,GPT-5.6 竟然在后台执行了 rm -rf

结果体验过程中,首当其冲就撞上两个低级问题。一个是模型跑完了,界面上几乎看不到任何结果。另一个是流式渲染之后,英文夹着中文一起喷出来,读起来像一坨泔水。还分不清这是ChatGPT Codex客户端的问题,还是模型本身的问题。结论很简单:体验有些差。

前天Grok 4.5刚出来的时候,有评测说这次效果其实不错。对GPT 5.6,又泼了冷水。结果这两个观点现在都在应验。一边是Grok 4.5被拿去和第一梯队认真比较。一边是GPT 5.6的热度,正在从“吊打一切”变成“寥寥无几地在吹”。不是5.6完全不能用,而是发布日的情绪和真正上手后的体感,不是一回事。

OpenAI 把重置玩明白了

现在OpenAI倒很清楚一件事情:额度重置,比再发一篇评测稿更管用。邀请重置,改bug重置,奥特曼打个不会赢的赌输了重置,甚至官方毫无理由直接下场送重置。属实把重置玩明白了。但这招的副作用也很明显:用户会逐渐把重置当成产品体验的一部分,而不是福利。哪天OpenAI如果不送重置了之后呢?用户可是没有忠诚度,哪个模型好用哪个,哪个模型省token用哪个,哪个模型性价比高用哪个。比如之前天天吹GPT 5.5,现在不也上手用上Grok 4.5了。要是天天靠补额度维稳,那产品本身一定哪里有问题。

A 社也坐不住了

GPT 5.6这波,连一毛不拔的A社都跟着重置额度了。Fable 5本来是7月7号结束订阅内的促销额度,后来延到7月12号;5.6一公开,A社又把5小时和weekly limit全量重置了一遍。Tibo直接在官方帖子下面说:他闻到了一股恐惧的气味。

离谱,GPT-5.6 竟然在后台执行了 rm -rf

这话当然带点阴阳。不过可以确定的是,A社确实感觉到了一些压力,否则也不会在GPT 5.6刚发布就选择重置额度。Fable 5的延迟下线也能证明这一点。

还记得当初用GPT 5.5时候的惊艳,但这次GPT-5.6 Sol,吐槽的人不少。

离谱,GPT-5.6 竟然在后台执行了 rm -rf

Simon Willison写过GPT-5.6家族(Luna/Terra/Sol)的梳理,也承认Sol很能干,但在他常做的复杂编码任务上,目前还没觉得它比Fable更好。另外一个更刺眼的点是:官方爱打的Agents' Last Exam上Sol很亮眼,但在SWE-Bench Pro这种更硬的编码评测上,Fable 5自报大约80%,Sol大约64.6%。OpenAI还专门发文质疑SWE-Bench Pro有大量坏题——这个动作本身,也说明编码榜单已经开始互撕了。

更严重的是Matt Shumer。他测试GPT-5.6 Sol时,最终执行了类似rm -rf /Users/mattsdevbox的操作,把Mac上的文件全删光了。(Matt Shumer就是写下那篇《有许多大事儿即将发生》的那位)出了这件事后,对GPT-5.6 Sol的信任直接掉了一截。

Theo(t3.gg)也吐槽了一个很工程的问题:把gpt-5.6-sol设成ultra之后,它下面的所有subagent也会继承ultra,造成无缘无故的token燃烧,而且还无法单独地把subagent的effort换成medium。因为很多人第一天就会把effort拉满,一拉满就疯狂烧token,然后回头说Sol太贵了。这老哥还有一个帖子更直接,说感谢大厂互卷,让A社感到恐惧,于是继续延长Fable 5的下线节奏。甚至觉得,Fable 5未必会在12号就按原计划切到纯credits。现在先立个flag,看看会不会打脸。

离谱,GPT-5.6 竟然在后台执行了 rm -rf

现在真实感觉到,现在的测评其实看一看就行。真正决定你换不换默认模型的,还是这几件事:会不会稳定产出结果,会不会乱删文件,会不会无故烧额度,会不会无缘无故降智,会不会有额外的惊喜。不是GPT 5.6没有实力,OpenAI在agent长程任务、工具调用、多agent编排上确实很突出。但发布后的第一波真实反馈里,稳定性和可控性,已经压过了再高10分的兴奋。

这也是为什么更愿意先看Grok 4.5这类够强、够快、够便宜的选手,而不是只盯着发布会里最顶的那一档。按照现在的趋势,顶级模型不会用来单纯地干活,而是会整理需求、做设计、拿方案;具体干活,要交给工程能力强、token消耗没那么快的模型。如果实在想用GPT 5.6,先把effort调到medium,别一上来ultra拉满。这和圈里不少人的观点基本一致:xhigh/ultra很容易过度思考,还特别废token,性价比不高。除非在做又难又大的攻城略地型任务,否则一般任务里,medium往往更划算。

说到底,GPT 5.6现在最大的问题,是新版Codex搭配着GPT 5.6还没稳定,bug比较多,而且大家对GPT 5.6的期待值有些过高,导致与实际情况有些差距,所以这次OpenAI还是有些着急了。现在的态度很简单:Sol继续观察,Terra先当省流备胎(其实并不省),Fable 5额度能蹬上的话还是最佳选择,Grok 4.5很值得尝试。现在最应该做的事,就是等着GPT 6.x的发布了。

来源:https://juejin.cn/post/7664972631319642163

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
TalkVisions实时视频翻译应用,消除语言障碍

TalkVisions实时视频翻译应用,消除语言障碍

TalkVisions是一款实时视频翻译应用,能将视频中的口语实时转录为文本并翻译成用户所选语言,以字幕形式叠加在画面上,支持多语言、低延迟,还可保存录制视频,有效消除跨语言沟通障碍。

时间:2026-07-25 22:26
AI驱动的日历管理工具Ipso

AI驱动的日历管理工具Ipso

IpsoAI是一款专为专业人士及助手打造的AI日历管理工具,能够自动协调多方日程、智能草拟邮件,并通过快速安排会议、提供智能建议及自动化工作流程,显著减少琐碎操作,帮助用户高效管理时间、提升工作效率。

时间:2026-07-25 22:25
Spectate企业级专业高效监控与事故管理一体化平台

Spectate企业级专业高效监控与事故管理一体化平台

Spectate是一款高效监控和事故管理工具,能在30秒内检测故障并推送告警。它支持Slack、PagerDuty等主流集成,提供自定义状态页面和全球性能监控。系统自动更新状态并推送修复建议,帮助团队减少沟通成本,快速解决问题。

时间:2026-07-25 22:25
阿里云通义千问2.5大模型发布 多项能力赶超GPT-4

阿里云通义千问2.5大模型发布 多项能力赶超GPT-4

通义千问2 5大模型发布,多项能力宣称赶超GPT-4,中文语境下文本理解、生成、知识问答等表现优异。相比2 1版本,理解提升9%、逻辑推理提升16%、指令遵循提升19%。开源1100亿参数模型超越Llama-3-70B,获评开源最强。已服务超9万家企业,与小米、微博等达成合作。

时间:2026-07-25 22:25
万知个人AI工作站:一站式智能阅读创作分享平台

万知个人AI工作站:一站式智能阅读创作分享平台

万知是集成多种AI能力的个人工作站,支持自然语言交互、文档快速阅读与摘要生成、PPT自动设计与优化,覆盖学术研究、商务报告、写作辅助及日常问答等场景,全方位提升工作效率。

时间:2026-07-25 22:25
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全
  • 热门数据榜