当前位置: 首页
科技数码
Kimi从震动硅谷到与马斯克掰手腕做对了什么

Kimi从震动硅谷到与马斯克掰手腕做对了什么

热心网友 时间:2026-07-23
转载

月之暗面发布2 8万亿参数KimiK3开源模型,全球参数最大,发布后用户请求量逼近承载极限。三项底层技术创新实现训练成本减半、效率提升,在长上下文和推理能力上取得突破,成本低于海外竞品,引发全球关注。

中国大模型独角兽月之暗面(Kimi)的K3模型,这次是真的火了,而且火到了全球。

7月16日,月之暗面正式发布了参数规模达到2.8万亿的Kimi K3,一举成为全球参数最大的开源模型。消息一出,整个行业都坐不住了——发布后48小时内,用户请求量直接逼近集群承载极限。7月19日晚,月之暗面不得不发公告,暂停C端新用户订阅,把全部算力优先保障给已付费的老用户。

这场面,连美国媒体都直言不讳:“美国在AI领域领先世界”这个认知,被中国打破了。外媒的分析更直接:Kimi K3在成本和功能可定制化上对用户有着极强的吸引力,美国AI产业链如果想维持技术优势,得先投上千亿美元建数据中心。问题是,很多投资者已经开始担心,那些美国AI企业的估值是不是太高了。K3的出现,无疑给它们带去了不小的压力。

说起来,月之暗面的办公室就在清华到知春路地铁站那一片。投资人王慧文曾说过一句很有意思的话:他所有投资回报最高的公司,都在这片“豆腐块”区域里。字节的豆包、DeepSeek、月之暗面,全都诞生在这里。五位创始人全部毕业于清华,公司名字取自平克·弗洛伊德的经典摇滚专辑《月之暗面》——公司成立那天,正好是这张专辑发布50周年。这种摇滚气质贯穿在公司每个细节里:所有会议室都以摇滚乐队命名,有一个叫“Splay”,外人以为是某个不知名乐队,其实是两位联合创始人杨植麟、周昕宇在清华上学时组的乐队名,这个名字还来自数据结构里的伸展树算法。

“不管是C端用户还是B端客户,Kimi现在都处于供不应求的阶段。”月之暗面企业业务负责人黄震昕在接受采访时这样说道。

K3最大的变化,是质变

“它不是靠后天很多技能学习或者打磨出来的强模型,是一个原生就非常聪明的模型。”黄震昕介绍,Kimi K3最核心的能力,是长时程高难度推理。

现场展示的几个案例很能说明问题:非技术人员用一句话,就能复刻出童年玩过的、已经停更的游戏,还原度达到90%;输入20篇商业航天领域的研报,一句话就能生成图文并茂的深度研究报告,所有图表实时生成,还包含周期传导链、竞争格局这类专业分析;就连复杂的芯片设计工作,现在也能通过K3完成。

大模型行业过去一直信奉Scaling Law——算力、训练数据、参数量三个维度同时放大,模型性能就会提升。但这条定律正在撞上墙:算力投入扩大100倍,模型才能获得10倍的增强,全球算力已经开始紧缺,高质量训练数据也基本见底。月之暗面的解法,是换掉Transformer架构中8到11年没有更新过的核心组件。三项底层技术,构成了K3的核心支撑:

第一项是名为MuonClip的新型二阶优化器,首次应用在万亿参数大模型训练中。它能让20T的训练数据发挥出40T的效果,同样性能下训练成本和算力功耗直接减半。DeepSeek已经认可并采用了这项技术。

第二项是自研的KDA混合线性注意力机制,解决了传统线性注意力在长距离任务上性能衰减的问题。传统全注意力机制的计算量随上下文长度平方增长,到了百万Token级别成本极高。而KDA让模型规模扩大10倍时成本仅扩大10倍,Scaling Law得以继续延伸。这也是K3支持100万Token上下文的基础——足够装下一整本长篇小说,或者一个完整项目的全部代码。

第三项是Attention Residuals(注意力残差)技术。今年3月月之暗面发布相关论文时,马斯克就曾在X平台转发评价“Impressive”。这项技术以不到2%的额外计算成本,实现了25%的训练效率提升。论文一作中,有一位17岁的实习生。

“真正懂行的人都知道,这一代模型的能力提升不可能靠蒸馏来。”针对外界关于蒸馏的质疑,黄震昕打了个比方:六耳猕猴和真孙悟空,终究还是不一样的。OpenAI的战略负责人也曾在X上表示,这么聪明的模型不可能通过蒸馏得到。

回应马斯克:希望“掰一掰手腕”

马斯克是K3最受关注的观众之一,没有“之一”可能也行。

K3发布当天,在FrontendCodeArena前端编程榜单上,K3以1679分登顶,成为首个在该榜单超越所有闭源模型的开源模型。马斯克在相关报道下留言:Impressive。这是他今年第二次公开肯定月之暗面的技术。

但仅仅一天后,马斯克就在X上放话,自家正在训练的Grok新模型可能会超越Kimi。月之暗面的回应很干脆:“欢迎加入2万亿俱乐部。”黄震昕在现场补了一句:“我们拭目以待,希望他们出来跟我们掰一掰手腕。他有信心,我们有更强的信心。”

马斯克的反应,其实代表着全球市场对Kimi K3实力的认可。外媒报道,自深度求索(DeepSeek)推出R1版本以来,中国的AI模型持续影响着整个行业。它们在一定程度上碘伏了由西方头部企业确立的AI产业的经济基础——付费闭源模式。

从数据来看,中国企业的AI模型在服务定价方面确实低于美国竞品。根据人工智能分析网的基准测试,使用Kimi 2.6或DeepSeek-V4-Flash执行标准化智能任务的加权平均成本在0.33美元到0.02美元之间,而Anthropic的Claude Fable 5执行同类任务则需要2.75美元。在上述任务中,Kimi K3的预估使用成本为0.95美元。性能强、成本低,这个组合让中国AI模型成为全球众多开发者的优先选择。

开源是月之暗面从成立之初就坚持的路线。“过去大家总觉得开源模型就要卖得便宜,中国模型就要打价格战。”黄震昕表示,“K3现在在全球都供不应求,我们没有走低价路线,就是想告诉全世界,开源模型、中国模型也能做出SOTA级别的产品,也能获得合理的商业回报。”他明确表示,Kimi不会陷入价格战。目前K3的推理分三档,用户可以根据需求选择。

今年以来Agent赛道火热,不少模型公司开始转型做应用,但月之暗面始终坚持在基模路线上。“模型公司一定要做模型。”这句话听起来像废话,但月之暗面的判断很清晰:模型强度是所有上层应用的基础——Agent、C端产品、B端服务,都是模型能力强到一定程度之后自然发生的事。“模型做得足够强,你说什么都是对的,用户自然会来用。”

这并不意味着他们不做应用。KimiPPT已经是C端最好的AI生成PPT产品之一,这些C端Agent能力正在反哺基模迭代。“海外最好的模型为什么强?因为他们会根据最终应用反过来调模型,而不是根据模型能力去做应用。”在月之暗面看来,这叫“模硬一体”——通过C端产品的真实使用数据,反过来优化模型,让模型能力和用户期望真正对齐。

接下来,月之暗面还会推出Kimi Hosting Agent平台,把内部打磨成熟的Agent能力(比如PPT生成、研报生成)通过API开放给B端客户。媒体可以直接接入内部系统做PPT,投研机构可以直接搭建自己的研报系统,用户还可以自定义风格。

商业化方面,黄震昕透露,目前C端收入占比达到70%,公司不做私有化部署服务,坚持SaaS模式。关于收入结构、与海外闭源模型的差距、国产算力使用比例、自研芯片计划等问题,大方向上,会尽可能使用更多国产算力。

关于幻觉问题,黄震昕坦言无法完全杜绝——幻觉是模型创造力的来源,很难彻底消灭,但模型越强幻觉率越低。K3已经是幻觉非常少的模型,内部通过AgentSwarm技术解决:一个Agent负责写内容,专门有一个事实校验员Agent核对所有数据,用户如果在prompt中加上“引用信源必须全部来自最新权威来源”,幻觉率会大幅降低。

“我们长期在三个方向投入:长上下文决定模型能干活的时长,训练效率决定模型有多聪明,Agent协作决定复杂任务怎么完成。”黄震昕表示,这三个方向,未来五年还会继续投入。

Kimi的愿景是“找到将能源转化为智能的最优解”。在他看来,这件事有三个层面:首先要做最强的模型,就像登月一定要做到最好;其次要通过底层算法创新,在有限算力下做出最强模型;最终要让AGI普惠全世界。

面对紧缺算力,月之暗面正在全力采购和部署新的算力,优先保障老用户体验。黄震昕表示,新的算力到位后,订阅会逐步开放。但可以确定的是,参数会继续越做越大。

一位行业专家给出了这样的判断:“K3的爆火,是国产大模型真正站上全球第一梯队的标志性事件。它不是靠堆算力、堆参数的蛮力,更不是靠蒸馏模仿的跟随品——三项底层架构创新,直接改写Transformer诞生十余年来未变的核心组件,让Scaling Law在全球算力瓶颈下得以延续。中国AI不再是硅谷的追随者,而是正在长出真正能定义行业方向的原始创新力量。”

来源:https://www.163.com/dy/article/L2GM47FK0514R9P4.html

游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。

同类文章
更多
罗福莉入选新一届35岁以下科技创新35人中国区名单

罗福莉入选新一届35岁以下科技创新35人中国区名单

2025年《麻省理工科技评论》“35岁以下科技创新35人”中国区名单在上海发布,罗福莉、姚顺宇等入选。罗福莉推动大模型从“能聊天”走向“能干活”,探索智能体演进;姚顺宇建立非厄米拓扑能带理论。本届AI+机器人领域入选者占四成。

时间:2026-07-25 21:58
美国科技巨头为AI投资年内裁员近14万人

美国科技巨头为AI投资年内裁员近14万人

美国科技巨头年内裁员近14万人,同时计划在AI基础设施上投入7250亿美元。裁员主要目的为AI投资腾出资金并纠正疫情期间过度招聘,市场对AI相关裁员反应负面,而AI初创公司正加速扩招,形成对比。

时间:2026-07-25 21:58
位AI Infra高管复盘WAIC:暴力美学触顶后求变?

位AI Infra高管复盘WAIC:暴力美学触顶后求变?

WAIC2026上,AIInfra行业关注点从算力规模转向推理效率与Token产出。Agent驱动Token消耗激增,AI工厂与Token工厂成为关键载体。效率竞争取代规模竞赛,玩家分层加速,具备全栈优化能力的头部厂商优势凸显。

时间:2026-07-25 21:58
显卡厂商封仓引发涨价 玩家面临高价购买

显卡厂商封仓引发涨价 玩家面临高价购买

显卡市场,恐怕又要迎来一波涨价潮了。过去两年,不少玩家咬咬牙买下的高价显卡,如今回头看,竟然成了抄底。但问题在于,硬件市场每一次涨价,最终买单的永远还是玩家。 业内消息显示,GDDR7显存价格出现了明显上涨,单颗2GB显存价格上涨接近20美元。按8GB显存规格计算,一张显卡的显存成本或将增加约542

时间:2026-07-25 21:58
OpenAI加入签署AI开源模型公开信,组织达35家

OpenAI加入签署AI开源模型公开信,组织达35家

7月25日,微软、英伟达等25家美国公司联署公开信支持开放权重AI模型,随后签署方增至35家,新增包括OpenAI等。开放权重模型可下载、修改、运行,能扩大创新、强化竞争并降低风险,避免AI收益集中于少数巨头。

时间:2026-07-25 21:28
热门专题
更多
刀塔传奇破解版无限钻石下载大全 刀塔传奇破解版无限钻石下载大全
洛克王国正式正版手游下载安装大全 洛克王国正式正版手游下载安装大全
思美人手游下载专区 思美人手游下载专区
好玩的阿拉德之怒游戏下载合集 好玩的阿拉德之怒游戏下载合集
不思议迷宫手游下载合集 不思议迷宫手游下载合集
百宝袋汉化组游戏最新合集 百宝袋汉化组游戏最新合集
jsk游戏合集30款游戏大全 jsk游戏合集30款游戏大全
宾果消消消原版下载大全 宾果消消消原版下载大全
  • 热门数据榜