文远知行WITT解决数据越多越难用补全数据飞轮关键一环
文远知行发布物理AI认知基础大模型WITT,解决自动驾驶数据量大但长尾场景难提取的问题。WITT从道路视频中提取可信事实,具备事实提取、推理、验证和编排能力,错误率仅为通用大模型的三分之一,数据处理效率提升200倍,与GENESIS世界模型组成数据飞轮。
直接说几个核心判断:自动驾驶行业存在一个反直觉的现象——车队规模越大、数据积累越多的公司,反而越头疼如何高效利用这些数据。
数据量正在暴涨,但模型能力的提升,却越来越依赖那些罕见、复杂、真正具有高价值的长尾场景。问题在于,如何从海量数据中精准挖掘出这些场景,其难度甚至不亚于数据采集本身。
在7月17日的世界人工智能大会上,文远知行发布了物理AI认知基础大模型WeRide WITT。发布会现场,文远知行上海研发中心总经理霍达没有直接介绍参数,而是从一个更根本的问题切入:没有可信的事实基础,我们就无法判断模型哪里正确、哪里错误。这句话,也点明了WITT诞生的核心逻辑。
这是一个运行在云端的数据理解模型,能够从连续的道路视频中提取可信事实,判断哪些数据值得进入训练流程,哪些需要进一步验证,哪些只是大量重复出现的普通样本。
今年1月,文远知行发布了负责生成仿真场景的世界模型GENESIS。半年后,WITT补齐了另一端的核心能力——数据理解。一个负责理解真实世界,一个负责生成虚拟世界,两者共同构成了文远知行物理AI飞轮的重要环节。
01 从有没有数据,到怎么用数据
过去几年,自动驾驶行业一直在追求更多的数据。特斯拉FSD累计行驶里程已超过84亿英里,但马斯克认为,要实现安全的无监督自动驾驶,大约还需要100亿英里的训练数据。美国兰德公司曾对自动驾驶安全验证进行测算:如果想以80%的置信度证明自动驾驶比人类司机更安全,100辆测试车需要连续行驶518年。
训练数据积累和安全验证虽然是两个不同的问题,但两组数字都说明了一个事实:单纯依靠真实道路测试,很难覆盖所有罕见情况。
与此同时,当车队规模扩大后,另一个问题又浮现出来——数据量过大,导致无法有效使用。
文远知行拥有超过3000辆L4车辆,在全球多个国家运营。一辆Robotaxi每天持续运行,会产生海量道路视频。其中绝大多数是普通的直行、跟车、等红灯场景,真正影响模型能力的,是少数复杂场景。
这些长尾数据价值极高,但数量稀少,且往往隐藏在大量普通数据中。人工筛选并非可持续的方法。面对每天新增的大量视频,工程师很难依靠人工逐段查看来找出所有有价值的数据。
那么,能否直接交给通用大模型来处理?答案并不理想。在WACV 2025的CODA-LM基准测试中,GPT-4V面对自动驾驶corner case场景时,通用感知得分仅为57.5分。
问题不仅在于识别错误。交通场景中的视觉大模型还可能产生幻觉,它会描述一段视频中根本不存在的细节,或者错误理解事件发生的先后顺序。如果错误的数据进入训练流程,模型学习到的可能并非现实规律,而是错误的判断,反而会拖累算法表现。
过去几年,行业一直在讨论“数据闭环”。采集、标注、训练、仿真、部署,看起来是一条完整的链路。但落到工程现场,许多闭环都卡在了同一个环节:哪些才是有价值的数据?
发布会上,霍达将这个问题总结为一句话:“没有可信的事实基础,我们其实就没有办法去判断模型哪里对了,哪里错了。”WITT试图解决的,正是这一关键步骤。
02 WITT:用事实建立对世界的认知

WITT的技术思路暗含在其名字之中。它的全称是World Intelligence Toward Truth,中文解释为“以可信事实建立世界认知”。这个名字同时致敬了哲学家路德维希·维特根斯坦,他在《逻辑哲学论》中写下的第一条命题是:“世界是事实的总和。”
在哲学史中,这句话探讨的是世界、事实与语言之间的关系。进入物理AI的语境,文远知行将其转化为一条具体的工程路线:AI要理解真实世界,必须先从环境、行为、规则、风险和时序关系中提炼出能够验证的事实,再在这些事实之上进行判断和推理。
这条路线的主要载体,被文远知行称为“最小物理事实单元”。霍达表示,这是行业内首次将这一概念引入物理AI。发布会现场,他用一个场景解释了这套方法:“一个路口里可能包含多个对象、多个行为、多层关系。比如说下雨是一个事实,右转是一个事实,路边有行人横穿马路是一个事实。这些事实按照时间和因果关系组合起来,才形成了我们看到的完整场景。”
在WITT的视角中,一段夜间雨天的城市道路视频不再只是一串连续的像素。它会被拆解成一组相对独立、且能够回到画面中验证的事实:天气正在下雨,自车准备右转,车辆位于交叉口,路边行人正在横穿马路,路口的信号灯正在变化。
这里的“最小”指的是事实的颗粒度。复杂场景被拆解后,每个单元只描述一件相对明确的事情。在这些事实单元之上,WITT还会生成更完整的场景描述,将一段视频里发生的事情、参与者之间的关系以及风险变化重新组织起来。
这和常用的标签系统截然不同。传统的数据处理方式,是先由人定义类别,再给视频贴上标签。标签可以回答“这段视频里有没有行人”,却很难描述行人与自车的距离如何变化、风险从哪一刻开始、车辆为何在此时减速。一张图像可能包含上百万个像素点,但真正与决策相关的只有一小部分。
WITT要做的,就是将这些像素背后的道路事实识别出来,再还原事实之间的关系,将其变成模型能够直接使用的认知单位。事实单元是基础,但真正让它进入自动驾驶研发流程的,是建立在此之上的事实提取、事实推理、事实验证和事实编排四项核心能力。
03 WITT四大核心能力

“最小物理事实单元”解决的是AI如何理解真实世界的问题,而围绕这些事实形成的四项能力,则决定了这些信息如何真正进入自动驾驶的研发流程。
WITT目前形成了事实提取、事实推理、事实验证和事实编排四项核心能力,分别对应自动驾驶研发中的关键环节:从真实道路视频中提炼事实,理解事件背后的关系,判断模型输出是否可信,以及让不同数据进入合适的训练路径。
事实提取:从连续视频中找到关键事实
自动驾驶面对的真实世界并非由一个个孤立的标签组成。一辆车在道路上行驶,背后同时包含天气、道路结构、车辆状态、交通参与者行为等多个因素。WITT要做的第一件事,就是从这些连续变化的信息中提取出能够被理解和验证的事实。
文远知行将事实分为三个层面:一类是标准驾驶事实,例如车辆转向、变道、减速;一类是多主体交互事实,例如车辆、行人、非机动车之间的位置和行为变化;另一类是物理模糊条件,例如雨雾、反光、遮挡等导致的不确定状态。一段夜间雨天的城市道路视频,在WITT看来,不再只是一串连续画面,而是一组相互关联的事实:正在下雨,自车准备右转,车辆位于交叉路口,路边存在行人,信号状态正在变化。这些事实单元组合起来,才形成工程师真正关心的道路场景。
事实推理:不仅找到场景,还理解发生了什么
找到事实之后,下一步是理解事件。在自动驾驶研发中,经常需要从大量历史数据里寻找某类特殊场景,例如施工区域内行人突然横穿、雨天低能见度下其他车辆压线、窄路会车时自车减速避让等。
过去,工程师需要依靠标签系统进行筛选,再人工查看大量视频。WITT内置的视频数据引擎支持通过关键词和自然语言进行检索。工程师可以直接描述希望寻找的场景,模型会定位相关时间段,并进一步分析事件的原因和演化过程。它回答的不仅是“这里发生了什么”,还包括“为什么发生”。例如,一辆车突然减速,是因为前方车辆影响,还是因为行人正在进入潜在风险区域;一次避让动作,是正常驾驶行为,还是模型决策出现了问题。
事实验证:减少模型对物理世界的误解
对于自动驾驶而言,理解错误比理解慢更危险。通用视觉语言模型能够描述画面,但在复杂交通场景中,也可能产生幻觉:补充不存在的信息,遗漏关键对象,或者错误判断事件顺序。
WITT针对这一问题建立了事实验证机制。它从弱势道路使用者、自车行为、他车行为、场景理解、事实完备性和交通设施六个维度评估模型输出,并加入事实置信度,形成“6+1”验证体系。模型输出的问题会被归纳为事实错误、幻觉、遗漏和时序错误,再用于判断数据质量,并反馈给模型训练。根据文远知行披露的数据,在自动驾驶垂类场景中,WITT平均每片段的事实错误率约为通用基础大模型的三分之一。
事实编排:让不同数据进入不同路径
自动驾驶数据并非越多越好。不同类型的数据,需要进入不同的处理流程。WITT会根据事实价值对数据进行编排:稀缺的长尾场景进入世界模型GENESIS,用于生成更多模拟训练场景;大量高频的日常场景用于强化学习和流程优化;暂时无法确认价值的异常片段则进入复核机制,避免关键数据被误判为“脏数据”。
这也是WITT与传统数据处理工具最大的区别之一。它并非简单地对数据进行分类,而是在判断这些数据接下来应该如何被使用。这套机制最终还要接受工程现实的检验。发布会上,霍达披露,在11项物理AI公开测试中,WITT有7项取得领先;单次请求可以输出100多个动态行为标签,事实错误率仅为通用基础大模型的三分之一。在工程成本方面,WITT相比通用大模型可以节省98%的Token成本;在同等算力预处理条件下,数据处理效率最高可提升200倍,单张主流显卡每天能够处理1万分钟车辆运行视频。
霍达在总结这套能力时表示:“用云端物理AI模型大规模处理车辆运行数据,在工程上已经变得可行。”对于自动驾驶公司来说,真正困难的并非让模型看懂一段视频,而是让它每天处理成千上万分钟的视频,并有效融入研发流程中。
04 WITT + GENESIS:文远知行的物理AI飞轮

WITT解决的是“理解现实”的问题。但自动驾驶不能只停留在理解现实。遇到一个危险场景后,需要在大量相似场景中进行训练;发现一次模型错误,也需要在安全环境中不断验证和改进。
今年1月,文远知行发布了通用仿真世界模型WeRide GENESIS。它负责生成高保真的虚拟道路环境,将真实世界中难以反复采集的场景搬到仿真环境中。车辆加塞、无保护转弯、行人突然出现,甚至极端天气条件,都可以在仿真世界里不断生成和测试。
如果说GENESIS负责“创造世界”,那么WITT负责的就是告诉它应该创造什么样的世界。真实道路中的数据经过WITT处理后,高价值的长尾场景被提取出来,进入GENESIS进行扩展,生成的仿真数据再用于车端模型训练;车辆重新进入真实道路,又会产生新的数据回流到WITT。一个负责理解现实,一个负责生成接近真实世界的训练场景,两者共同构成了文远知行的物理AI飞轮。
这一方向也正在成为自动驾驶行业的重要趋势。过去,行业更多在讨论世界模型如何生成世界,而WITT在此基础上进一步探索:模型应该依据什么事实,去生成一个可信的世界?这需要两个条件:足够多的真实道路数据,以及能够验证模型性能的产品体系。文远知行过去几年的积累刚好满足了这些条件。
在L4自动驾驶领域,文远知行已经形成了规模化运营。公司披露,目前拥有超过3000辆L4自动驾驶车辆,产品进入12个国家、40多座城市,并在广州、北京、阿布扎比和迪拜开展常态化纯无人商业运营。在量产市场上,文远也已获得近30个车型定点,并搭载于奇瑞星途星纪元、广汽埃安N60等车型。
L4车辆提供更加复杂、更接近无人驾驶要求的真实场景,L2++量产车则提供更大的车辆规模和更广泛的道路覆盖。两者产生的数据,都可以进入WITT进行理解和筛选,再反向推动模型迭代。
更值得关注的是,自动驾驶下一阶段的竞争,将不仅仅是比谁拥有更多数据,而是比谁能够更快、更准确地从中找到真正有价值的数据。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
2026中国航空产业大会10月底南昌启幕:首次与航博会同期举办,聚焦低空经济新路径
2026中国航空产业大会与南昌航空产业博览会将于10月31日至11月4日在南昌国际博览城首次同期举办。大会聚焦低空经济,设置主旨报告、行业专家报告及低空产业洽谈会等主题活动,旨在探讨航空产业新路径,推动低空物流、城市巡检等新业态集聚,打造中部领先、全国知名的航空产业交流高地。
联想来酷Air 16酷睿5 315版开售:国补后3739元,16英寸轻薄本选购指南
联想来酷Air 16酷睿5 315版于8月27日正式开售,搭载6核处理器与12GB内存,配备16英寸16:10屏幕。叠加国家补贴后预估到手价仅3739 15元,主打长续航与静音办公。本文详细解析其硬件配置、接口布局及购买建议,助您快速决策。
牛来AirPods保护套海外走红:萌趣硅胶设计引发关注
一款名为“牛来”的AirPods硅胶保护套在日本市场引发关注,售价约1726日元。其独特的搞怪萌趣造型、兼容多代机型的硅胶材质以及专属挂饰设计,使其在社交平台上迅速走红,成为近期备受瞩目的国产原创数码周边产品。
行李箱选购全攻略:材质、轮子与尺寸避坑指南
选购行李箱时,材质、轮子和尺寸是核心决策点。PP材质抗冲击且轻便,适合频繁托运;万向轮决定推行顺滑度;尺寸需匹配航空限重。本文拆解关键参数,结合具体产品案例,助您选出耐用且实用的行李箱。
《湮灭之潮》成都试玩会:技嘉RTX 5080风魔显卡实测体验
2026年8月《湮灭之潮》成都试玩会圆满举行,千名玩家现场体验西方奇幻大作。文章重点解析技嘉RTX 5080风魔显卡在虚幻5引擎下的表现,涵盖Blackwell架构、DLSS 4 5技术及16GB GDDR7显存对高画质流畅运行的支撑作用。
- 热门数据榜
1
2
3
4
5
6
7
8
9
10
相关攻略
2026-08-31 11:17
2026-08-28 14:44
2026-08-28 14:44
2026-08-28 14:44
2026-08-28 14:43
2026-08-28 14:43
2026-08-28 14:43
2026-08-28 14:42
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程

