Grab视觉语言模型新突破!攻克东南亚多语言文档识别难题
东南亚科技企业Grab近日宣布,其自主研发的视觉大语言模型在文档处理领域取得突破性进展。这款专为东南亚多语言环境设计的模型,成功解决了传统技术处理非拉丁字母文档的难题,在身份证、驾照等关键证件识别任务中展现出显著优势。
作为覆盖新加坡、马来西亚、印尼等八个国家的超级应用平台,Grab每日需处理海量多语言文档。工程技术团队发现,现有商业模型在解析东南亚语言时普遍存在两大缺陷:一是字符识别错误率居高不下,二是图像处理延迟严重。即使开源视觉模型在效率上表现优异,但面对复杂文档模板时仍难以保证准确性,这给客户身份验证等合规工作带来巨大挑战。
研发团队经过技术评估,最终选定阿里云Qwen2-VL模型的作为基础架构。该模型具备三大核心优势:支持东南亚多语言处理、可动态适配不同分辨率图像,且模型体积适中便于部署。为构建专属训练数据集,工程师们从Common Crawle开源库中筛选东南亚语言内容,同时开发内部合成系统,生成包含多样化字体和背景的文本图像样本。
在模型优化阶段,团队采用分阶段微调策略。初期通过低秩适配技术快速验证印尼文本文档的处理效果,当发现泰语、越南语等语言存在特殊视觉模式后,立即启动全参数微调。经过数轮迭代训练,最终诞生的轻量化模型不仅在字符识别准确率上超越主流OCR工具,其图像处理速度较通用模型提升40%。
这项技术突破已产生实质性应用价值。在马来西亚驾照识别场景中,新模型将错误率从18%降至3.2%;越南身份证信息提取的完整率提升至97%,较传统方案提高23个百分点。Grab工程负责人表示,通过精准筛选高质量训练数据,小型专业模型完全能够实现效率与效果的双重突破。
目前,该模型已集成至Grab核心业务系统,支持打车、外卖、金融等场景的实时文档核验。研发团队正着手扩展模型能力边界,计划开发支持手写体识别、多语言混合文档解析等高级功能,以应对东南亚市场日益复杂的数字化需求。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
蔡司6月2日发布新品镜头技术迎来重大突破
蔡司宣布将于6月2日发布一款新镜头,并称其为镜头技术的重大突破,标志着全新纪元的开启。官方仅公布了产品剪影,但措辞暗示其可能带来根本性的技术升级,例如全新光学结构、先进镀膜或对焦系统改进。具体细节需待发布日揭晓。
神舟二十三号飞船将携带九项科学实验进驻中国空间站
据中国科学院空间应用工程与技术中心最新消息,神舟二十三号载人飞船即将发射升空,计划携带总计9项前沿科学实验项目进驻中国空间站。此次上行实验的样品及配套装置总重约54公斤,实验材料种类丰富,涵盖了肝脏细胞、水稻与拟南芥种子、纳米酶、放线菌以及钙钛矿太阳能电池等关键领域,旨在利用空间站独特环境开展多学科
香港女警黎家盈任载荷专家 资讯科技专长助力航天任务
5月23日上午,酒泉卫星发射中心举行神舟二十三号载人飞行任务新闻发布会,正式宣布任务计划。根据安排,神舟二十三号载人飞船将于北京时间5月24日23时08分准时发射升空。 本次飞行乘组的组成备受瞩目。神舟二十三号任务乘组由指令长朱杨柱、航天员张志远以及来自中国香港的载荷专家黎家盈共同构成。这标志着中国
苹果Beats新款头戴耳机通过FCC认证即将上市
美国联邦通信委员会数据库出现一款型号为A3577的蓝牙头戴式耳机,并非已知的AirPodsMax2。目前公开信息极少,仅有一张普通耳机耳罩图片。推测其可能属于苹果旗下Beats品牌的新一代产品,如BeatsStudioPro的更新型号,但具体身份仍有待后续信息确认。
永辉超市转型裁员三万人 CEO涨薪引争议
永辉超市因大连御锦拖欠股权转让尾款36亿余元申请强制执行,担保人王健林承担连带责任。永辉近年推行“胖改”后关店裁员约三万人,CEO薪酬却大幅上涨。追债成功与否存疑,万达自身债务压力使款项回收难度极大。此事关乎永辉现金流,已成为生存攸关的紧迫问题。
- 日榜
- 周榜
- 月榜
1
2
3
4
5
6
7
8
9
10
相关攻略
2015-03-10 11:25
2015-03-10 11:05
2021-08-04 13:30
2015-03-10 11:22
2015-03-10 12:39
2022-05-16 18:57
2025-05-23 13:43
2025-05-23 14:01
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程
热门话题

