DeepSeek引爆AI圈:视觉路线成焦点,Karpathy等大佬如何评价?
近期,AI领域迎来了一项引人瞩目的技术突破——DeepSeek团队开源的DeepSeek-OCR模型凭借其独特的视觉压缩技术,在GitHub上迅速斩获超过4000个Star,引发全球开发者与科研人员的热烈讨论。该模型通过将文本转换为视觉token的方式,实现了对长文本的高效压缩与处理,为解决大模型上下文效率问题提供了全新思路。
免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈
该技术的核心在于视觉token的压缩效率革新。传统多模态模型中,视觉token通常仅用于处理图像或无法用文字描述的内容,因其空间占用远高于文本token。举例来说,一万个英文单词若转换为文本token约需15000个,而视觉token可能达到3万至6万个。但DeepSeek的研究表明,通过特殊压缩算法,视觉token的效率可提升10倍,使得原本需要10000个单词的文本,理论上仅需约1500个压缩视觉token即可完整表示。
这一突破引发了关于人类认知机制的联想。研究指出,人类大脑在回忆文本内容时,往往依赖视觉记忆定位,如记住段落所在页码、位置等信息。这种生物机制与视觉token压缩的思路不谋而合,但模型能否在压缩视觉token的基础上保持语言推理能力,仍是待解的疑问。有研究者提出,过度依赖视觉表征可能削弱模型的语言表达能力,但若能平衡效率与性能,该技术或将成为扩展模型上下文容量的关键路径。
行业反响呈现两极分化。支持者认为,结合DeepSeek此前发布的稀疏注意力机制,该技术有望使大模型上下文窗口扩展至千万级token。例如,用户可将整个代码库或企业文档集作为提示词前缀输入模型,通过缓存机制实现快速查询,无需依赖外部搜索工具。纽约大学助理教授谢赛宁对此表示认同,他曾在扩散Transformer研究中探索过视觉与文本的融合路径。
批评声音则聚焦于技术原创性。有研究者指出,哥本哈根大学2024年发表的《Language+Modelling+with+Pixels》已提出类似概念,其开发的PIXEL架构通过将文本渲染为图像,实现了跨语言的表征迁移。此后,CVPR+2024、NeurIPS+2024等会议陆续出现相关改进研究,包括仅用像素处理图像与语言的CLIPPO模型,以及利用视觉token扩展文本上下文的多模态学习方案。
尽管存在争议,DeepSeek-OCR的开源策略获得广泛认可。技术社区迅速展开实践探索,Django框架联合创始人Simon+Willison仅用4个提示词便在英伟达Spark硬件上运行该模型,耗时40分钟;科技博主NiceKate+AI则成功将其部署至Mac设备。这些案例显示,该模型在工程实现上具有较高可行性。
值得关注的是,部分研究者认为谷歌Gemini模型可能已应用类似技术。其庞大的上下文窗口与优秀的OCR性能,或源于视觉token压缩的隐藏能力。但DeepSeek的完全开源策略,使任何团队均可验证并改进这一技术,这种透明度在商业竞争中显得尤为珍贵。
在Hacker+News等平台,讨论延伸至模型认知能力的边界。有用户设想,若模型能像物理学家Hans+Bethe般记忆海量数据,将极大提升知识调用效率。例如,将整个元素周期表或代码库存入上下文窗口,可能彻底改变科研与编程模式。然而,这种“工作记忆”扩展是否以牺牲语言表现为代价,仍需更多实证研究。
游乐网为非赢利性网站,所展示的游戏/软件/文章内容均来自于互联网或第三方用户上传分享,版权归原作者所有,本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容,请联系youleyoucom@outlook.com。
同类文章
逼AI当山顶洞人!Claude防话痨插件爆火,网友:受够了AI废话
新智元报道编辑:元宇【新智元导读】一个让AI像原始人一样说话的插件,在HN上一夜爆火,冲破2w星。它的核心只是一条简单粗暴的prompt:删掉冠词、客套和一切废话,号称能省下75%的输出token。
季度利润翻 8 倍,最赚钱的「卖铲人」财报背后,内存涨价狂潮如何收场?
AI 时代最赚钱的公司,可能从来不是做 AI 的那个。作者|张勇毅编辑|靖宇淘金热里最稳赚的人,从来不是淘金的,是卖铲子的。这句老话在 2026 年的科技行业又应验了一次。只不过这次卖铲子的不是英伟
Claude Code Harness+龙虾科研团来了!金字塔分层架构+多智能体
Claw AI Lab团队量子位 | 公众号 QbitAI你还在一个人做科研吗?科研最难的,从来不是问题本身,而是一个想法从文献到实验再到写作,只能靠自己一点点往前推。一个人方向偏了没人提醒,遇到歧
让离线强化学习从「局部描摹」变「全局布局」丨ICLR'26
面对复杂连续任务的长程规划,现有的生成式离线强化学习方法往往会暴露短板。它们生成的轨迹经常陷入局部合理但全局偏航的窘境。它们太关注眼前的每一步,却忘了最终的目的地。针对这一痛点,厦门大学和香港科技大
美国犹他州启动新试点项目:AI为患者开具精神类药物处方
IT之家 4 月 5 日消息,据外媒 PC Mag 当地时间 4 月 4 日报道,美国医疗机构 Legion Health 在犹他州获得监管批准,启动一项试点项目,允许 AI 系统为患者开具精神类药
- 日榜
- 周榜
- 月榜
相关攻略
2015-03-10 11:25
2015-03-10 11:05
2021-08-04 13:30
2015-03-10 11:22
2015-03-10 12:39
2022-05-16 18:57
2025-05-23 13:43
2025-05-23 14:01
热门教程
- 游戏攻略
- 安卓教程
- 苹果教程
- 电脑教程
热门话题

