DeepSeek开源新模型:用视觉模式实现上下文压缩。
10月20日 ,DeepSeek宣布开源最新大模型DeepSeek-OCR 。所谓的OCR,据DeepSeek在论文中解释称,是通过光学2D映射压缩长上下文可行性的初步研究。DeepSeek-OCR由两部分组成:DeepEncoder和作为解码器的DeepSeek3B-MoE-A570M。DeepEncoder作为核心引擎 ,设计为在高分辨率输入下保持低激活,同时实现高压缩比,以确保视觉tokens数量优化且可管理 。
通俗而言 ,这是一种视觉-文本压缩范式,通过用少量的视觉token来表示原本需要大量文本token的内容,以此降低大模型的计算开销。
据公布的论文名单显示,该项目由DeepSeek三位研究员Haoran Wei、Yaofeng Sun 、Yukun Li共同完成 ,但这三位核心作者都颇为低调,其中一作作者Haoran Wei曾在阶跃星辰工作过,曾主导开发旨在实现“第二代 OCR ”的GOT-OCR2.0系统。
DeepSeek-OCR的架构分为两部分 。一是DeepEncoder ,一个专为高压缩、高分辨率文档处理设计的视觉编码器;二是DeepSeek3B-MoE,一个轻量级混合专家语言解码器。这款刚开源不久的新模型,发布后就得到海外科技媒体广泛赞美 ,有网友盛赞:“这是AI的JPEG时刻。”
前特斯拉AI总监、OpenAI创始成员安德烈·卡帕西(Andrej Karpathy)在社交媒体高度评价DeepSeek的新模型,他表示,自己相当喜欢新的DeepSeek-OCR论文 ,“它是一个很好的OCR模型(可能比dots稍微差一点),是的,数据收集等等 ,但无论如何都不重要。对我来说更有趣的部分(尤其是作为一个以计算机视觉为核心,暂时伪装成自然语言的人)是像素是否比文本更适合作为LLM的输入 。作为输入,文本标记是否浪费且糟糕。”
根据他的设想,或许所有LLM的输入都只应该是图像。即便是纯文本内容 ,也应该先渲染成图片再输入给模型,其中理由包括:信息压缩效率更高 、像素更通用、支持双向注意力、可淘汰存在安全隐患的分词器(Tokenizer) 。
特斯拉创始人马斯克(Elon Musk)也现身评论区,并表示:“从长远来看 ,AI模型超过99%的输入和输出都将是光子,没有其他任何东西可以规模化。 ”
知名科技媒体《麻省理工科技评论》解释称,DeepEncoder是整个系统的关键所在。它的设计目标在于 ,在处理高分辨率输入图像的同时,保持较低的激活内存,并实现极高的压缩比 。为达到这一目的 ,DeepEncoder融合两种成熟的视觉模型架构:SAM(Segment Anything Model)和 CLIP(Contrastive Language–Image Pre-training)。前者以窗口注意力机制(window attention)见长,擅长处理局部细节,构成编码器的前半部分;后者则依赖密集的全局注意力机制(global attention) ,能够捕获整体知识信息。
《麻省理工科技评论》表示,除了文本识别性能,DeepSeek-OCR还具备较强的“深度解析”能力 。这得益于其训练数据中包含了图表 、化学分子式、几何图形等多样化的视觉内容。因此,模型不仅能识别标准文本 ,还能对文档中嵌入的复杂元素进行结构化解析。例如,它可以将报告中的图表转换为表格数据,将化学文献中的分子式输出为SMILES格式 ,或解析几何图形中的线段关系 。这种超越传统文本识别的能力,拓展了其在金融、科研、教育等专业领域的应用空间。
DeepSeek介绍,实验表明 ,当文本tokens数量在视觉tokens的10倍以内(即压缩比<10×)时,模型可达到97%的OCR精度。即使在20×压缩比下,OCR精度仍保持在约60%。这为历史长上下文压缩和LLM中的记忆遗忘机制等研究领域展示可观前景 。
DeepSeek-OCR还初步验证上下文光学压缩的可行性 ,证明模型可以从少量视觉tokens中有效解码超过10倍数量的文本tokens。DeepSeek-OCR也是一个高度实用的模型,可大规模生产预训练数据,“未来 ,我们将进行数字-光学文本交错预训练 、大海捞针测试等进一步评估,继续推动这一有前景的研究方向。”
据海外科技媒体分析,研究团队表示,在基准测试中 ,DeepSeek-OCR优于多个主流模型,且使用的视觉tokens数量少得多 。此外,单张A100-40G GPU每天可生成超过20万页的训练数据 ,可为大型语言模型和视觉-语言模型的开发提供支持。
前网易副总裁、杭州研究院执行院长汪源发文表示,DeepSeek-OCR模型是一个专门能“读懂 ”图片里文字的AI模型。但厉害的地方不是简单“识字”,是采用了一种非常新颖的思路:把文字当成图片来处理和压缩 。
汪源认为 ,可以把它想象成一个超级高效的“视觉压缩器”,传统的AI模型是直接“读”文本,但 DeepSeek-OCR 是先“看 ”文本的图像 ,然后把一页文档的图片信息高度压缩成很少的视觉tokens。DeepSeek-OCR的能力强在能把一篇1000字的文章,压缩成100个视觉tokens。在十倍的压缩下,识别准确率可以达到96.5% 。
玩股票开户需要多少钱:中国股票配资网平台官网-营收过亿的娃哈哈上海工厂为何改卖“沪小娃”?
手机买股票怎么买第一次:怎么买股票开户要多少钱-突然!俄罗斯发动大规模袭击!俄乌紧张局势加剧
手机用什么买股票:股票开户费用哪家低-开源证券:光伏反内卷持续深化 关注贝塔修复
北京股票配资官方网站查询:炒股票要多少钱开户-主力资金一周调仓路线图曝光!消费龙头获大幅加仓
股票手机开户哪个app好:股票配资平台全国招商-特朗普的“沉默48小时”:揭秘美联储降息背后 鲍威尔如何赢得一场11:1的独立性之战
买第一次买股票怎么开户:股票配资平台配资炒股-爆火仅半年 DeepSeek在银行业已“泯然众模型”?三大障碍成为拦路虎
炒股票买什么手机好:股票配资开户费用-上半年最热十大板块梳理:DeepSeek概念傲视全场 人形机器人、军工板块掀上涨热潮
道正网配资-正规合法股票配资平台 ,可靠股票配资公司提示:文章来自网络,不代表本站观点。
道正网配资-正规合法股票配资平台 ,可靠股票配资公司⑯股票配资平台持续优化服务流程,提高响应速度,确保客户在需要时能够迅速得到帮助。
3月24日,海洋王照明科技股份有限公司(以下简称“海洋王”,002724.SZ)早盘一字跌停,此后股价拉涨,尾盘封涨停板...
记者王珍中国国际经济交流中心副理事长、国务院发展研究中心原副主任王一鸣周一在“中国发展高层论坛2025...
记者辛圆给补贴、建平台,为了吸引更多高层次人才,各地纷纷放出“大招”。据央广网周一发布消息,湖...
作者:ACE1.对于中国的互联网大亨来说,刚刚过去的2021年,是被载入史册的一年。只不过,载入...
界面新闻记者|龙力开年两个多月,不少头部量化私募都在积极“上新”。Wind数据显示,截至3月17日,...
3月24日,易方达国证自由现金流ETF公开发售。该产品跟踪国证自由现金流指数,这个指数是什么?有哪些优势?投资价值如何?...
记者辛圆3月25日,博鳌亚洲论坛旗舰报告《亚洲经济前景及一体化进程2025年度报告》(以下简称《报告》...
3月10日,“连锁火锅第一股”呷哺呷哺开盘再下跌,股价不足一港元,已成“仙股”。此前,呷哺呷哺(0520.HK)...
记者|赵阳戈年初,证监会就修改《证券发行与承销管理办法》部分条款向社会公开征求意见,市场也将注意力投向了...
记者闫桂花激发增长新动能,哪些领域需要进一步深化改革?在3月23日举行的中国发展高层论坛2025年年会...
2025年3月25日,倍轻松(688793.SH)公告称,公司股东宁波倍松投资有限公司(简称“宁波倍松”)拟通过大宗交易...
3月24日,AI眼镜概念股开盘拉升,瀛通通讯直线涨停,明月镜片涨超10%,比依股份、博士眼镜、恒玄科技、国光电器等跟涨。...
近日,开源证券大连分公司遭大连证监局处罚,暂停其办理需要合格投资者认定相关业务六个月。该惩处力度在近年来券商分支机构中并...
当地时间3月24日,特斯拉美股涨幅扩大至5%,现报262.055美元/股。...
【隔夜行情】•周五(2025年3月21日),A股三大指数集体下跌,截至收盘,截止收盘,沪指跌1.29%,报收33...