返回首页

OCR

找到 6 篇关于此标签的文章

PP-OCRWebAssembly

OCR 装进一个 HTML 文件就能用:边缘 AI 开始挤掉云端 API

百度开源的 PP-OCR 被开发者打包成单个 HTML 文件,靠 WebAssembly 让浏览器离线跑 OCR。不装 Python、不要服务器、图片不出本机 — 边缘 AI 第一次以「可执行文档」的形态落地,OCR 这种最常见的视觉 AI 多了一条不依赖云端的部署路径。

2d ago2 分钟
WorkBuddy腾讯云

WorkBuddy 半小时审完 8 份标书 — 这才是 AI Agent 落地的样子

腾讯 WorkBuddy 配合自家 OCR 能力,演示了一套 AI Agent 审核投标文件的流程:8 份 PDF 生成 4 个审查文档,覆盖 30 个合规检查点。值得关心的是,'AI Agent 落地'到底是营销话术,还是真的能嵌入企业日常工作流。

Aug 192 分钟
百度Unlimited-OCR

百度开源 Unlimited-OCR,把长文档识别做成一次完成,但离商用还有距离

百度开源 Unlimited-OCR,核心卖点是“长文档 OCR 一次完成”,不必把超长页面切成很多小块再拼接。值得关心的是,这不是单纯提速,而是在票据、合同、档案等场景里,重新争夺企业文档入口。

Jun 242 分钟
PP-OCRv6Hugging Face

PP-OCRv6 把多语言读字模型做到 3450 万参数,实用型 AI 还在继续变便宜

PP-OCRv6 在 Hugging Face 发布,覆盖 50 种语言,模型从 150 万到 3450 万参数不等。我们的判断是,这不是又一个大模型新闻,而是企业更容易把“看懂文档、票据、表单”这类老问题,用更低成本重新做一遍。

Jun 222 分钟
DeepSeek多模态

DeepSeek 多模态灰度测试 — 秒出识别但色盲卡全败,编程场景最受益

DeepSeek 灰度上线多模态,OCR 和图表识别速度极快,但色盲卡两种模式均失败,暴露视觉感知短板。对编程场景意义最大,图转 HTML 已可用但细节不及 Gemini。

May 12 分钟
OCR本地部署

本地OCR模型崛起:票据识别外包的终结倒计时

llama.cpp现已支持本地运行OCR模型,企业文档识别可脱离云端API,倒逼每年千万级票据外包市场重新定价。

Apr 102 分钟