
曾经只能手动摘取 PDF 文字、结果乱码堆、LLM 还看不懂的苦逼日子——林芝pvc排水管专用胶水
终于要结束了!
Y Combinator 孵化的明星项目 Firecrawl 团队近放了个大招:
其联创始人兼 CTO Nicolas Camara 宣布,他们新开发的OCR It可以在 20ms 内将份不可复制的 PDF 文件内的所有文字内容提炼完,并将其转化成清晰的 Markdown 格式,AI 读完马上就能看懂。
20ms 是什么概念?
相当于你刚点完确定还没眨完眼,份处理好的 Markdown 文件就已经清清爽爽地交到你手上了。
而且它还不需要联网,可以Offline via Bundled Tesseract。
这个刚刚开源的 OCR 工具才刚发布,就在 GitHub 上获得了热门关注。
Nicolas Camara 骄傲地表示,在处理质量与 Docling 旗鼓相当的前提下,OCR It 的处理速度比 Docling 快了近 300 倍!
小伙伴们测完也纷纷在 X 上留言:
OCR It 怎么用
先,OCR It 是款适用于 Chrome 和 Firefox的费浏览器插件。
你只需框选次区域,之后每按次快捷键(或开启自动模式),它就能把整本书或整个文档变成完整且可编辑的纯文本,便你直接喂给 AI 进行总结或提问。
期间,OCR It 会默认在连续识别到两张相同页面、法继续翻页、OCR 失败或达到 300 页上限时自动停止,避在末页限重复抓取。
具体而言,手动和自动档可以分别按以下的几个步骤操作:
(注:用 Windows 和 Linux 的小伙伴们需将 option 键替换为 Alt)
1、手动档:
框选和识别:林芝pvc排水管专用胶水
先按 Option+Shift+R选定需要识别的文字区域,确认误后按 Enter 保存;
完成步框选文字区域之后,按次 Option+Shift+S,OCR It 就会开始识别当前页面,并在识别完成后会自动翻到下页。
接下来你只需要重复这个操作直到整份文档识别完毕就好了。
如果你希望进步节省时间的话,你也可以边翻页边在每页按次 Option+Shift+S,系统会立即截图并在后台自动排队执行识别任务。
检查:
全部识别完成后,你可以在插件面板中检查、修改文本,也可以重新识别单某页,PVC管道管件粘结胶后选择" Copy all "或" Download .txt "出全文,整个任务就完成啦!
2、自动档:
自动挡的话就简单多了,你只需要按下Option+Shift+A 或点击 Start auto-run,OCR It 便会自动循环执行"截图— OCR —翻页",直至文档结束。
如果你想中途结束任务的话,按 ESC 就行林芝pvc排水管专用胶水,检查流程几乎和手动档致。
此外,OCR It 仓库界面显示,它既不需要 API Key、联网、安装时也不需要索取任何网站权限,它只会在需要自动运行或操作跨域 iframe 时才按需申请当前站点的权限。
另外,浏览器内置 PDF 阅读器目前也还暂时不支持自动翻页,所以大在处理这类 PDF 时,还是尽量用手动档处理吧。
处理复杂任务时还不太稳定
不过,OCR It 虽然看起来又快又便,但还远没有到"以后把所有 PDF 都丢给它,就能枕忧"的程度。
网友们通过实测达成的个共识是:
OCR It 目前可以相当顺手地处理版式简单、文字清晰的 PDF 文档,但它还不太能处理些标题、脚注、表格、数学公式和正文段落混排的复杂页面,所以它还有不小的提升空间。
让我们期待下团队后续的新吧!
感兴趣的小伙伴们可以点进文末二个链接看看,欢迎跟我们分享你的测试结果~
参考链接:
[ 1 ] https://x.com/nickscamara_/status/2083295265793212827
[ 2 ] https://github.com/thiagotigaz/ocr-it
[ 3 ] https://www.firecrawl.dev/about
键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
� � 点亮星标 � �
科技前沿进展每日见相关词条:罐体保温 塑料挤出设备 钢绞线 超细玻璃棉板 万能胶
奥力斯 万能胶生产厂家 联系人:王经理 手机:13903175735(微信同号) 地址:河北省任丘市北辛庄乡南代河工业区
1.本网站以及本平台支持关于《新广告法》实施的“极限词“用语属“违词”的规定,并在网站的各个栏目、产品主图、详情页等描述中规避“违禁词”。
2.本店欢迎所有用户指出有“违禁词”“广告法”出现的地方,并积极配合修改。
3.凡用户访问本网页,均表示默认详情页的描述,不支持任何以极限化“违禁词”“广告法”为借口理由投诉违反《新广告法》,以此来变相勒索商家索要赔偿的违法恶意行为。
