OCR 文字识别让图片和 PDF 变得可搜索
Joplin 内置 OCR(光学字符识别):自动扫描你笔记里的图片和 PDF,把里面的文字提取出来纳入搜索。扫描版合同、截图里的报错信息、拍照的板书,从此都能搜到。
开启与范围
- 新版本默认开启;没开的话到 配置 > 一般 区块打开;
- 只在桌面端执行扫描(识别耗资源),PNG 与 JPEG 图片和 PDF 都会处理;
- 识别结果经同步分发给移动端——手机上也能搜到图内文字。
识别的可靠度:印刷体效果最好,PDF 尤佳,清晰截图也不错;手写体目前不支持,随手拍照的文字视清晰度而定。
搜索与查看
- 搜索命中附件时,相关笔记顶部会出提示条,告诉你"这条笔记的附件里有匹配内容";
- 想看识别出了什么:右键图片或 PDF 链接 > "查看 OCR 文本",会生成对应的文本文件打开;
- 生成可选文字的 PDF:对纯图片扫描版 PDF 右键选"创建可访问文档",得到带隐形文字层的 PDF(可选中复制、可被阅读器朗读)。
隐私亮点:全程离线
官方明确强调:OCR 完全在本地离线完成,图片不会上传到任何第三方云端做识别——与"离线优先"的整体设计一脉相承。
两个使用提示
- 首次开启 CPU 会飙:应用要扫描历史全部附件,量大时让它跑一会,扫完恢复常态;
- 语言数据:识别用的语言文件首次使用时联网下载并缓存;完全离线的电脑可以通过设置项手动指定语言数据目录(官方文档有分步说明)。
与搜索体系的关系
OCR 把"附件层"纳入了全文搜索与过滤器的射程——resource:application/pdf 这类查询配合 OCR,检索深度上一个台阶。
识别能力与支持语言可能随版本变化,以官方最新版为准。