要识别文本型 PDF 中的字体,应检查文件内部保存的字体信息。将 PDF 上传到 PDF Font Checker,即可列出字体名称、类型、编码、子集和检测到的嵌入状态。在 Adobe Acrobat 中也可以打开文档属性 → 字体查看列表。
该方法适用于包含真实文本和字体对象的 PDF。扫描页把字母保存为像素,转曲文字则把字母保存为矢量形状,两者都可能不再包含原始字体名称。遇到这种情况,应截取清晰文字做视觉字体识别,再人工核对候选结果。
快速识别流程
- 确认文字能否被选择。
- 检查你实际要编辑或打印的那份 PDF。
- 记录基础字体名、类型、编码与嵌入检测结果。
- 确定需要原字体、获许可的替代字体,还是重新导出。
- 在编辑、打印或交付前再次检查最终文件。
先判断 PDF 的内容类型
| 内容 | 文件通常包含什么 | 首选方法 |
|---|---|---|
| 可选择文本 | 文本指令和字体对象引用 | 检查 PDF 字体列表 |
| 扫描页面 | 不带原始字体名称的页面图像 | 用 OCR 识别文字,用视觉工具识别字形 |
| 转曲文字 | 看起来像字母的矢量形状 | 视觉对比并检查源文件 |
| 混合型 PDF | 文本、扫描图、徽标和转曲图形 | 结合文件检查与视觉对比 |
尝试选择并复制一句话。如果无法取得有效文本,可用 PDF Text Extractor 判断页面是否只有图像。这也能解释为什么页面明明有文字,字体列表却是空的。
使用 PDFCheck 识别字体
- 1. 打开 PDF Font Checker。
- 2. 上传最终副本。另一次导出可能使用不同的字体集合。
- 3. 查看字体总数、检测到的已嵌入和未嵌入字体、子集数量与类型分布。
- 4. 逐行记录基础名称、PDF 字体类型、编码、字体类别和状态。
- 5. 按目标解释结果。编辑文字可能需要已安装且许可合适的字体;可靠显示和打印通常依赖正确嵌入。
- 6. 尽可能修改可维护的源文件,重新导出,再检查新的 PDF。
如何理解字体名称与状态
| 结果 | 含义 | 下一步 |
|---|---|---|
| 基础字体名 | PDF/PostScript 内部名称,可能与商品名不同 | 搜索时保留准确拼写和样式后缀 |
ABCDEF+FontName | 六字母前缀通常代表字体子集 | 搜索加号后面的名称 |
| 已嵌入 | 检查器检测到与该字体关联的字体资源 | 仍需在目标设备或打印流程上校对 |
| 未嵌入 | 阅读器可能依赖本机字体或使用替代字体 | 在源文件中选用可嵌入字体并重新导出 |
| 类型 / 编码 | Type0、TrueType、CID 或编码名等技术信息 | 用于排查提取、编辑和制作问题 |
字体子集本身不一定有问题。它通常只包含 PDF 实际使用的字形,从而减小文件体积;当你要加入子集中没有的字符时,限制才会出现。Adobe 的字体嵌入、子集与替换说明解释了这些差别。
在 Adobe Acrobat 中手动检查
Adobe 的操作方法是:打开 PDF,在 Windows 中选择菜单 → 文档属性 → 字体,或在 macOS 中选择文件 → 文档属性 → 字体,然后准确记录列表中的名称。参阅 Adobe 的查找 PDF 字体名称指南。
Acrobat 适合快速桌面检查;PDFCheck 会把基础名称、类型、编码、子集和检测到的嵌入状态整理为结构化报告。两种方法都无法视觉识别已经变成图像或轮廓的字形。
字体名称为什么看起来不对
- 子集前缀:搜索字体族时忽略六个大写字母和加号。
- 内部命名:PostScript 名称可能没有空格,并带有 Bold、Italic 或 Condensed 等后缀。
- 字体替换:导出服务可能替换无法合法或技术性嵌入的字体。
- 多个文本段:不同样式、文字系统、符号和备用字符可能各用一个字体对象。
- 扫描或转曲:肉眼看到的字体可能完全不出现在列表中。
Microsoft 的 Office PDF 导出指南提醒,不能嵌入的字体可能被替换。对于 Office 源文件,应先解决字体可用性和导出设置,再检查新生成的 PDF。
按用途选择下一步
- 编辑文字:取得可编辑源文件和许可合适的匹配字体,或有意识地选择替代字体。
- 送印:确认印刷方要求的 PDF 配置和字体规则,将对方的印前检查与 PDF Validator 结合使用。
- 无障碍发布:真实文本和 Unicode 映射很重要,只有字体对象并不代表无障碍。使用 PDF Accessibility Checker 并人工审查。
- 减小体积:谨慎使用子集,不要盲目移除字体;按兼顾质量的压缩流程操作。
- 长期归档:采用指定的 PDF/A 配置和合适的合规验证器,并查看 PDF 标准说明。
PDFCheck 无法证明什么
PDFCheck 读取 PDF 解析器能够发现的字体信息。它不能视觉识别扫描或轮廓中的字体,不能把某个准确字体分配给点击的单词,也不会授予字体许可、安装或嵌入缺失字体,更不会认证印刷或 PDF/A 合规性。请把报告视为诊断清单,并在实际使用流程中验证最终文件。
最终检查清单
- 已区分真实文本、扫描图和转曲文字。
- 已记录去掉子集前缀后的基础字体名。
- 已检查类型、编码和检测到的嵌入状态。
- 字体许可允许计划中的编辑或再分发。
- 如有可能,已修复可维护的源文件并重新导出。
- 已在目标设备、打印或提交流程中检查最终副本。
从 PDF Font Checker 开始。如果文件损坏或无法解析,请先按无效 PDF 故障排查流程处理。