
BabelDOC PDF翻译教程3分钟拿到双语对照版公式和排版不动【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOCBabelDOC 是一个开源的 PDF 翻译工具能把英文 PDF 直接翻成中英双语对照版公式、表格、排版都留在原位文档全程不离开你的电脑。装好之后一条命令就能开始翻译论文。核心能力速览产出双语对照 PDF 的开源 PDF 翻译工具BabelDOC 是一个用来翻译 PDF 文档的开源工具翻译结果保留原始版面。几个判断点双语对照默认输出原文译文并排在同一页的双语 PDF同时给你一份纯译文版本公式不破坏公式区域先被识别保护只翻译文字部分公式符号原样保留多语言支持 20 多种语言当前重点打磨英文转中文语言清单见支持语言列表本地运行程序在你机器上跑翻译调用 OpenAI 兼容接口也可以接自己部署的模型 快速开始3 条命令跑通 BabelDOC安装只需要一条命令前提是装好了 uv 这类 Python 工具链uv tool install --python 3.12 BabelDOC然后直接翻译一份 PDF翻译走 OpenAI 兼容接口babeldoc --openai --openai-model gpt-4o-mini \ --openai-base-url https://api.openai.com/v1 \ --openai-api-key your-api-key \ --files example.pdf跑完之后当前目录会多出一个同名 PDF双语对照版和单语版各一份。想用哪个模型改--openai-model和 base-url 就行。真实用法从读论文到术语一致的 3 个场景读英文论文边看中文边对原文读译文顺但想核对作者的原话时要在两个 PDF 之间来回切。BabelDOC 生成的双语版把原文和译文排在同一页视线不用离开。想反过来先看译文加--dual-translate-first只要单语版就加--no-dual。babeldoc --dual-translate-first --files paper.pdf你拿到的就是下面这种效果左侧英文原文右侧中文译文公式区域两侧完全一致。术语总被翻得不一致同一个概念模型可能这段译机器学习、下段译成machine learning 学习。BabelDOC 支持术语表一个 CSV三列source、target、tgt_lng。翻译时系统会把当前段落和术语表比对命中了就把相关词条写进提示词要求模型照译。source,target,tgt_lng machine learning,机器学习,zh-CN neural network,神经网络,zh-CNbabeldoc --glossary-files terms.csv --files document.pdf仓库里有一份术语表演示文件可以参考格式。翻译完成后全文术语统一成你定的写法。大文档翻译慢、中断要重来几百页的文档一口气翻耗时长中途失败就前功尽弃。--max-pages-per-part把文档按页数切成块逐块翻译结束后自动合并babeldoc --max-pages-per-part 50 --files large_document.pdf最终产出的仍然是一份完整的双语 PDF中途某一块失败也不会连累整份文档。进阶与技巧4 个容易被忽略的参数--pages 1,2,1-,-3,3-5只翻译指定页码。想在整本书上先翻摘要和前两章看效果时用它省 API 开销。--qps 10配合--pool-max-workers 8默认 QPS 是 4你的 API 额度宽裕时调高大文档的翻译时间明显缩短。--custom-system-prompt /no_think 你是一名专业、地道的机器翻译引擎。接 Qwen3 这类会输出思考过程的模型时加上避免思考文本混进译文。--generate-offline-assets /path/to/dir在联网机器上把模型和字体打成一个离线包拷到内网机器再用--restore-offline-assets还原。部署到无外网环境时用得上。原理速览一页 PDF 怎么变成双语 PDF整条流水线分两段解析和渲染。先用 pdfminer 和 PyMuPDF 把页面解析成一份中间 XML 表示document_il再经过版面分析、段落识别、样式与公式处理把文字交给 LLM 翻译最后由排版引擎重排字体、拼出新的 PDF。核心思路是只翻译文字页面的骨架交给排版重建。每个阶段的细节在实现细节文档里按执行顺序写好了。避坑与常见问题只支持英文转中文吗当前重点打磨英文转中文另外加了基础的中文转英文。其他语言对在列表里但组合没有被充分测试效果自行验证。译文在个别 PDF 阅读器里打开报警告或显示异常加--enhance-compatibility重试它等于一次性打开跳过清理、译文置前、关闭富文本翻译三个兼容选项。注意跳过清理会让文件体积变大。扫描版 PDF 没有文字层翻不了用--auto-enable-ocr-workaround。检测到文档大面积是扫描图时它会自动切到 OCR 路线在译文下方垫白色色块盖住原文文字强制纯黑。前提是白底黑字。第一次运行特别慢首次运行要下载模型和字体。可以先跑babeldoc --warmup预下载或者用离线包的方式绕开。能用自己部署的模型吗只要是 OpenAI 兼容接口就行Ollama 这类本地服务直接填 base-urlapi-key 随便给个非空值。想弄清某一页具体是怎么被拆开再拼回去的按顺序读一遍docs/ImplementationDetails/ 比看代码快得多。遇到解析失败的 PDF附上可复现的样张去提 Issue是修得最快的路径。【免费下载链接】BabelDOCYet Another Document Translator项目地址: https://gitcode.com/GitHub_Trending/ba/BabelDOC创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考