
一条命令译出双语 PDF 论文PDFMathTranslate 上手拆解【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslatePDFMathTranslatePython 包名pdf2zh是一款开源 PDF 学术论文全文翻译工具先识别公式、图表与正文排版再调用 Google、DeepL 等服务逐段翻译并回填原文位置一次产出纯译文与双语对照版。适合需要批量阅读外文文献的研究生与工程师被 EMNLP 2025 收录为系统演示论文。它解决什么问题用普通翻译软件译论文的人都有过这段经历逐页复制文本粘进翻译工具公式变成乱码多栏排版散掉手工拼回去比读原文还费时间还得自己判断哪些该翻、哪些该保留。PDFMathTranslate 的做法是翻译前用内置版面分析模型DocLayout-YOLO ONNX 推理把页面切成正文、公式、图片、表格等区域只翻译文本区非文本区域原样保留再按原坐标把译文写回页面多栏与跨页文档不会被拆散。核心能力你得到什么排版保留公式、图表、目录、注释位置样式不变多栏/跨页文档不散架双语双输出一次翻译同时产出纯译文版与中英对照版可插拔翻译服务内置 Google、Bing、DeepL、OpenAI、Ollama、Gemini、DeepSeek 等十余种也支持任意 OpenAI 兼容接口多种使用形态命令行、Web 界面、Docker 容器、MCP 服务、Python / HTTP API5 分钟跑通第一份输出第 1 步安装工具本地运行要求 Python 3.11~3.12项目声明3.11,3.13在现成环境里直接装pip install pdf2zh第 2 步跑第一次翻译默认使用 Google 翻译服务不需要配置任何密钥对任意一个 PDF 执行pdf2zh paper.pdf完成后当前目录生成两个文件paper-mono.pdf纯译文版和paper-dual.pdf双语对照版。首次运行卡在模型下载程序首次运行会下载版面检测模型网络不通时先设置镜像源再运行Windows 用setPowerShell 用$env:set HF_ENDPOINThttps://hf-mirror.com习惯点选的话一条命令启动 Web 界面pdf2zh -i浏览器打开http://localhost:7860/即可。按使用深度选你的路径只想要结果Web 界面适合不想记参数的用户。启动后把 PDF 拖进窗口点Translate翻译完直接在浏览器里预览并下载-mono.pdf与-dual.pdf。Service 下拉选择翻译服务部分需要密钥Translate to目标语言界面支持英语、简繁中文、日语、韩语等 10 种Pages整篇或只译前几页--share生成对外可访问的临时链接--authorized users.txt用用户名,密码文件限制登录用户可自定义登录页pdf2zh -i更多界面选项见 GUI 文档。要调参数PDF 翻译命令行常用组合适合想精确控制语言、页码与服务的用户。-li/-lo源语言与目标语言代码参照各服务的支持列表-p页码范围-p 1-3,5表示第 1~3 页和第 5 页-s翻译服务服务名:模型名写法可直接指定模型-t多线程数长文档可适当加大-f/-c用正则声明保持原样不翻译的字体与字符Math、Mono、Italic 等数学/代码字体默认已保护# 英文→中文只翻译第 1~3 页和第 5 页 pdf2zh paper.pdf -li en -lo zh -p 1-3,5 # 换用 DeepL结果输出到 out 目录 pdf2zh paper.pdf -s deepl -o out本地文件之外PDF 的 URL 也可以直接作为输入。完整参数表与语言代码见 docs/ADVANCED.md。要嵌进自己的系统API 集成与 MCP 接入开发者有三种集成方式细节见 API 文档。from pdf2zh import translate params {lang_in: en, lang_out: zh, service: google, thread: 4} file_mono, file_dual translate(files[example.pdf], **params)[0]HTTP API安装pdf2zh[backend]后运行pdf2zh --flask与pdf2zh --celery worker通过 REST 接口提交任务、查询进度、下载结果依赖 RedisMCP 服务pdf2zh --mcp可加--sse把翻译能力暴露给 Claude Desktop 等 MCP 客户端用自然语言让助手找文件并翻译要批量、可复现目录级批量 PDF 翻译与缓存适合需要整目录处理文献、且要求结果可复现的科研团队。--dir遍历目录内的 PDF 逐一处理--config config.json加载配置文件可预写语言、字体路径与多组翻译服务含密钥不指定时读取~/.config/PDFMathTranslate/config.json--prompt prompt.txt自定义发给大模型的翻译指令模板可用${lang_in}、${lang_out}、${text}三个变量适合注入领域术语要求缓存已翻译文本段写入缓存重复翻译同一文档不再消耗 API 额度--ignore-cache强制重新翻译--skip-subset-fonts关闭字体子集裁剪个别阅读器兼容不佳时使用pdf2zh --dir /path/to/papers/从单台机器到团队服务Docker 部署与更多形态Docker 部署适合团队共用一台翻译服务跑完浏览器访问http://localhost:7860/与本机 GUI 是同一套界面。仓库内 Dockerfile 与 docker-compose.yml 可二次定制docker pull byaidu/pdf2zh docker run -d -p 7860:7860 byaidu/pdf2zhWindows 免安装版从发布页取pdf2zh.exe压缩包解压后双击运行打不开就按提示补装 VC 运行库vc_redist.x64.exe。HTTP 后端服务pip install pdf2zh[backend]后运行pdf2zh --flask与pdf2zh --celery worker用 REST 接口提交任务、查进度方便做成自己的在线服务接口细节见 docs/APIS.md。实验特性--mode precisev2 翻译内核需先运行pdf2zh-setup-precise搭建独立环境面向跨栏跨页一致性等边缘场景生产环境慎用。实验特性--babeldoc换用 BabelDOC 后端翻译可搭配-s openai使用。用之前确认这几件事适合带文本层的电子 PDF学术论文、技术报告、标准文档、教材需要译文 原文对照学习双语表达的场景-dual.pdf输出需要批量、可复现处理整目录文献的科研或工程团队把翻译能力接进自己系统或 AI 助手的工作流API / MCP不适合 / 注意扫描版、图片型 PDF程序识别的是 PDF 内嵌文本纯图片页没有可翻译的文本需先做 OCR翻译质量取决于所选服务默认 Google 免配置术语质量要求高时换 DeepL 或大模型服务并用--prompt注入领域要求付费服务需配密钥DeepL、OpenAI、Gemini 等均需在环境变量或配置文件中提供 API Key变量名对照见 docs/ADVANCED.md自建中转代理BASE_URL必须带/v1后缀否则 404配置示例见 docs/PROXY_CONFIGURATION.md环境要求本地运行需 Python 3.11~3.12可用 Docker 或 Windows 免安装版绕过正式交付先用默认模式--mode precise属实验特性参考与许可完整参数表与翻译服务环境变量对照docs/ADVANCED.mdPython / HTTP API 集成参考docs/APIS.mdGUI 使用细节docs/README_GUI.md项目以 AGPL-3.0 协议开源可自由使用、修改与分发装好、丢一份 PDF 进去几分钟拿到两份双语文件比读十页文档更快建立判断。【免费下载链接】PDFMathTranslate[EMNLP 2025 Demo] PDF scientific paper translation with preserved formats - 基于 AI 完整保留排版的 PDF 文档全文双语翻译支持 Google/DeepL/Ollama/OpenAI 等服务提供 CLI/GUI/MCP/Docker/Zotero项目地址: https://gitcode.com/GitHub_Trending/pd/PDFMathTranslate创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考