Skip to content

Paper2Any 论文多模态工作流

文档说明

社区开源的论文转换工具,支持将学术论文一键转换为模型架构图、技术路线图、PPT演示文稿、Rebuttal等多种格式,通过 FastAiToken 调用 GPT、Claude 等大模型。

概述

Paper2Any 是一个开源的论文多模态工作流平台,专注于学术论文的格式转换与可视化。支持从论文 PDF/截图/文本出发,一键生成模型架构图、技术路线图、实验图表、PPT 演示文稿等多种输出格式。

项目信息

  • 🔗 开源地址:github.com/OpenDCAI/Paper2Any
  • 📜 许可证:开源
  • 👤 组织:OpenDCAI
  • ⭐ 该项目由社区贡献,支持通过 FastAiToken 调用多种大模型

为什么选择 Paper2Any

支持论文转架构图、路线图、PPT、Rebuttal 等,一个工具覆盖科研全流程 支持动态切换 GPT-4o、Claude Sonnet、Qwen-VL 等模型,无需硬编码,通过 API 参数即可指定 提供命令行脚本和 Web 界面两种使用方式,适合不同场景需求 原生支持 OpenAI 兼容 API 格式,只需配置 FastAiToken 的 Base URL 即可接入 400+ 模型

核心功能模块

功能模块说明输出格式
Paper2Figure论文生成科研可视化图模型架构图、技术路线图(PPTX + SVG)、实验图表
Paper2Diagram论文/文本/图片生成流程图draw.io / PNG / SVG
Paper2PPT论文转 PPT 演示文稿PPTX(支持 40+ 页长文档)
Paper2Rebuttal生成结构化审稿回复带证据引用的 Rebuttal 文档
PDF2PPTPDF 保留排版转可编辑 PPTPPTX
Image2PPT图片/截图转结构化幻灯片PPTX
PPTPolishAI 驱动的 PPT 排版优化PPTX
知识库文件导入、语义搜索,驱动 PPT/播客/思维导图生成多种格式

通过 FastAiToken 接入大模型

Paper2Any 支持 OpenAI 兼容 API 格式,配置 FastAiToken 作为 LLM 服务端点后,即可使用 GPT、Claude、Gemini、DeepSeek 等 400+ 模型。

Docker 部署配置

  1. 访问 FastAiToken控制台 注册/登录 2. 进入【令牌】栏目 3. 点击生成新的 API 密钥 4. 复制密钥(以 sk- 开头)备用 克隆仓库后,编辑 fastapi_app/.env 文件,配置 FastAiToken 作为 LLM 端点:
text
# fastapi_app/.env

DEFAULT_LLM_API_URL=https://fastaitoken.com/v1
BACKEND_API_KEY=sk-你的FastAiToken密钥

可选:为不同工作流指定默认模型:

bash
PAPER2PPT_DEFAULT_MODEL=gpt-4o
PDF2PPT_DEFAULT_MODEL=gpt-4o
编辑 `frontend-workflow/.env` 文件,让 Web 界面默认使用 FastAiToken:
bash
# frontend-workflow/.env

VITE_DEFAULT_LLM_API_URL=https://fastaitoken.com/v1
VITE_LLM_API_URLS=https://fastaitoken.com/v1

    使用 Docker Compose 一键启动:

docker compose up -d --build

text

启动完成后,访问前端页面即可开始使用。

CLI 命令行使用Paper2Any 提供独立的命令行脚本,支持通过 --api-url 和 --api-key 参数直接指定 FastAiToken:
# 论文转 PPT

python script/run_paper2ppt_cli.py \
  --input paper.pdf \
  --api-url https://fastaitoken.com/v1 \
  --api-key sk-你的FastAiToken密钥 \
  --model gpt-4o

# 论文转科研图

python script/run_paper2figure_cli.py \
  --input paper.pdf \
  --api-url https://fastaitoken.com/v1 \
  --api-key sk-你的FastAiToken密钥 \
  --graph-type model_arch
  **模型推荐**:论文转 PPT 推荐使用 GPT-4o 或 Claude Sonnet 4.5,它们在长文档理解和结构化输出方面表现出色。图表生成任务也可尝试 Qwen-VL 等视觉模型。

部署方式部署方式说明适合场景Docker(推荐)一键启动前后端服务快速体验、生产部署Linux 原生需 Python 3.11+、LaTeX、Inkscape、LibreOffice开发调试、定制需求Windows需 Python 3.12、Inkscape本地使用
  PDF2PPT 和 Image2PPT 等功能依赖 GPU,需要额外部署 SAM3 模型服务器。详见项目 README 的 GPU 部署说明。

常见问题

    在环境变量中将 `DEFAULT_LLM_API_URL` 设置为 `https://fastaitoken.com/v1`,并将 `BACKEND_API_KEY` 设置为你的 FastAiToken 密钥即可。CLI 模式下使用 `--api-url` 和 `--api-key` 参数。

    通过 FastAiToken 接入后,支持 400+ 模型,包括 GPT-4o、Claude Sonnet 4.5、Gemini、DeepSeek、Qwen 等。可在 Web 界面动态切换模型,无需修改代码。

    请检查:

1. Docker 和 Docker Compose 是否已正确安装
2. `.env` 文件是否已正确配置
3. 端口是否被占用
4. 查看 `docker compose logs` 获取详细错误信息
* 确保 FastAiToken 账户余额充足
* 长论文建议使用上下文窗口更大的模型(如 GPT-4o 128K)
* 检查论文 PDF 是否为可搜索文本格式(扫描版 PDF 效果可能较差)

    访问 [FastAiToken控制台](https://fastaitoken.com/token),注册账号后在【令牌】栏目生成新的密钥。新用户有免费测试额度。

相关资源

    查看 FastAiToken 支持的 400+ 模型完整列表

    了解如何在各类工具中配置 FastAiToken Base URL

    管理 API 密钥、查看用量和余额

    查看各模型定价和充值优惠