这是gemini pro的建议
面对几千页的实体文献(大约几百篇 paper),逐页去扫描或手动录入是非常低效的。要得到最纯粹的 Markdown 文本,核心逻辑应该是物理输入最小化,通过代码和 API 解决剩下的工作。
这里设计了一条自动化的“流水线”方案,大约一个下午就能把这几千页纸全部变成结构化的 Markdown,随后纸张就可以直接当垃圾处理掉:
核心思路:只拍首页 + Vision API + Crossref API
既然是已发表的文献,99% 的核心元数据都绑定在 DOI 上。你完全不需要扫描中间和结尾的几千页,只需要处理每篇 paper 的第一页。
第一步:物理采集(耗时极短)
不需要购置专业的馈纸扫描仪。
- 将 iPhone XS Max 或 iPad Pro 固定在桌面支架上,镜头朝下,或者直接手持。
- 把几百篇 paper 堆在旁边。翻开第一页,在系统相机里按快门(或者开启录像,每页停留一秒定格,事后抽帧)。
- 拍完首页,整份 paper 直接扔进垃圾桶。
- 将这几百张首页照片通过隔空投送批量传入 Mac。
第二步:编写批量提取脚本 (Python + LLM API)
在 macOS Sequoia 的终端里,你可以写一个几百行的 Python 脚本,结合 AI 接口来自动化信息抓取。
脚本的核心逻辑如下:
- 遍历图片:读取本地文件夹中的所有首页照片。
- 视觉识别 DOI:调用多模态大模型的 API(比如 GPT-5.6 Sol 的视觉能力)。Prompt 设定得非常简单:“识别并输出这张学术论文首页图片中的 DOI 号,只输出 DOI 字符串”。
- 调用文献数据库:拿到 DOI 后,直接用 Python 的 requests 库请求免费的 Crossref API (https://api.crossref.org/works/{doi})。
- 提取纯粹的元数据:从返回的 JSON 中精准抓取 title (标题)、author (作者列表)、container-title (期刊名) 和 published (年份)。
第三步:自动生成纯 Markdown 文件
在脚本的最后一步,将抓取到的信息格式化为你需要的纯 Markdown 语法,直接追加写入本地的 .md 文件中。根据你日常在多窗口环境下的阅读习惯,可以选择不同的排版:
格式 A:纯文本列表(适合大纲视图和快速检索)
### 2026年归档文献
- **[论文标题]**
- 作者: Author A, Author B
- 期刊: *Journal Name*, 2023
- DOI: `10.1038/s41586-023...`
格式 B:Markdown 表格(适合结构化数据展示)
| 标题 | 作者 | 期刊 | 年份 | DOI |
| :--- | :--- | :--- | :--- | :--- |
| Paper Title | Author A, etc. | Nature | 2023 | `10.1038/...` |
进阶优化:用 MCP 与 CLI 接管工作流
如果不想写独立的循环脚本,你可以把这套逻辑封装成一个本地的 MCP (Model Context Protocol) Server。
在 Claude Code 等 CLI 开发工具中,直接给 AI 下达自然语言指令:“读取 ~/Downloads/papers 目录下的所有照片,调用本地的 DOI 提取工具,查询文献详情后,按 Markdown 表格格式追加保存到 papers.md 文件中”。工具会在后台自动帮你完成图片遍历、信息核对和文本排版。
备选方案:全量 PDF 转换 (markitdown)
如果你之前已经用裁纸刀切掉了书脊,并通过高速扫描仪把这几千页纸变成了几百个 PDF 文件,那就不需要再走视觉大模型。
你可以直接使用微软开源的 Python 实用工具 markitdown。在脚本中调用它,将 PDF 首页直接解析为结构化的 Markdown 文本,然后通过正则表达式提取出标题和核心信息写入总目录中。这种方式也能在本地终端里安全、快速地闭环。