求个安娜图书馆的读秀库获取途径

shiyan1012 2026-10-04 12:26 1

如题,有没有大佬点拨下

最新回复 (1)
  • chenghaha 10-04 12:36
    1楼

    ai回答dsp4.1

    一、先确认入口:官方域名只剩 3 个

    安娜官网 FAQ 当前原文列出的官方镜像:


    annas-archive.gl ✅

    annas-archive.pk ✅

    annas-archive.gd ✅

    其他情况:


    annas-archive.org(以及 .se)已死——实测 DNS 直接 NXDOMAIN;.org 是被 PIR 置为 serverHold 拿掉的。

    .su / .io / .is / .cc 被官网 FAQ 明确列为 Fraudulent(冒充站,会偷捐款,别用);welib.org 是 fork,官方标注 "NOT RECOMMENDED"(不贡献回社区)。

    二、读秀库的三条获取途径(按你要的东西分)

    A. 只要单本书 → 站内搜索 + 下载 搜索到书后走"慢速免费下载"(有 Cloudflare 人机验证)或"会员快速下载"(捐款,不自动续费;会员有稳定 JSON API /dyn/api/fast_download.json)。慢速下载常需浏览器真人验证,实测数据中心/VPN IP 会直接失败(我这边自动化访问就被拦成 "Sorry, we could not verify your browser automatically")。


    B. 要批量/全库 → 种子(最实际的途径) https://annas-archive.gl/torrents/duxiu


    页面实测汇总(updated 2026-08-07):


    text

    复制

    duxiu 294.8TB / 7,773,029 files / avg 37.9MB per file / 1,027 torrents

    🔴 160.3TB(57%) 🟡 118.9TB(43%) 🟢 338.2GB(0%)

    data 类种子每个约 300GB、含 3k–12k 个文件,可只勾选需要的文件下载(种子内含文件本体)。

    metadata 类种子很小(几百 MB~几十 GB 的 *.jsonl.zst),如 annas_archive_meta__aacid__duxiu_records__…、…duxiu_files…——只想要元数据就先下这个。

    注意页面尾部约 52 条 upload_files_duxiu_main_202602__2026… 带 🔒 标记(需登录/会员)。

    全量种子清单另有 JSON 可下,官网还提供 "torrent list generator"(按你的硬盘容量生成优先级列表)。

    C. 只要元数据 / 自己建库 https://annas-archive.gl/datasets/duxiu 给出散落库表:dx_20240122.db(统一元数据)、dx_cover.db(封面)、dx_toc.db(目录),以及书商原始表 读秀512w.txt、512w_catalog.tsv、2.0-5.0全部书表.txt、6.0书表.txt 等,原始数据打包在 chinese_2025_10_original_metadata.tar.zst。


    按 SS 号直接查元数据(无需登录):https://annas-archive.gl/db/source_record/get_duxiu_dicts/duxiu_ssid/<8位SS号>.json.html

    2026-02 新发布智臻(超星发现/SuperStar Discovery)元数据 564,197,355 条(对方声称近 12 亿),种子在 /torrents/other_metadata:annas_archive_meta__aacid__zhizhen_records__20260215T000000Z--20260215T000000Z.jsonl.seekable.zst.torrent

    三、量级与结构(决定你怎么选路)

    数据集页实测:总计 9,817,610 文件 / 331.0 TB,AA 已镜像 9,807,385(99.896%),last updated 2025-01-27。


    来源:超星/Chaoxing 为高校与图书馆扫描的学术书,原件多为 pdg 散页 zip,AA 用 pdgconvert 转成 PDF。

    主键是 SS 号(8 位,常以 10/11/12/13/14/15/40/96 开头),DX id 次之;读秀有 1.0–7.0 多个版本,5.0 之后超星不再整库外流,网上流传的整库主要是 5.0 及更早。

    元数据 → 文件的映射:官方建议下 ElasticSearch/MariaDB 全库,用 torrent_paths 字段定位某本书在哪个种子里(这样就不用下 300TB)。

    四、两个现实坑

    墙内可达性:域名常被 DNS 污染,.org 现在直接解析不了。要么 VPN/家宽,要么干脆绕过站点——种子走 DHT/tracker 即可,不需要能打开官网(但需要官网页面拿 magnet/元数据,可先用镜像站点取)。

    Cloudflare 人机验证:/search、/md5/... 这类页面在异常 IP 上会卡在验证页(我实测 403 / "Checking your browser")。换干净 IP、用手机端网络、或用真人浏览器,通常能过。

    法律层面提醒一句:这是影子图书馆资源,是否可下载取决于你所在司法辖区的版权规定,自己判断风险;另外务必只认 .gl/.pk/.gd,假冒站不仅偷捐款还可能挂马。

* 帖子来源NodeSeek
返回