我做了一个中文论坛聚合页,欢迎来看看

qzhai 2026-08-13 10:29 1

昨天在「除了 V2 你们还去哪里逛啊」 v2ex.com/t/1233776 里贴了个链接,没想到不少人喜欢,索性今天在这里简单介绍一下。

因为文采不好以下有 80%ai 润色。。。
---

起因很土。每天 V2EX 、NodeSeek 、linux.do 、小众软件挨个开一遍,一半时间在看重复的,另一半在翻水贴。就想把这些站的帖子拉到一页,让 AI 先过一遍,把明显没营养的滤掉。

所以 https://n.mumingfang.com/intel ,我导航站里的一页,只有标题和摘要,点了跳原站。

做了些什么

拉了 23 个源的最新帖,加 8 个站的当日热榜。三台机器分工,一台国内的抓国内站(有些直接挡机房 IP ,海外抓不动),一台海外的过 Cloudflare 顺便跑 AI 判定,站上只管渲染。

不是非要三台服务器,是正好有两台闲置的。。一台海外的,一台国内的(年前为了玩龙虾买的)

判定就是把标题批量喂给模型,让它输出 tier ( 0 拦掉,1 到 3 是力度)、type (优惠 / 小道消息 / 资讯)和版面分类。48 小时窗口,每天能稳定吐出 1.0k 条。

踩过的坑

热榜和最新流不能共用一套判定。最新流判的是「值不值得看」,加热榜的时候图省事直接复用了,结果职场和种草两个分类全空。论坛真热帖大量就是闲聊晒单,linux.do 日榜榜首《(燃尽了)那个,奏乐,起舞~》直接被判成水贴。现在热榜只判合规不判价值,热度是用户拿回复投出来的,不用 AI 再投一次。

跨站热度不能比绝对数。同一时刻 linux.do 榜首 5823 浏览,NodeLoc 榜首 304 ,差 19 倍。名次也不能用百分位,50 条榜单的第 30 名和 10 条榜单的第 6 名都算 0.4 ,含金量差远了,长榜单的大站会把版面吃光。后来改成按绝对名次半衰才正常。

关于 ai 过滤
prompt 里得把话说死,不然模型偷懒。比如「判成优惠 tier 只能给 1 或 2 」,不写它就全扔垫底档;「带据传、曝光、涨价、裁员这类词的讨论帖算爆料不算水贴」,不写爆料贴全被当闲聊清掉。另外让它拦截的时候顺便输出一个原因词,调 prompt 的时候特别有用。

Discourse 的 latest.json 要取 created_at 不是 bumped_at ,V2EX 取 created 不是 last_touched ,不然一条新回复就能把三个月前的老帖顶进「最新」。

GLM-4.5 和 4.7 是思考模型,不传 thinking disabled 会返回空内容或者超时,我排查半天以为是限流。

成本
判定结果按帖子缓存,热榜重复率极高,首轮判 150 条,第二轮只剩 7 条,整轮 27 秒跑完。模型主要吃 GLM 的免费额度包,兜底才走付费,一个月下来个位数。机器是本来就闲着的两台。

抓取节奏是白天 15 分钟一轮,晚上 30 分钟,深夜 4 小时,热榜 30 分钟。上次回复我说 5 分钟,是记岔了。RSS 还没做,记下了。

有推荐的源欢迎说,尤其是有真实热度排序的中文榜单。


再贴一次 https://n.mumingfang.com/intel
最新回复 (11)
  • NotNEO 08-13 10:40
    1
    挺好的
  • weilaa 08-13 11:05
    2
    感觉配色有点刺眼
  • qzhai 楼主 08-13 11:28
    3
    @weilaa 所以你需要的是 暗黑模式
  • weilaa 08-13 13:16
    4
    @qzhai 不是,就是整体感觉有点刺眼
  • chzzzy 08-13 14:42
    5
    公众号推荐一个,质量很高:几乎满级

    还有网站有做 rss 吗?
  • aero99 08-13 15:00
    6
    给用户一个关键词过滤功能,比如不想看到某些帖子/消息怎么办
  • qzhai 楼主 08-13 16:24
    7
    @chzzzy 好的。这个页面还没做 rss
  • qzhai 楼主 08-13 16:24
    8
    @aero99 好的
  • noob9030 08-13 17:29
    9
    不错,
  • noob9030 08-13 17:29
    10
    有没有黑夜模式
  • qzhai 楼主 08-13 18:28
    11
    @noob9030 之后搞一个
* 帖子来源V2EX
返回