【开源】llm-tap:采集真实 LLM 交互并筛选导出 SFT 训练数据

luckfu 2026-07-19 21:26 1

本帖使用社区开源推广,符合推广要求。我申明并遵循社区要求的以下内容:



  • 我的帖子已经打上 开源推广 标签:

  • 我的开源项目完整开源,无未开源部分:

  • 我的开源项目已链接认可 LINUX DO 社区:

  • 我帖子内的项目介绍,AI生成、润色内容部分已截图发出:

  • 以上选择我承诺是永久有效的,接受社区和佬友监督:


以下为项目介绍正文内容,AI生成、润色内容已使用截图方式发出




项目介绍


llm-tap 是一个本地透明代理和 LLM 交互数据采集工具。它把 Claude Code、Codex、CherryStudio 或其他兼容客户端的请求透明转发到真实服务商,同时原样保存完整请求、响应和元数据,帮助你把真实使用轨迹沉淀为可检查、可筛选、可导出的 SFT 训练数据。


项目地址:GitHub - luckfu/llm-tap · GitHub


核心能力



  • 零上游配置:Host 从 URL 路径提取,API Key 继续由客户端透传,代理不保存上游凭证。

  • 自动识别 Anthropic、OpenAI Chat Completions、OpenAI Responses 等协议,并整合流式响应。

  • Web 管理界面支持按 Host、模型、协议、状态和时间范围筛选调用,也支持查看调用详情与质量信息。

  • 支持显式选择单条记录、当前页或筛选结果后再导出,不会误把全量数据库直接导出。

  • 支持 canonical、ShareGPT、tool_sft、OpenAI 和 OpenAI windowed 等训练数据格式。

  • 支持限制每条记录上下文,保留完整工具调用链并按预算压缩过长内容。

  • 对 Authorization、x-api-key 等敏感请求头进行脱敏,数据默认保存在本机用户目录。


欢迎反馈使用体验和改进建议。

最新回复 (2)
  • 哈总 07-19 21:38
    3

    我在想把这个数据集存下来, 然后可以卖给做大模型的公司, 这是不是更好的方案。 都所有人都有利。


    数据是有价值的,现在都被相应的模型公司免费拿去了

  • luckfu 楼主 07-19 23:30
    4

    主要还是个人隐私吧,适合自己从大模型蒸馏小模型.

* 帖子来源Linux.do
返回