[开源] Wapic : 一个 C++17 CRF 中文分词工具

iarch 2026-07-29 11:38 1

最近把自己写的中文分词工具 Wapic 整理并发布到了 PyPI ,想请大家试用、拍砖。


Wapic 是一个使用 C++17 实现的线性链 CRF 中文分词工具,提供 Python API ,也支持从头训练模型。


现在安装时会自动带上默认模型,不需要另外下载或现场编译:


pip install wapic

使用示例:


import wapic

seg = wapic.Segmenter()
print(seg.segment("中华人民共和国成立了"))

输出:


['中华人民共和国', '成立', '了']

目前支持:



  • CPython 3.9–3.14

  • Linux 、Windows 、Intel Mac 、Apple Silicon Mac

  • 单句分词、BMES 标签和多核批量推理

  • 加载自定义模型

  • SGD-L1 、L-BFGS/OWL-QN 训练

  • MIT License


发布模型在 PeopleDaily 和自建测试集上的 F1 分别为 98.0197.95


模型约 30 MB ,底层是传统 CRF ,不依赖 PyTorch 等大型运行时。


项目地址:



  • GitHub:https://github.com/Ismantic/Wapic

  • PyPI:https://pypi.org/project/wapic/

  • 模型:https://huggingface.co/Ismantic/Wapic-CWS


目前尤其想收集人名、机构名、中英混排和数字表达方面的 bad case 。


如果大家愿意试一下,欢迎直接贴出分错的句子,或者在 GitHub 提交 issue 。

最新回复 (1)
  • moeloli 07-29 12:56
    1
    测试
    ```
    有时候 / , / 化解 / 矛盾 / 的 / 最 / 好 / 武器 / 不 / 是 / 讲 / 道理 / , / 而是 / 一 / 份 / 纯真 / 的 / 善意 / 。
    ```
* 帖子来源V2EX
返回