同样的模型和 Prompt,为什么 Codex 写中文论文明显不如 ChatGPT 网页版?

pandalin 2026-06-24 20:30 1

最近在做一个体量比较大的中文学术写作项目,主力工具一直是 Codex。不过用得越多,越明显感觉到一个问题:Codex 写出来的中文“人味”比较弱。


这种情况在 5.5 和 5.4 模型上都存在。内容通常不能说错,逻辑也基本完整,但读起来容易生硬、机械,句式重复,段落之间的衔接也不够自然。尤其是在论文润色、扩写和重组论述时,模型味会比较明显。


于是我简单做了一个对比实验:



  • 使用同一段论文原文;

  • 输入完全相同的润色任务和 Prompt;

  • 分别在 Codex 和 ChatGPT 网页版中运行;

  • 尽量保持模型版本和其他条件接近。


结果在我的样本里,ChatGPT 网页版的输出明显更加自然,可读性和流畅性也更好;Codex 的版本则更像是在“完成修改指令”,虽然形式上完成了任务,但文字经常缺少自然的语气和节奏。


目前我能想到几种可能:



  1. Codex 的 system prompt 更偏向代码、精确执行和少改动,因此不太鼓励主动调整文风;

  2. 两个平台虽然使用相近的模型,但推理预算、采样参数、上下文组织方式或后处理流程不同;

  3. Codex 的安全对齐或 harmlessness 约束可能更强,导致表达更保守、更模板化;

  4. ChatGPT 网页版可能对长文本写作、语言润色和对话式需求做了额外优化;

  5. 也可能是 Codex 对“润色”这类指令的理解更偏向局部修改,而 ChatGPT 更愿意进行整体重写。


当然,这只是我个人在有限样本中的观察,并不确定真正原因是什么。


大家有没有做过类似的对比?你们在 Codex 中写中文论文、报告或者长文本时,也会感觉输出比 ChatGPT 网页版更生硬吗?


尤其想听听大家对下面几个问题的看法:



  • 这种差异主要来自模型本身,还是 system prompt 和产品侧配置?

  • harmlessness 或其他对齐策略,真的会明显影响中文写作的自然度吗?

  • 有没有什么 Prompt 或配置,可以让 Codex 的中文表达更接近 ChatGPT 网页版?

  • 在英文写作中,是否也存在同样的差异?


欢迎贴出自己的案例或对比结果。也想看看这是普遍现象,还是只出现在特定任务和使用方式下。

最新回复 (7)
  • yeluo001 06-24 20:34
    1

    codex内置了很长的系统提示词,专门针对编程的,而且我记得还有工程师这种类似身份设定

  • Eeevan 06-24 20:34
    2

    应该是网页版的系统提示词发力了,我记得有仓库汇总了大部分的OpenAI、Anthropic、Google的系统提示词,你用上应该差不多能达到网页版的效果吧

  • pandalin 楼主 06-24 20:35
    3

    其实我也测过 API 的方式来润色,效果也不如网页版

  • pandalin 楼主 06-24 20:36
    4

    谢谢佬,那我感觉润色的活可能还是不太适合交给 codex 的会话去做,得控制好上下文才行。

  • taohe 06-24 20:50
    5

    个人感觉claude 写作更好用一点,逻辑更强一些,另外就是写作上你需要按照你的要求、风格给他指定,比如不要用破折号的形式解释等,分享一个个人常用的提示词,佬看看能不能用上

    1、使用正向描述而不是反向句式;

    2、除非必要,否则不使用破折号形式解释;

    3、多用简单句和简单词汇,复杂句拆成简单句,便于读者理解;

    4、句子和段落之间前后逻辑要紧密,便于读者阅读;

    5、术语全文统一,不要在前后文使用不同术语表示同一含义;

    6、不要使用复合形容词(如high-priced)

    7、不要写元说明,使用自然的叙述描述清楚(如不写“本章根据后续实现整理”,“经过修改”等写作过程);

    8,图表要在正文中有引出和解释。图前说明它展示什么,图后说明图中关键对象、流程和结论。

  • ulimate057 06-24 21:50
    6

    之前用codex写小说还有角色扮演,特别死板,装各种skill还有改设定都不行,说话永远都像客服,网页版还是好些。

  • pandalin 楼主 06-24 21:57
    7

    狠狠爱了佬,我准备把你的这些和 awesome-ai-research-writing里面的拼接一下。

* 帖子来源Linux.do
返回