我是一名税务行业从业者,目前遇见了国产ai运用比赛?希望能看到各位大佬的见解。

哆啦A梦 2026-06-04 15:36 1


我个人因为要参加一场比赛,目前也在测试目前最先进的国产大模型情况,需要运用到真实的实战和案例中的情况,我希望能知道大家对目前最先进的模型都有什么看法,运用出现的问题,这里讨论的是DeepSeek v4、通义千问qwen3.7、glm5.1、kimi2.6,目前最先进的国产大模型,截止2026年6月4日。

这里面涉及到了问题解读,政策理解,根据政策要求进行数据计算,整理标准格式的报告等。


附ai整理的比赛详情和问题,希望各路大佬能说说这些国产模型如何发挥出自己的最大性能。包括不限于提示词、思考模式等。这里涉及主要是文本大模型,并非多模态。



最新回复 (14)
  • comingpeople 06-04 15:42
    1

    提供我自己快捷选择模型的思路,需要从几个模型中需要选择一个来完成某个任务的时候,我会自己设计一些和任务关联的“题目”作为baseline,看哪个模型在“题目”上表现更好

  • wublub 06-04 16:11
    2

    佬友可以先发发自己的见解之类的,而且要看的东西太长了

  • 冷帅 06-04 16:22
    3

    你得理解下 agent , tools 和 harness 。


    单纯和模型对话 他们区别是不大的。 能力都不错。

    关键点放在对 模型一次模型会话的上下文管理上, 不要将所有的信息都放到一次对话里。 要拆任务, 然后每个任务都只有自己 必要的信息,(塞太多信息 会影响结果)


    流程应该是 : 先用一次模型的agent +tools, skills 能力获得 工作需要的 必要信息 ,比如



    1. 工作的步骤

    2. 找到对应的表格,

    3. 找到对应的 管理规范,计算口径,


    然后 把工作拆为单独的任务, 每个任务 只用必要的信息, 完成任务后, 接下来核验这个任务。 核验完 去进行下一步。


    关键词: ”上下文管理“,

    拆分任务, 且让ai只需要知道完成当前小任务需要必要信息。 在尽可能必要且短的 内容信息里 把活干了。

  • 象牙山小诸葛 06-04 18:48
    4

    对于这种非编程任务 不要死磕模型的能力 你应该去研究prompt 对于这些分析类工作国模可以做的很好了

  • 哆啦A梦 楼主 06-05 10:28
    5

    上下文长度控制,越短准确性越高吗,求解

  • 哆啦A梦 楼主 06-05 10:29
    6

    是要规范的提示词的吗?处理逻辑,模型的执行力,相差大吗

  • 象牙山小诸葛 06-05 10:36
    7

    当然好的harness 可以做到巨大的提升 就像我的项目使用mimo 模型我就可以做大多数事情了 但是90分钟其实没有时间做的太复杂 因此优化prompt 才是最优解 或者你找找那些小型非langgraph 那么大的框架现在熟悉熟悉 可以作为编排层当做底座也能节省很多时间

  • Andy Ding 06-05 10:52
    8

    首先佬,推理模型是可以无脑D老师V4 pro/flash的,红队你就拿pro审flash好了。然后你得拿两个多模态,推荐qwen 3.6 plus + Seed2.0 pro/lite交叉验证,既然比赛都允许agent融合RPA OCR工具,那肯定是要过文档的,PDF扫描版本不可避免的要用OCR工具+LLM兜底。

    agent也要国产吗?没规定就无脑Hermes,灵魂+记忆配置强制事实引用,D老师1M上下文千万别打满,过半绝对出幻觉,整理报告直接输出审计/税务领域格式化文档,提取领域重要参数。然后马上/reset重置上下文,再让Hermes拿格式化文档进行后续计算或者解读。可有效避免幻觉。Hermes RPA也很强阿,前两天我还让它帮我老婆刷公需课答题来着。当然看什么方面的自动化,文档类网页类自动化是小case的,一套UIA感知(UIA+win32gui) → label编号映射 → SendInput执行操作桌面GUI打开税务软件然后让Hermes根据业务流程即时编写py脚本开始点点点还是很丝滑的。啊要开会了下次再聊。

  • 哆啦A梦 楼主 06-05 10:57
    9

    极其感谢各位大佬的解答,对我帮助很大,我也会将具体的测试结果发布。希望能给各位一些参考

  • Ryan Lin 06-05 11:17
    10

    佬,不知道比赛方是怎样提供模型的(API还是网页),在写代码这一块有一个简单的方法,你可以参考一下。


    在写完代码之后,我们会使用两个模型进行对垒来优化代码,简单来说就是A模型先优化代码,然后让B模型来审核,审核完之后再跟A模型说这个B模型审核出来的结果,你怎么看吧啦吧啦之类的


    这个方法的好处是出来的代码质量高,符合我们在系统提示词中写定的要求,可以直接拿来用和可维护性高


    缺点就是慢,很慢,因为他们在吵架 ^-^

  • mengnimen 06-05 12:02
    11

    税务和审计 这两个行业的基础工作完全可以被ai替代的,我最近就在帮朋友整理她审计的表格,ai描述的清楚真的是直接帮你生成结果的。只是国内ai还没遇到好用的(或者说没有好用的插件)(WPS不知道怎么样,反正ChatGPT在excel的中是很好用,当然也很费token)

  • 90 cpx 06-05 20:18
    12

    1.“问题解读,政策理解” 搞这个需要长上下文 选DS 但是这玩意不是多模态的 万一题干是扫描件那就只能qwen了

    2.“根据政策要求进行数据计算”涉及到复杂规则计算 至少也要把固定规则固化成含脚本的skills 讲实话这三都不太行

    3.“整理标准格式的报告” 这一步倒是豆书记最擅长的

    关键是你这参赛须知里写得太含糊了 到底是只能用这三家的chat(网页聊天界面)通过提示词工程完成比赛 还是能调用这三家的api 用各类工具实现编排工作流完赛呢? 计分规则是啥 比速度(提前完成有没有赋分)还是纯限时比质量(你这还有人工干预环节 这人的水平也很有关系啊)

  • 哆啦A梦 楼主 06-06 15:50
    13

    目前具体的规则还未公布,猜测应该是提供了网页端这三个模型交互的网页,存在工具流的可能性不大。

  • 90 cpx 06-07 10:09
    14

    仅提供三家的网页界面 那太生草了 纯提示词工程啊 对了 你这提示词能复制粘贴嘛 不会要现敲吧 ^-^

* 帖子来源Linux.do
返回