请教一个统计相关的问题

Mayerchan 2026-08-07 11:16 1

rt ,现在在做一个高频相关的违规模型,背景有点类似与营业厅人员的操作,这种非规律性的数据,我需要怎么去定义一个高频的阈值呢🤔


目前计划以“人员在某个时间窗口内的操作次数”作为统计指标,但数据分布较不均匀,可能还会受到岗位、网点、业务类型和时段等因素的影响,因此不确定应该如何定义“异常高频”。

目前的思路是结合分位数和箱线图规则:先将 P90 以上的数据作为重点观察范围,再使用 Q3 + 1.5 × IQR 作为异常高频阈值。但实际结合数据分析后,发现识别效果并不理想,存在一定的误报或漏报。

想请教以下问题:

P90 和 Q3 + 1.5 × IQR 是否适合用于这类偏态或长尾的计数数据?
阈值应该全局统一设置,还是按人员、岗位、网点、业务类型或时段分别计算?
除分位数和 IQR 外,是否有更合适的统计方法或异常检测方法?
如果需要,我也可以补充数据分布、时间窗口以及当前误报和漏报情况。



内容用 AI 修饰了一下 ,大伙将就着看哈
最新回复 (3)
  • Sawyerhou 08-07 16:40
    1
    既然“操作次数”“会受到岗位、网点、业务类型和时段等因素的影响”,那阈值理论上也应该随着不同的“岗位、网点、业务类型和时段等因素”而变化。

    阈值紧,误报多,漏报少;阈值松,误报少,漏报多。没有免费的午餐,总要有取舍。具体怎么取舍,还是取决于业务场景的需求。

    我觉得用分位数就行,不过 90%分位数似乎有点低,98%、99%差不多,不过不清楚业务具体情况,也不敢确定。
  • Mayerchan 楼主 08-07 17:11
    2
    @Sawyerhou 就是这个取舍 还有误报这个问题,有点头疼
  • Sawyerhou 08-07 18:28
    3
    @Mayerchan #2 粗暴处理,就是误报和漏报两者放弃其一,误报和漏报中肯定存在某一个,比另一个带来的后果更严重,那就专注解决后果严重的那个,放弃另一个。

    比如放弃处理误报的问题,即宁可放过一个坏人,也不冤枉一个好人,那就可以采用我前面说的,用高分位数作阈值,比如 99%,甚至 99.9%之类的。
* 帖子来源V2EX
返回