悦数图数据库

首页>博客>行业科普>理赔团伙分:图数据库的图特征如何给每张保单打风险分?

理赔团伙分:图数据库的图特征如何给每张保单打风险分?

理赔团伙分图数据库

同一张理赔案件,两套风控模型给出截然相反的结论。传统评分卡核验保单全部字段:被保险人 34 岁、保额 30 万、出险在投保后第 11 个月、三甲医院就诊、票据完整、诊断与用药匹配、无既往理赔记录,综合得分 0.08,判定低风险自动结案。基于图数据库的图谱模型处理的是同一份材料,但它关注的不是单据本身,而是案件背后关联的人物网络,输出 0.87,标记高风险转入人工核查。两个结果都不算错误,它们回答的是不同问题:评分卡判断这张单子单独看是否存在造假疑点,图数据库图谱模型判断这张单子依附于什么样的关系网络。对于团伙骗保而言,他们能把每一份报案材料包装得毫无破绽,却很难彻底抹去团伙成员之间的关联痕迹,这正是图数据库在反欺诈场景里的核心价值。

一、团伙骗保的四种结构,只有关系能看见

单案手法可以千变万化,但团伙的组织方式收敛得很快。把它们抽象出来,大致是四类结构,每一类在图上都有清晰的形状。

同期同网型。 一批互不相识的人,在同一段时间内集中投保、集中出险、集中理赔,背后的票据来自同一批机构,赔付资金最终流向同一组账户。每个人单独看都是正常客户,异常只存在于“同一时间、同一批机构、同一组账户”这三个重合上。这类结构在图上表现为一个高密度子图,社区发现算法一眼就能圈出来。

环形互保型。 投保人 A 为 B 投保、B 为 C 投保、C 又为 A 投保,形成闭环。闭环的用途是让每一份保单都看起来有独立的投保动机,同时让每个人的保单数量保持在风控阈值以下。环结构在关系表里几乎无法表达,因为判断它需要的是路径的起点和终点重合,而不是某几个字段的取值。

中介聚合型。 一个代理人、一个保险中介、一个“理赔黄牛”,同时连接着几十个彼此没有其他交集的投保人。这几十个人之间没有任何直接关系,只有这一个共同联系人,属于罕见但极具判别力的图特征:两个素不相识的人共享同一个代理人,这不奇怪;但如果还有同一家医院、同一个查勘员、同一个赔付账户、同一台设备,巧合的层数就超过了自然发生的可能。

寄生型。 最隐蔽的一类,不新建虚假业务,而是在真实业务里掺入少量虚假案件。一家确实在经营的修理厂、一家确实有门诊量的诊所、一个确实在带团的旅行社,真实单与虚假单混在一起,比例通常在百分之十到三十之间。这类结构在单案层面完全无法识别,因为虚假单复用了真实单的全部合规外观;只有用机构作为枢纽节点,统计其出险分布、伤情编码分布、赔付金额分布相对同业的偏离度,才会露出尾巴。

结构类型 图上的形状 核心异常信号 单案层面可见度
同期同网型 高密度小社区 时间聚集、机构重合、资金同汇聚 极低
环形互保型 闭环回路 投保关系首尾相接、多份保单互指 不可见
中介聚合型 单一枢纽星型 共同代理人、共同查勘员、共同账户 低
寄生型 机构为中心的稠密簇 出险分布相对同业显著偏离 不可见

二、图特征从哪里来

给保单打团伙分,前提是先把图上的结构量化成可以进模型的数值。能用的图特征大致分五类,每一类回答一个不同的问题。

局部结构特征回答“这个实体黏不黏人”。 节点度(直接关联的实体数量)、聚类系数(邻居之间互相认识的比例)、三角形计数(参与了多少个三人闭环)。一份保单的被保险人如果同时是另外十几份保单的被保险人、投保人或受益人,度数会显著高于正常值——正常人的保险关系通常在一到三份之间。

全局位置特征回答“它站在网络的什么位置”。 PageRank 衡量节点被多少重要节点指向,中介中心性衡量它在多少条最短路径上。一个代理商如果是多个互不相交社区之间的唯一桥梁,中介中心性会异常突出——他很可能就是那个把不同来源的案件拼装在一起的人。

共同邻居与路径特征回答“两个实体凭什么连在一起”。 两个投保人之间共享多少邻居、最短路径是几跳、路径上经过哪些类型的节点。素不相识的两人共享三家医院、两个查勘员、一个赔付账户,这个组合本身就是证据。

重合度特征回答“他们是不是同一个人在操作”。 设备指纹、登录 IP、手机号、银行卡、常用地址、甚至提交理赔的时间习惯。用 Jaccard 相似度量化重合程度,比布尔判断更稳健,也更容易设定阈值。

二阶邻域污染度回答“他身边有多少坏人”。 这是风控里最有效也最容易被忽略的一类特征:不看这个节点自己怎么样,而看它的邻居中有多少是被标记为高风险或已确认欺诈的实体。二阶邻域(邻居的邻居)的高风险占比,往往比节点自身的所有属性加起来都更能说明问题。

维度 单案特征 图特征
数据来源 本案件字段、被保险人档案、历史理赔 跨案件的关系结构、实体重合、网络位置
回答的问题 这张单本身像不像假的 这张单和谁一起出现、出现在哪个结构里
典型失效场景 单案合规的团伙骗保、票据真实的虚假案件 偶发的单点欺诈、无关联的独立案件
规模适应性 单条记录计算,成本固定 依赖图遍历与算法,规模决定可行性
可解释性 字段权重,易于说明 需要路径级证据链才能说明,否则是黑箱

三、团伙分怎么合成,以及为什么必须可拆解

有了特征,接下来是合成分数。这里最容易犯的错,是把图特征直接追加进原有评分卡,当成几十个新变量一起训练。结果是两个问题同时出现:一是双重计数,同一件事在单案特征和图特征里各算了一次,分数被放大;二是不可解释,一个 0.87 的分数背后是哪些关系在起作用,没人说得清,也就没法向调查员交代线索、向合规解释处置依据。

更稳妥的做法是分层合成。第一层是关系密度类,由节点度、聚类系数、共同邻居数构成,判断这个实体是否处在超常密度的关系中。第二层是位置异常类,由中介中心性、社区跨越数、PageRank 偏离度构成,判断它是否在结构中扮演了不该扮演的角色。第三层是邻域污染类,由一阶与二阶高风险邻居占比构成,判断它所处的关系环境是否已被污染。三类各自得出一个分量,再加权合成团伙分,并保留每个分量的贡献值。

保留贡献值的意义在于分数可以往下拆。同样输出 0.87,拆开可能是“二阶邻域污染度 0.9 + 关系密度 0.7 + 位置异常 0.3”,也可能是“位置异常 0.9 + 其余两项中等”——前者指向一个被团伙包裹的真实客户,处置上应当保留申诉通道;后者指向一个主动串联多方的组织者,处置上应当直接移送核查。同一个分数,两种完全不同的处置。 这也是为什么团伙分不能只输出一个数字。

四、图特征的计算路径

落在工程上,图特征抽取与算法调用是同一个遍历过程的两端。先用查询把候选集及其邻域取出来,再用算法在子图上计算结构与位置指标。判断“某个账户是否是多人共用的赔付出口”,用共同邻居和入度统计就够了;判断“这个社区是不是团伙”,需要社区发现;判断“谁是组织者”,需要中心性度量。

识别目标 图特征 图算法 处置动作
关系密度异常 节点度、聚类系数、三角计数 度统计、子图匹配 标记观察,纳入名单
团伙边界划分 社区归属、模块度 社区发现(Louvain) 整社区立案移交
组织者定位 中介中心性、PageRank 中心性计算 优先核查,主犯方向
资金回流闭环 路径首尾重合 环检测 冻结、追偿
多案共犯识别 共同邻居、多角色频次 路径聚合、频次统计 提取证据链
邻域污染传导 一阶二阶高风险占比 邻域聚合、标签传播 分级提示,动态调整额度

把前面那张理赔单跑一遍,特征拆出来大致是这样:该被保险人在 90 天内出现在 6 家公司的 11 张保单中,关系密度分量 0.91;同一位“事故见证人”在 27 起案件的签字记录里出现过 9 次,共同邻居特征被触发;就医机构的同一科室、同一诊断编码在半年内出现 43 次,机构偏离度显著;赔付资金经过三层转出后汇聚到 3 个账户,与另外 14 起案件共享其中 2 个出口账户,二阶邻域高风险占比 0.83;投保时间集中在三个月内,与前一张保单间隔 6 天。五条特征里没有一条是靠单案字段能发现的,它们全部来自关系。

五、悦数图数据库的核心能力支撑

针对这类需要把全量保单、理赔记录、票据、代理人、赔付账户一起入图,并在万亿边规模上实时抽取图特征的场景,悦数图数据库提供几个关键支撑:万亿边规模的分布式存储可容纳历年全量业务数据与多源外部数据,使图特征有完整的网络基础而不是局部抽样;存算分离架构让批量入图与在线特征抽取互不干扰,模型服务的响应时间不随入图任务波动;内置图算法库直接提供社区发现、PageRank、中心性计算、环检测等算子,图特征无需自研分布式实现;动态 Schema 支持新增数据源(设备指纹、票据编号、就诊记录)不停机扩展模型;CDC 实时同步让新发生的投保与理赔在秒级进入图谱,使团伙分可以在核赔决策的窗口内给出,而不是次日批量计算。