悦数图数据库

首页>博客>行业科普>小微首贷户风控:没有信贷记录的企业主,图数据库关联图谱能给出什么参考?

小微首贷户风控:没有信贷记录的企业主,图数据库关联图谱能给出什么参考?

小微首贷户风控图数据库

信贷系统里调出来的那份报告只有两行字:姓名、身份证号,下面写着"无信贷记录"。评分模型跑完返回一个空值,规则引擎没有任何一条命中,风控意见栏里能填的只有"建议人工尽调"。这是小微首贷户评审会上最常见的一幕——不是客户有问题,是系统里关于他的一切都是空白。偏偏首贷户占比又是普惠金融的硬考核指标,不做要被扣分,做了又没有抓手。首贷户风控的难点从来不是"敢不敢贷",而是拿什么来评估一个从未被评估过的人。悦数图数据库讨论的就是这件事:在没有信贷记录的前提下,关联图谱能提供哪些真正可用的参考。

一、首贷户"评无可评"的四个真实原因

首贷户(首次从银行体系获得贷款的小微企业主)之所以难评,不是因为尽调做得不够细,而是传统风控依赖的四类信息在他身上同时缺位。

征信空白是表象,不是核心。 没有信用卡、没有房贷、没有既往贷款,征信报告自然空白。但征信空白本身不构成风险——一个经营了八年、年开票三千万的五金厂老板从未贷过款,只能说明他过去靠自有资金滚动,这在制造业里相当普遍。真正的麻烦在于,征信这条最省力的路径断掉之后,后面的评估全部要换一套材料。

财务报表不可用。 小微企业普遍两套账,报给银行的报表与真实经营之间往往隔着一层。没有信贷记录意味着连历史还款行为可以参考,报表又不可信,剩下的只有流水和个人账户——而个人账户恰恰是另一个问题。

经营资金与个人资金混同。 大量小微企业的收款走的是老板个人卡、微信、支付宝,货款、家庭开支、员工工资混在一条流水里。银行看到的不是企业经营,而是一个人的收支记录,靠流水倒推经营规模,误差大且容易被临时刷单做出来。

缺少同行业可比样本。 评分模型依赖同群体违约率做标定。首贷户在数据上属于"从未被观察过的群体",模型既没有他的历史,也没有足够多的同类样本,输出结果的置信度天然偏低。

把这四类缺位摆在一起看,问题就清晰了:

信息维度 首贷户可得性 传统方式能否补齐 图谱可替代的来源
征信与历史还款 空白 不能,需要时间积累 关联人(配偶、股东、实际控制人)的信贷与涉诉记录
财务真实性 报表不可信 部分,依赖现场尽调 税务开票、社保人数、水电用量、物流单据交叉验证
经营规模 流水混同难拆 难,人工拆分成本高 上下游交易对手数量与账期、采购频次、开票集中度
关联负担 完全未知 基本不能 名下其他企业、对外担保、股权出质、被执行信息
行业与区域风险 样本稀疏 依赖宏观判断 同商圈、同产业链企业的整体违约与经营趋势

二、传统风控模型在首贷户上的三重失效

多数银行面对首贷户时会退回到"人工尽调 + 经验判断",这条路本身也跑不通,原因是三重失效叠加。

评分卡无分可用。 申请评分卡的输入变量里,征信类变量权重通常最高。当这一组变量全部缺失,模型要么直接拒绝(把所有首贷户一律挡在门外,与普惠考核冲突),要么按默认值兜底(等于把首贷户当作平均客户,风险敞口被系统性低估)。两种处理都不能接受。

规则引擎无规则可命中。 反欺诈规则多为"命中黑名单""短期多头申请""征信查询频繁"这类。首贷户不申请、不查询、不上黑名单,规则全部落空。结果是首贷户在反欺诈环节几乎零阻力通过——而零阻力恰恰是最容易被中介利用的通道。

专家经验不可复制。 老信贷员看厂、看库存、看工人状态确实有效,但一个人一天看不了几家,经验也无法沉淀为可复用的判断标准。当首贷户任务按户数下达到支行,人工尽调的产能天花板立刻暴露。

这三重失效指向同一个结论:首贷户需要的不是"更严格的审核",而是换一套信息源——从"这个人过去的信用表现"换成"这个人在整个商业网络里的位置与关系"。

三、图数据库:从评这个人,到看他站在哪儿

关联图谱的核心思路很直白:一个人没有信贷记录,但他在商业社会里不可能没有关系。他有供应商、有客户、有员工、有同行、有家庭、有经营场所,这些关系散落在税务、社保、电力、物流、工商、司法等多个系统里。把这些关系连成一张图,首贷户就从"一个空白的人"变成"一个位置明确的节点"。

替代数据入图。 建模时通常包含六类节点:企业主个人、名下企业、上下游交易对手、经营场所(地址/园区)、设备与车辆、关联自然人(股东、配偶、亲属、财务负责人)。关系边则来自多源数据:工商登记的股权与任职关系、税务开票产生的供需关系、社保缴纳产生的雇佣关系、租赁合同产生的场所占用关系、司法与执行产生的担保与涉诉关系。一个人的信贷记录可以是零,但这六类节点之间的关系不可能为零。

三类真正有用的参考结论。 图谱能给出的不是"批或拒"的结论,而是三类在此之前完全看不到的参考。

第一类是经营真实性。税务开票、社保人数、水电用量、物流单据这四条线如果互相印证——开票增长、社保同步增加、用电量同向上升、物流频次匹配,经营是真实的;如果开票额高但社保只有两三人、用电量长期平稳,则高度疑似空壳或开票型走账。传统尽调靠信贷员一条条比对,图谱里这是一个多源交叉验证的自动判断。

第二类是关联负担。首贷户本人没有贷款,不代表他没有负担。通过股权与任职关系向外扩展两到三跳,可能发现他名下还有三家企业、其中一家已被执行、他为两家关联公司提供过担保、配偶名下有经营贷。这些负担在首贷申请里一个字都不会出现,但在图谱上它们是直接相连的边。

第三类是网络位置与传导风险。用 PageRank 看他在本地产业链里是否处于关键节点,用社区发现看他所在的商圈或产业集群整体经营状况如何,用最短路径量化某个核心客户出问题后对他的传导距离。位置本身不是风险,但位置决定了外部冲击传导到他身上的速度。

多跳查询给出可解释的证据链。 比如下面这类查询在关系数据库里需要五六张表级联 JOIN,在图数据库里是一次遍历:以申请人为起点,沿"任职-持股-担保-交易"关系扩展三跳,返回所有关联主体,过滤掉其中存在被执行、失信、经营异常的实体,并按关联强度排序。用 nGQL 表达大致如下,一次语句完成扩展、过滤与排序:

MATCH (p:Person)-[:HOLDS|OFFICE_AT|GUARANTEE|TRADES_WITH*1..3]-(n)
WHERE id(p) == "申请人ID" AND n.riskTag IS NOT NULL
RETURN n.name, n.riskTag, count(*) AS relStrength
ORDER BY relStrength DESC LIMIT 50

一次真实的推演。 某个申请 80 万经营贷的五金加工厂老板,征信空白、报表不具参考性。图谱从他出发扩展三跳后返回:他名下还有两家关联企业,其中一家半年前被列为被执行人;他为这两家企业分别提供过担保;他的主要客户集中在同一家贸易公司,开票占比 71%;他的经营地址上还注册了另外四家企业,其中两家已注销。这四条里,前两条指向隐性关联负担,第三条指向客户集中度过高,第四条指向地址异常聚集——没有一条出现在申请材料里。信贷员据此上门核实,客户承认其中一家关联公司确有纠纷,最终额度从 80 万压到 30 万并追加担保。

这个案例里图数据库没有"拒掉"任何人,它只是把原本要等三个月后才暴露的信息,提前到了审批当天。对首贷户群体来说,这恰恰是最合适的用法:不是用图谱把没记录的人挡在门外,而是用图谱给没记录的人补上一份可以被讨论的档案。

四、替代数据与图算法的实际产出

把常用替代数据、对应的图谱关系、能得出的风控结论和适配算法列出来,可以直接作为建模清单:

替代数据源 图谱中的关系表达 能得出的判断 适配图算法
税务开票数据 企业与上下游的供需边,带金额与频次 经营真实性、客户集中度、账期健康度 社区发现、度中心性
社保与公积金 企业与员工的雇佣边 实际用工规模,与财报/开票交叉验证 属性聚合
工商与股权 个人与企业的持股、任职边 隐性关联、壳公司识别、实控人穿透 多跳遍历、环检测
司法与执行 担保、涉诉、被执行边 隐性负债与代偿风险 最短路径、子图匹配
经营场所 企业与地址、园区、仓库的占用边 同一地址多家企业、注册地址异常聚集 联通子图、标签传播
物流与仓储 货物运输、库存周转边 真实贸易背景,识别走单不走货 路径分析
同商圈企业群 同行业、同区域企业组成的关系网 区域性、行业性风险的传导暴露 PageRank、社区发现

需要强调的是,图谱给出的是参考而不是判决。首贷户授信最终仍要结合额度、期限、担保方式综合决策。图谱的价值在于把决策依据从"空白"变成"若干条可核实的证据",把风险从未知变成可度量——这对首贷户这种缺乏历史数据的群体,是唯一可行的路径。

五、悦数图数据库的核心能力支撑

针对首贷户这类多源替代数据的关联分析场景,悦数图数据库提供了从数据接入到算法输出的完整支撑:万亿边规模可容纳全国范围的企业关系与个人关系网络;存算分离架构使税务、社保、司法等多源数据批量入图时不影响在线查询;动态 Schema 让新增数据源不必停机重构模型;内置图算法库支持社区发现、PageRank、最短路径、联通子图等开箱即用,无需自研分布式算法;CDC 实时同步保证工商变更、新增执行信息能及时反映到图谱;配合 Text2nGQL,业务人员可以用自然语言查询关联关系,不必先学图查询语言。

六、首贷户图谱建设的落地路线图

建议分四阶段推进,每个阶段都有可验证的产出。

第一阶段:单源数据建最小图。 只用工商股权与司法执行两类公开数据,为存量小微客户建图,先验证一件事——图谱能否发现人工尽调遗漏的关联。用历史不良客户回溯检验命中率,这一步通常两周内可完成。

第二阶段:接入税务与社保,做经营真实性校验。 拿到客户授权后接入开票与社保数据,建立多源交叉验证规则,输出"开票-社保-用电"一致性指标,作为首贷审批的辅助参考项。

第三阶段:图算法接入决策流程。 把关联负担评分、网络位置指标做成可调用的服务,嵌入贷前审批环节,设置人工复核阈值,先"提示"后"拦截",逐步积累阈值经验。

第四阶段:贷后联动与样本回流。 首贷户放款后的还款表现回流到图谱,用于标定各指标的权重——首贷户群体最大的价值其实在这里:今天没有记录的人,是明天的有记录样本,越早开始积累,后面的模型越准。

首贷户风控真正的困境不是风险高,而是看不见。当一个人的信贷档案是一片空白的时候,唯一能替他说话的,是他在这个商业网络里留下的那些关系。把这些关系连起来,空白就不再是无解——这既是普惠金融能真正扩面的前提,也是图数据库在这件事上给出的最实在的参考。