1. 金融信贷场景下智能体落地的整体设计思路1.1 为什么金融信贷是智能体最值得啃的硬骨头金融信贷这个领域表面上看流程标准化程度很高——获客、进件、初审、风控、授信、放款、贷后每一步都有SOP。但真正做过信贷系统的人都知道魔鬼全在细节里。同一个客户不同渠道进来的资料格式不一样同一个风控规则不同产品线的阈值不一样同一个监管要求不同地区的执行口径还有差异。这种大框架稳定、小细节极度碎片化的特征恰恰是传统规则引擎和普通RPA最头疼的地方也是AI智能体最能发挥价值的战场。我最初接触华为云智果AgentArts这个平台就是被一个很具体的痛点逼过去的。当时团队维护着一套信贷审批辅助系统里面光收入认定这一个环节就写了三千多行规则代码每加一个资方、每换一个产品就得改代码、跑回归、等发版。业务同事还天天催这个规则昨天就该上了客户等着放款呢。那种被规则变更追着跑的感觉做过信贷系统的人都懂。AgentArts吸引我的点在于它把智能体的编排能力做成了可视化的画布同时底层又保留了很强的工具调用和知识库检索能力。说白了就是让业务逻辑和代码逻辑解耦——规则变了改的是知识库和提示词不是Java代码。这个思路对信贷场景来说价值太大了。1.2 智能体在信贷链路中的定位选择在动手之前我先想清楚了一个问题智能体到底应该放在信贷链路的哪个位置是替代人工审批还是做辅助我的判断是现阶段最稳妥、也最容易出效果的定位是智能辅助人机协同。具体来说就是让智能体承担三类工作第一类是资料预审与信息抽取。客户提交的身份证、银行流水、收入证明、征信报告格式五花八门智能体负责把这些非结构化信息抽成结构化字段并做初步的完整性校验。这一步纯人工做一个客户平均要花十五到二十分钟智能体可以压缩到几十秒。第二类是规则匹配与风险提示。把信贷政策、产品准入条件、风控规则做成知识库智能体根据客户画像去检索匹配输出符合/不符合/需人工复核的结论并附上依据条款。这一步的价值不在于替代审批人做决策而在于把审批人从翻文件、查规则里解放出来。第三类是贷后预警与客户触达。根据还款行为、外部数据变化智能体生成预警信号并起草触达话术由客户经理确认后发送。这个定位的好处是智能体不直接碰资金决策风险可控同时它干的都是重复性高、规则性强、但又需要一定理解能力的活投入产出比最高。1.3 平台选型的几个关键考量市面上做智能体的平台不少我最终选AgentArts主要看中四点一是知识库能力要够硬。信贷场景的知识库不是简单的FAQ而是包含大量表格、条款、附件的复杂文档。AgentArts支持多种格式的文档解析还能做分段和向量化检索时能定位到具体条款这个对信贷场景太重要了。二是工具调用要灵活。信贷系统里有很多存量接口比如征信查询、黑名单校验、额度计算智能体必须能调这些接口。AgentArts的工具编排能力让我可以把这些接口封装成工具在画布上直接拖拽使用。三是流程可控可追溯。金融行业对可解释性要求极高智能体的每一步推理、每一次工具调用、每一条知识库引用都必须留痕。AgentArts的执行日志和链路追踪做得比较完整能满足审计要求。四是部署要合规。信贷数据敏感必须能私有化部署或者用专属云。AgentArts在这块的支持比较到位数据不出域这个底线能守住。提示选平台时不要只看Demo效果一定要拿自己业务里最脏、最乱的那批数据去测。很多平台在干净数据上表现很好一遇到扫描件、手写体、多页表格就露馅。2. 核心细节解析与实操要点2.1 知识库构建把信贷政策喂给智能体知识库是智能体的地基地基没打好上面盖什么都是歪的。信贷知识库的构建我踩过的坑最多这里详细说说。第一步是文档收集与清洗。信贷政策文档通常有几个来源监管文件、总行制度、分行细则、产品说明书、操作手册。这些文档格式各异有PDF、Word、Excel还有扫描件。我的做法是先把所有文档统一转成可编辑格式扫描件用OCR识别然后人工过一遍把页眉页脚、水印、无关的修订记录删掉。这一步很枯燥但省不得。我试过偷懒直接扔原始PDF进去结果检索出来的内容里混着大量页眉文字智能体回答时经常把内部资料 请勿外传这种话也带出来非常尴尬。第二步是分段策略。这是最考验经验的地方。信贷文档的分段不能简单按字数切要按语义单元切。我的原则是一个完整的规则条款作为一个分段比如收入认定标准下的每一条单独成段表格类内容保留表头把每一行转成字段名字段值的文本形式附件和正文的引用关系要保留比如正文说具体见附件三那附件三的内容要打上关联标签。分段长度我一般控制在300到500字之间。太短了信息不完整太长了检索精度下降。这个区间是实测下来比较平衡的。第三步是元数据标注。每个分段都要打上标签比如所属产品线、适用地区、生效日期、文档类型。这些标签在检索时可以做过滤极大提升准确率。举个例子客户问这个产品最高能贷多少如果知识库里同时有A产品和B产品的额度规定没有元数据过滤就会串。打上产品线标签后检索时先过滤再匹配准确率能提升一大截。第四步是检索策略调优。AgentArts默认用的是向量检索但纯向量检索在信贷场景有个问题它对数字和专有名词不敏感。比如年化利率不超过24%和年化利率不超过36%向量相似度很高但意思完全相反。我的做法是向量检索加关键词检索混合对数字、金额、比例这类内容强制走关键词匹配。这个配置在平台里可以调具体参数后面实操部分会讲。2.2 工具编排让智能体真正能干活知识库解决的是知道什么工具解决的是能做什么。信贷智能体需要调用的工具我梳理了一下大概分四类工具类型典型工具调用频率关键注意点查询类征信查询、黑名单校验、工商信息查询高注意接口超时和限流要设重试和降级计算类额度计算、利率计算、还款计划生成高计算逻辑要固化在工具里不要让模型算写入类进件登记、审批意见回写、预警工单创建中必须加人工确认环节不能自动执行通知类短信发送、站内信推送、企微消息中话术模板要审核变量替换要校验这里重点说两个坑。第一个坑是让模型做计算。我一开始图省事想让智能体自己算月供结果它给出的数字经常差几块钱。后来老老实实把还款计划计算封装成一个工具模型只负责提取参数本金、利率、期数计算交给工具。金融场景对数字精度要求极高差一分钱都是事故这个懒偷不得。第二个坑是工具调用的异常处理。征信查询接口偶尔会超时如果智能体没有降级策略整个流程就卡住了。我的做法是给每个工具设置超时时间和重试次数超时后返回一个明确的错误码智能体根据错误码决定是转人工还是走备用方案。比如征信查询失败就提示征信查询暂时不可用请稍后重试或转人工审核而不是傻等着。2.3 提示词设计把审批专家的经验翻译成指令提示词是智能体的灵魂。信贷场景的提示词我的设计原则是角色清晰、步骤明确、边界严格、输出规范。角色设定要具体。不要写你是一个信贷助手要写你是一名有十年经验的信贷审批辅助专员熟悉个人消费贷和经营贷的准入政策你的职责是根据客户资料和知识库规则给出初审意见但不做最终决策。步骤拆解要细致。把审批流程拆成明确的步骤让智能体一步步执行。比如检查客户资料完整性列出缺失项从资料中提取关键字段年龄、收入、负债、征信记录根据客户所在地区和申请产品检索对应的准入规则逐条比对规则记录符合和不符合的项输出初审意见格式为建议通过/建议拒绝/需人工复核并附依据。边界约束要强硬。明确告诉智能体什么不能做不能编造知识库里没有的规则不能替客户做决策遇到不确定的情况必须标注需人工确认。我还会加一句如果知识库中没有相关规则请明确说明未找到相关规则不要自行推断。输出格式要固定。用JSON或者固定模板方便下游系统解析。比如{ conclusion: 需人工复核, matched_rules: [规则A-3, 规则B-1], violated_rules: [规则C-2], missing_info: [近六个月银行流水], reason: 客户负债率超过产品准入阈值但提供了额外资产证明需人工判断 }这个格式是我迭代了好几版才定下来的。早期版本输出的是自然语言下游系统解析起来很痛苦后来改成结构化输出对接效率高了很多。3. 实操过程与核心环节实现3.1 环境准备与基础配置动手之前先把环境理清楚。我用的是华为云智果AgentArts的专属云版本主要是出于数据合规考虑。基础配置分几步第一步创建智能体应用。在AgentArts控制台新建一个应用选择工作流编排模式。这里有个选择是用对话模式还是工作流模式信贷审批这种有明确步骤的场景我强烈建议用工作流模式因为流程可控每一步的输入输出都能定义清楚调试也方便。第二步配置知识库。把前面清洗好的文档上传设置分段规则。AgentArts支持自定义分段我一般设置按标题层级分段最大分段长度500字重叠50字。重叠是为了避免关键信息被切断。向量化模型选平台默认的就行实测在中文信贷文档上效果够用。第三步封装工具。在工具管理里新建工具每个工具定义好入参和出参。以征信查询为例{ tool_name: query_credit_report, description: 根据客户身份证号查询征信报告摘要, input_params: { id_card: string, 客户身份证号, query_reason: string, 查询原因代码 }, output_params: { credit_score: integer, 信用评分, overdue_count: integer, 近两年逾期次数, debt_ratio: float, 负债率, query_status: string, 查询状态 }, timeout: 5000, retry: 2 }工具描述要写清楚因为模型是根据描述来决定调不调这个工具的。描述写得太模糊模型就可能该调的时候不调或者不该调的时候乱调。第四步编排工作流。在画布上把节点连起来。我的工作流大致是这样的开始节点接收客户资料然后并行走两条线——一条是资料抽取一条是知识库检索两条线汇合后进入规则比对节点最后输出初审意见。并行处理能省不少时间实测下来比串行快百分之四十左右。3.2 资料抽取环节的实现细节资料抽取是整条链路的入口这里出问题后面全白搭。信贷资料主要有几类身份证、银行流水、收入证明、征信报告、资产证明。每类的抽取策略不一样。身份证相对简单用OCR加字段映射就行。但要注意有些客户的身份证是临时身份证或者消磁了OCR识别率会下降。我的做法是设置一个置信度阈值低于阈值的字段标红提示人工核对。银行流水是最麻烦的。不同银行的流水格式完全不同有的用收入字样有的用代发工资有的用转账。我的做法是先用关键词匹配定位到可能的收入项再用规则判断。比如连续三个月同一日期、同一金额的入账大概率是工资。这个逻辑我封装成了一个工具叫流水收入识别模型负责调用具体判断逻辑在工具里。收入证明通常是扫描件需要OCR加人工复核。这里有个技巧让智能体把识别出的关键信息姓名、单位、月收入、盖章日期列出来和身份证、流水做交叉验证。如果收入证明上的月收入和流水里的代发工资差异超过百分之二十就标记为需人工核实。这个交叉验证的逻辑是我从老审批员那里学来的非常实用。征信报告的解析最复杂因为格式固定但内容多。我的做法是只抽取关键字段信用评分、逾期记录、查询次数、负债总额。其他内容不抽避免信息过载。抽取出来的字段直接喂给规则比对节点。实操心得资料抽取环节一定要设兜底策略。我遇到过客户上传的是一张手写的收入证明OCR完全识别不了。这时候智能体不能卡死要能识别出这份资料无法自动处理然后转人工。这个判断逻辑很简单但能避免很多客诉。3.3 规则比对与意见生成规则比对是智能体的核心价值所在。我的实现方式是检索比对生成三步走。检索阶段根据客户画像地区、产品、客群类型构造检索query从知识库里召回相关规则。这里有个细节检索query不能只用客户的基本信息还要带上准入条件额度利率这些意图词这样召回更准。比如query写成个人消费贷 准入条件 年龄 收入 负债率 征信要求比只写个人消费贷召回质量高很多。比对阶段把客户字段和规则逐条对照。这一步我让模型做但给了很明确的指令对每条规则输出符合不符合无法判断三种结论之一并说明理由。无法判断的情况包括客户资料缺失、规则表述模糊、存在例外条款。这三种情况都要转人工。生成阶段把比对结果汇总成初审意见。意见的格式我前面说了用JSON。但这里有个优化我让智能体在输出JSON的同时也生成一段自然语言的摘要方便审批人快速浏览。摘要控制在两百字以内只讲关键结论和主要风险点。实测下来这套流程对标准件资料齐全、情况简单的处理准确率能达到百分之九十以上对非标准件的处理准确率在百分之七十左右。非标准件的错误主要集中在规则理解偏差上比如规则说原则上不超过智能体有时候会理解成绝对不能超过。这类问题需要通过持续优化提示词和补充示例来解决。3.4 人机协同界面的设计智能体再强现阶段也离不开人。人机协同界面的设计核心原则是让审批人做判断而不是做查找。我的界面设计是这样的左边是客户资料原文中间是智能体抽取的结构化字段和比对结果右边是审批操作区。智能体把需要人工确认的点用黄色高亮标出来审批人只需要看这些高亮项确认或修改即可。实测下来审批人的单件处理时间从平均十五分钟降到了六分钟左右。这里有个细节很重要智能体的每一条结论都要能追溯到依据。审批人点击不符合规则C-2这个结论界面要能弹出规则C-2的原文和出处。这个追溯功能是审批人信任智能体的关键。没有追溯审批人不敢用有了追溯审批人会把智能体当成一个靠谱的助手。4. 常见问题与排查技巧实录4.1 智能体胡说八道怎么办这是最常见的问题专业说法叫幻觉。信贷场景里智能体编造规则、编造数字后果很严重。我遇到过智能体说根据某某文件第几条该客户不符合准入结果一查那个文件根本不存在。排查思路分三层第一层检查知识库。幻觉往往是因为知识库里没有相关内容模型只能自己编。解决办法是补充知识库或者在提示词里明确如果知识库中没有相关规则请回答未找到相关规则。第二层检查检索配置。有时候知识库里有但检索没召回来。这时候要调检索参数比如提高召回数量、调整相似度阈值。AgentArts里可以设置最小相似度分数我一般设在0.75左右低于这个分数的结果不采纳。第三层检查提示词。提示词里如果给了模型太多自由发挥的空间它就容易编。我的做法是加约束你的所有结论必须基于知识库中检索到的内容引用时注明来源文档和条款编号。下面这张表是我整理的幻觉问题速查表现象可能原因排查方法解决措施编造不存在的规则知识库缺失或检索失败用相同query手动检索知识库补充知识库调低相似度阈值数字计算错误让模型做了计算检查是否调用了计算工具把计算逻辑封装成工具张冠李戴A产品规则用到B产品元数据过滤未生效检查检索时是否带了产品线标签补全元数据检索时强制过滤结论与依据矛盾提示词逻辑不清检查提示词的步骤拆解细化步骤增加自检环节4.2 工具调用失败的排查工具调用失败在实操中很常见原因五花八门。我总结了几类接口超时是最常见的。信贷系统的接口尤其是征信查询响应时间波动很大。我的做法是设置合理的超时时间一般五秒超时后自动重试两次还失败就返回错误码让智能体走降级流程。参数错误也很多。模型提取的参数格式不对比如身份证号多了一个空格或者日期格式不对。解决办法是在工具定义里加参数校验格式不对直接返回错误提示让模型重新提取。权限问题偶尔会遇到。有些接口需要特定的权限令牌令牌过期了就会调用失败。这个要在工具配置里做好令牌管理定期刷新。限流问题在高并发时会出现。信贷业务有高峰期比如月初、季末接口调用量激增。我的做法是在工作流里加一个队列节点控制并发数避免把下游接口打挂。4.3 效果不达预期的调优路径智能体上线后效果不好不要急着推翻重来按这个路径一步步调第一步看数据。把智能体处理错误的案例捞出来分类统计。是抽取错误多还是检索错误多还是比对错误多找到主要矛盾。第二步看日志。AgentArts的执行日志很详细能看到每一步的输入输出。我经常通过日志发现一些意想不到的问题比如某个字段的抽取规则写错了导致后续全错。第三步小步迭代。每次只改一个地方改完测一批数据看效果变化。不要一次改好几个地方否则出了问题不知道是哪个改动导致的。第四步建评测集。从历史数据里挑一批有代表性的案例人工标注正确答案作为评测集。每次迭代后跑一遍评测集看准确率变化。这个评测集我建议至少两百条覆盖各种边界情况。4.4 合规与审计的注意事项金融行业做智能体合规是红线。我踩过的坑主要有两个一是数据留存。智能体处理过程中产生的中间数据比如抽取的字段、检索的记录都要留存备查。AgentArts的日志功能可以满足这个要求但要记得开启日志持久化默认可能只保留一段时间。二是决策可解释。智能体给出的每一个结论都要能解释清楚是怎么来的。这个前面说了靠的是知识库引用和工具调用记录。审计的时候要能还原出完整的决策链路。注意不要用智能体直接做拒绝决策。我的做法是智能体只输出建议拒绝最终拒绝必须由人工确认。这不仅是合规要求也是保护自己。5. 智能体在信贷场景的扩展玩法5.1 从单智能体到多智能体协作单智能体跑通之后我开始尝试多智能体协作。思路是把审批流程拆成几个专职智能体资料审核智能体、规则比对智能体、风险评估智能体、意见生成智能体。每个智能体只干一件事通过工作流串联。这样做的好处是每个智能体的提示词可以写得更聚焦效果更好。比如资料审核智能体只关心资料完整性和字段抽取不用管规则规则比对智能体只关心规则匹配不用管资料格式。职责单一调试起来也容易定位问题。坏处是链路变长延迟增加而且智能体之间的信息传递容易丢失。我的做法是在关键节点加信息校验确保上游输出符合下游输入要求。5.2 贷后预警场景的智能体设计贷后预警是另一个很适合智能体的场景。传统做法是写一堆规则比如逾期超过三天发短信超过七天打电话。但实际情况复杂得多客户可能只是忘了也可能真的遇到困难了一刀切的规则效果不好。我用智能体做贷后预警的思路是根据客户的还款历史、当前逾期情况、外部数据变化比如工商信息变更、司法信息生成个性化的预警等级和触达策略。比如一个一直按时还款的客户偶尔逾期一天可能只需要一个温和的提醒一个频繁逾期的客户又逾期了可能需要客户经理直接介入。触达话术也让智能体生成但必须经过审核才能发送。我建了一个话术模板库智能体根据客户情况选择合适的模板并填充变量这样既保证了个性化又控制了合规风险。5.3 持续运营的关键指标智能体上线不是终点持续运营才是。我关注的指标主要有几个指标含义目标值监控频率抽取准确率字段抽取正确的比例95%以上每日检索命中率知识库检索到相关规则的比例90%以上每周初审通过率智能体给出明确结论的比例80%以上每日人工修正率审批人修改智能体结论的比例15%以下每日平均处理时长单件从进件到出意见的时间3分钟以内实时这些指标里我最看重的是人工修正率。这个指标直接反映了智能体的可信度。修正率高说明智能体结论不准需要调优修正率低说明智能体靠谱可以逐步扩大应用范围。6. 一些踩坑之后的真心话做智能体这一年多最大的体会是技术不是最难的难的是让业务方信任它。我见过太多项目技术做得漂漂亮亮但业务方不用最后不了了之。要让业务方用起来关键是两点一是让智能体干那些他们不想干的活比如翻文件、查规则二是让智能体的结论可追溯、可修正给他们安全感。还有一个体会是不要追求一步到位。我一开始想做一个全流程无人化的审批智能体结果发现根本不现实。后来退一步只做辅助反而落地很快业务方接受度也高。先让智能体在某个环节跑通证明价值再逐步扩展这个节奏比较稳。最后说个具体的技巧智能体的提示词要定期review。业务在变规则在变提示词如果一直不更新效果会慢慢下降。我一般每个月review一次提示词把新出现的bad case加进去把过时的约束删掉。这个习惯坚持下来智能体的效果能一直保持在一个不错的水平。信贷智能体这个方向我觉得才刚刚开始。现在做的更多是辅助人未来随着模型能力提升和合规框架完善可能会走向替代部分人。但不管怎么变金融场景对准确性、可解释性、合规性的要求不会变。做这个方向敬畏心比技术更重要。