资讯中心

从10行代码到百万级Agent:我总结了开发「售后工单Agent」的8层进阶技术栈!

📅 2026/8/11 2:32:50
从10行代码到百万级Agent:我总结了开发「售后工单Agent」的8层进阶技术栈!
很多Agent教程从十几行代码开始创建一个Agent挂上两个工具再让它自己循环。Demo跑通的那一刻很有成就感但真正接入业务后问题会立刻变得具体。模型把订单号提错了怎么办退款接口已经成功响应却超时了能不能直接重试知识库里同时存在新旧两版规则该信哪一份一次任务跑了二十轮还没停谁来限制成本这些问题很少靠“再换一个框架”解决。它们分别落在数据结构、工具契约、检索、状态管理、幂等、权限、评测和部署上。本文试图用一个“售后工单Agent”的案例进行说明用户描述问题系统识别诉求查询订单和售后制度判断是否可以退款高风险操作交给人工确认最后留下审计记录。沿着这个案例我们把Agent应用开发需要的技术栈按依赖关系重新排一遍。先看结论如果你已经会Python或TypeScript建议不必先学遍所有Agent框架。更有效的顺序是先把单次模型调用做稳定再接一个只读工具然后加入状态与失败恢复最后补齐评测、安全和部署。01 会调用大模型API为什么还不等于会开发Agent普通聊天应用的主要动作是“输入一段文字生成一段文字”。Agent多了一个关键循环模型不仅回答还要根据环境反馈决定下一步。一次典型运行可以写成读取当前状态选择动作生成工具参数程序执行工具把结果交还模型再决定继续、暂停还是结束。模型负责处理含糊信息和开放判断普通代码负责校验、权限和副作用。这也解释了聊天机器人、工作流和Agent的区别。聊天机器人主要产出自然语言路径短通常不改变外部系统。工作流步骤由程序提前定义模型只处理其中一部分例如先分类、再检索、最后生成回复。Agent模型可以根据中间结果动态选择工具和步骤执行轮数不完全固定。Anthropic把工作流定义为“由预设代码路径编排模型和工具”把Agent定义为“由模型动态控制过程和工具使用”。它同时建议从最简单的可行方案开始因为自主程度越高延迟、成本和错误累积风险通常也越高。Anthropic用“增强型LLM”说明模型如何接入检索、工具和记忆。售后场景就是一个很好的分界。回答“七天无理由退货怎么规定”可能只需检索加生成真正执行退款则会修改资金状态必须增加确定性的金额校验、权限判断、人工审批和幂等控制。02 一张图看懂Agent应用开发的八层技术栈把Agent理解成一个会思考的黑盒很容易漏掉工程工作。更接近现实的看法是把它拆成八层底层越稳定上层才越敢增加自主性。从编程与API基础向上依次连接模型接口、结构化输出、工具、上下文、编排、评测安全和用户体验。这不是八门彼此独立的课程而是一组依赖关系。不会处理HTTP超时和数据校验时直接学习多Agent编排只会把故障藏得更深。技术层主要解决什么问题入门时至少做到编程与API基础调用服务、并发、异常和测试会用HTTP、JSON、环境变量、异步与单元测试模型与推理接口选择模型并控制延迟、成本记录Token、超时、流式事件和模型版本指令与结构化输出把自然语言变成稳定数据用JSON Schema或Pydantic校验结果工具与协议让模型读取或改变外部世界定义清楚参数、返回值、权限和副作用上下文、RAG与记忆给当前决策提供正确事实区分工作区、检索结果、任务状态和长期信息工作流、状态与编排控制步骤、分支和恢复能画状态图保存检查点设置停止条件评测、可观测性与安全判断系统是否可用有测试集、Trace、权限表和人工升级路径服务、存储与部署把Demo变成持续运行的产品会部署API、数据库、队列、日志和回滚Microsoft的入门课程和Hugging Face Agents Course虽然使用的工具不同学习顺序却很相似先理解Agent与工具再进入工作流、RAG、评测、生产和多Agent。这类高关注课程值得借鉴的是层次不是照抄框架代码。03 第一层先学会稳定地调用模型调用模型最先要补的不是复杂提示词而是普通接口能力HTTP请求、JSON、鉴权、环境变量、同步与异步、流式返回、超时、重试和日志。然后再掌握几个模型特有概念系统指令与用户输入怎样分离上下文窗口怎样计量输入和输出Token怎样影响延迟与费用什么时候用更强模型什么时候把简单分类交给便宜模型。对业务开发最实用的一步是让模型输出有Schema的数据。售后工单不要直接返回一段“我觉得用户可能想退款”而应该先形成可校验对象json{ intent: refund_request, order_id: A202608050031, reason: screen_damaged, risk_level: high, missing_fields: [], next_action: query_order}这里的枚举、必填字段、字符串长度和金额类型由Schema负责。模型可以判断意图但字段是否存在、订单号格式是否正确不应再交给模型“凭感觉检查”。结构化输出只能保证形状符合约定不能保证事实一定正确所以订单号还要去业务库核验。这一层的练习目标很明确同一批真实工单反复运行统计Schema通过率、字段准确率、超时率和平均成本。只有单次调用稳定后面的工具循环才有可靠输入。04 第二层工具调用让Agent真正开始“做事”Function Calling常被误解成“模型调用了函数”。更准确的过程是程序把工具名称、描述和参数Schema提供给模型模型生成“想调用哪个工具、参数是什么”程序校验后才真正执行再把结果返回模型。因此模型没有天然权限。是否允许调用、用谁的身份调用、能访问哪些订单、调用后如何审计都由运行时决定。MCP可以标准化客户端与工具服务之间的连接和消息但不会自动替你设计业务权限。MCP 2026-07-28规范售后Agent可以先只接三个工具query_order只读查询订单、支付与物流状态search_refund_policy检索带版本号和生效日期的售后规则create_refund有资金副作用必须带用户身份、审批记录和幂等键。工具说明要像写给新同事的接口文档什么时候用什么时候不能用参数格式、边界条件、错误码和示例都要清楚。Anthropic在实践总结中甚至强调他们优化工具接口花的时间多于优化总提示词。Anthropic工具设计建议好的工具还要“难以误用”。例如退款金额不要允许自由文本“差不多三百元”而要使用最小货币单位的整数订单ID不要支持模糊搜索退款工具与查询工具名称要明显区分有副作用的操作默认要求确认。05 第三层把上下文、RAG、状态和记忆分开这四个概念经常被混成“给Agent加记忆”实际职责并不相同。上下文窗口像当前工作桌RAG从外部档案按需取证任务状态记录执行进度长期记忆只保留经过筛选的稳定信息。Agent当前工作区不应塞入所有历史。它只需包含当前目标、必要对话、最近工具结果和下一步所需证据其余信息按需检索或从状态恢复。上下文窗口是模型本轮能读取的工作区RAG是在调用前从外部资料中找回相关片段任务状态保存“做到哪一步、哪些工具已经成功、正在等待谁审批”长期记忆保存跨会话仍有价值的信息例如用户确认过的偏好。KV Cache只是推理加速产生的中间状态不能替代这些业务记忆。售后Agent最常见的检索故障不是“完全找不到”而是找到一份过期制度。文档入库时至少要保存版本、适用地区、生效日期和失效日期召回时结合关键词与向量检索再用重排序筛选最终回复附上依据。规则冲突时普通代码先按日期和适用范围过滤模型再解释差异。长期记忆也不该自动保存整段聊天。用户临时说“这次送到公司”不一定是永久地址身份证、银行卡等敏感信息更不该因为“以后方便”就写入记忆库。写入前需要明确用途、保留周期和删除机制。06 第四层什么时候需要工作流和Agent框架当任务只有一次模型调用和一个只读查询时直接使用模型API通常更容易调试。出现多步骤、循环、人工暂停、并行或恢复需求后再引入编排框架。常见模式包括顺序链、条件路由、并行处理、Agent循环和“生成—评估—修改”。固定步骤多的业务工作流更合适步骤难以预先确定的开放任务才更需要Agent自主选择。需求更合适的起点原因单模型、少量工具、希望掌握循环细节直接使用模型API抽象少方便查看每次输入、输出和工具参数快速构建单Agent、需要工具、Guardrail与TraceOpenAI Agents SDK提供Agent、Runner、工具、交接和追踪等少量核心原语长时间、有状态、需要中断恢复与人工介入LangGraph强调持久化、durable execution和human-in-the-loop.NET、Python或Go企业应用与显式工作流Microsoft Agent Framework提供Agent、会话、类型化工具、遥测和图式工作流OpenAI Agents SDK把Agent描述为配置了指令、工具、结构化输出、Guardrail和可选交接行为的模型并由Runner管理循环。OpenAI Agents SDK LangGraph则把自己定位为面向长时间、有状态任务的低层编排运行时重点能力包括持久化、人工介入和把确定性节点与模型节点放在同一张图中。Microsoft Agent Framework的文档给出一个很实用的判断开放、对话式任务适合Agent步骤明确、需要严格控制顺序的任务适合工作流能用普通函数可靠解决时就先用函数。不要一开始就拆成五个Agent。多Agent会增加上下文复制、交接误差、成本和调试难度。先把一个Agent和几个边界清楚的工具跑稳只有当角色确实需要不同权限、不同上下文或并行执行时再拆分。07 第五层让Agent失败后可以恢复Agent会失败并不可怕可怕的是程序不知道失败发生在动作之前还是之后。假设退款服务已经扣减商家余额并创建交易但网络响应在返回前超时。运行时看到超时就重试用户可能收到两笔退款。这个问题不是模型推理不够认真而是副作用操作缺少幂等与状态查询。工单先结构化、检索规则并查询订单风险动作经过人工审批退款超时时先按幂等键查询状态再决定是否重试。模型负责给出风险建议和下一步候选程序负责金额上限、审批门槛、幂等键、超时恢复和审计。两者边界越清楚系统越容易排错。pythondef safe_refund(order_id: str, amount_fen: int, run_id: str): key frefund:{order_id}:{run_id} existing get_refund_by_idempotency_key(key) if existing: return existing if amount_fen 50_000: return pause_for_human_approval(key, order_id, amount_fen) return create_refund( order_idorder_id, amount_fenamount_fen, idempotency_keykey, )生产运行时还需要检查点、指数退避、最大重试次数、取消信号、最大循环轮数和预算上限。工具结果要区分“确定失败”“确定成功”和“结果未知”只有结果未知时才进入查询状态与恢复流程。高风险步骤则使用中断点保存当前状态发起人工审批收到带签名的决定后从原节点继续。不要把审批结果当成一句可以被用户消息伪造的自然语言。08 第六层评测、安全和可观测性决定能不能上线“我试了十个问题感觉不错”不能替代评测。一个可上线的Agent至少要同时看五类指标任务是否完成、工具是否选对、参数是否有效、回答是否有依据、整个过程花了多少调用与时间。售后Agent的测试集应覆盖正常请求、缺字段、模糊表达、旧规则冲突、无权限订单、工具超时、提示注入和重复退款请求。每个样本都记录期望工具、禁止动作、最终状态和人工升级条件而不只比较最后一句话像不像参考答案。Trace也不能只有模型文本。一次运行至少关联用户与租户、模型版本、提示词版本、检索文档ID、工具参数摘要、工具结果、状态迁移、审批人、耗时、Token和错误类型。OpenAI Agents SDK的追踪会记录模型生成、工具调用、交接和Guardrail等事件这类粒度才有助于复盘。OpenAI Agents SDK Tracing安全侧要按“模型输出不可信输入”处理。工具采用白名单和最小权限密钥放在服务端不进入上下文检索文档里的指令不能覆盖系统规则执行代码或访问文件时使用隔离环境删除、付款、退款和对外发送等动作增加确认与审计。上线检查系统是否能在不确定时停止并转人工是否能解释用了哪条规则是否能撤销或补偿副作用是否能按租户隔离数据是否能从日志还原一次完整决策。09 从Demo到上线还要补哪些普通软件技术Agent应用仍然是软件。API层可以使用FastAPI、Django、Node.js或你熟悉的框架PostgreSQL保存业务状态和审计记录Redis处理短期缓存与分布式锁对象存储放文档和附件队列承接长任务和重试。容器、CI/CD、配置中心、灰度发布、限流、熔断、监控和回滚同样重要。模型服务偶尔超时或降级时系统要能切换备用模型、返回可理解的等待状态或者把任务放入队列而不是把内部错误原样甩给用户。成本优化也不能只盯模型单价。缓存是否命中、RAG是否塞入过多文本、循环是否无效重复、并行工具是否真的独立都会改变整体费用。建议按“每个成功任务的总成本”统计而不是只看“每百万Token价格”。最终提示词、工具Schema、检索配置、模型和评测集都要有版本。一次发布如果让工具选择率下降团队必须知道改了什么也必须能够回到上一版。10 推荐的四阶段项目学习路线学习路线最好每一阶段都交付一个能验收的项目而不是看完课程就算完成。下面四个项目沿用同一批售后数据后一个项目复用前一个项目的资产。从结构化提取、知识问答、业务操作到生产上线每一阶段都要求留下测试指标和失败证据。作品集真正有说服力的不是界面截图而是Schema、测试集、失败样例、Trace、权限表和恢复记录。它们能证明你理解系统为什么可靠。01 阶段一结构化信息提取服务用50至100条脱敏工单做输入输出意图、订单号、问题类型、风险等级和缺失字段。提供API、Schema、自动测试和错误重试。验收指标Schema通过率、关键字段准确率、P95延迟和单次成本工程难点脏输入、缺字段、枚举越界和模型版本变化作品证据测试脚本、混淆矩阵、失败样例及修复记录。02 阶段二带依据的知识问答Agent导入多版本售后制度完成文档切分、关键词与向量混合检索、重排序和引用。回答必须显示使用的规则版本不确定时明确说缺什么。验收指标检索召回率、引用正确率、无依据回答率工程难点相似旧制度、表格切分、跨段落条件和访问控制作品证据标注问题集、检索对比、错误归因和版本过滤设计。03 阶段三能够安全操作业务系统的Agent加入订单查询、创建售后单和模拟退款工具。只读工具可自动执行资金动作必须通过金额规则、权限检查和人工审批。验收指标工具选择准确率、参数有效率、重复执行次数和人工升级率工程难点超时后状态未知、幂等、审批恢复和提示注入作品证据工具契约、权限矩阵、状态图、审计日志和故障演练。04 阶段四把Agent改造成可上线系统把前三阶段部署成服务加入身份认证、队列、状态存储、Trace、离线评测、监控告警、限流和回滚。用固定测试集做每次发布的回归门槛。验收指标端到端成功率、P95时延、每个成功任务成本、恢复时间工程难点并发状态、租户隔离、模型降级和配置版本管理作品证据架构图、线上演示、指标看板、发布记录和事故复盘。如果目标是求职这四个项目比“又做了一个聊天框”更有区分度。面试时也不要只讲用了什么框架要能解释一次失败在哪里发现如何定位为什么选择程序规则而不是继续改Prompt修复后哪个指标发生了变化。最后唠两句为什么AI大模型成为越来越多程序员转行就业、升职加薪的首选很简单这些岗位缺人且高薪智联招聘的最新数据给出了最直观的印证2025年2月AI领域求职人数同比增幅突破200% 远超其他行业平均水平整个人工智能行业的求职增速达到33.4%位居各行业榜首其中人工智能工程师岗位的求职热度更是飙升69.6%。AI产业的快速扩张也让人才供需矛盾愈发突出。麦肯锡报告明确预测到2030年中国AI专业人才需求将达600万人人才缺口可能高达400万人这一缺口不仅存在于核心技术领域更蔓延至产业应用的各个环节。那0基础普通人如何学习大模型 深耕科技一线十二载亲历技术浪潮变迁。我见证那些率先拥抱AI的同行如何建立起效率与薪资的代际优势。如今我将积累的大模型面试真题、独家资料、技术报告与实战路线系统整理分享于此为你扫清学习困惑共赴AI时代新程。我整理出这套 AI 大模型突围资料包【允许白嫖】✅从入门到精通的全套视频教程✅AI大模型学习路线图0基础到项目实战仅需90天✅大模型书籍与技术文档PDF✅各大厂大模型面试题目详解✅640套AI大模型报告合集✅大模型入门实战训练这份完整版的大模型 AI 学习和面试资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】①从入门到精通的全套视频教程包含提示词工程、RAG、Agent等技术点② AI大模型学习路线图0基础到项目实战仅需90天全过程AI大模型学习路线③学习电子书籍和技术文档市面上的大模型书籍确实太多了这些是我精选出来的④各大厂大模型面试题目详解⑤640套AI大模型报告合集⑥大模型入门实战训练如果说你是以下人群中的其中一类都可以来智泊AI学习人工智能找到高薪工作一次小小的“投资”换来的是终身受益应届毕业生‌无工作经验但想要系统学习AI大模型技术期待通过实战项目掌握核心技术。零基础转型‌非技术背景但关注AI应用场景计划通过低代码工具实现“AI行业”跨界‌。业务赋能 ‌突破瓶颈传统开发者Java/前端等学习Transformer架构与LangChain框架向AI全栈工程师转型‌。获取方式有需要的小伙伴可以保存图片到wx扫描二v码免费领取【保证100%免费】