Qwen-Agent 本地部署一块 8GB 显卡如何把会函数调用的 Agent 跑在自己机器上【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-AgentQwen-Agent 是一个开源的 AI Agent 框架原生支持函数调用、代码解释器与 RAG。做本地化部署后推理、文档解析、工具执行全部发生在自己的机器上不依赖云端 API数据不出域模型可替换。先装基础包pip install -U qwen-agent[rag,code_interpreter]然后按显存档位往下走。先定档位三条显存基线档位硬件基线跑得动跑不动入门4–8GB 显存或 32GB 内存纯 CPU7B–8B 四比特量化、单 Agent 加简单函数调用14B 以上、长文档 RAG进阶12–24GB 显存14B 全精度或 32B 量化、代码解释器、PDF 问答72B、多用户并发生产多卡或服务器级32B–72B、多 Agent、MCP 工具生态无硬性上限预算成本即可判断标准只有一个目标模型的函数调用能不能稳定触发——这是 Agent 框架的入口模型不行后面全白搭。入门档4–8GB先跑通最小闭环选什么模型Qwen2.5-7B-Instruct 或 Qwen3-8B 的 4-bit 量化版显存占用约 5–6GB。别贪更大小模型函数调用模板解析失败率明显更高。怎么起本地服务Ollama 最省心的路线两条命令ollama pull qwen2.5:7b然后ollama serve默认 11434 端口自带 OpenAI 兼容的/v1接口。怎么接进 Qwen-Agent本地模型集成的关键只有一处model_type填oai指向任何 OpenAI 兼容服务即可。from qwen_agent.agents import Assistant llm_cfg { model: qwen2.5:7b, model_type: oai, # 任何 OpenAI 兼容本地服务 model_server: http://localhost:11434/v1, api_key: EMPTY, } bot Assistant(llmllm_cfg, function_list[code_interpreter]) print(list(bot.run([用工具算一下 17*23再用一句话总结结果])))怎么跑通验证看两点返回里有 function_call 记录、且工具结果被引用进最终回答。若模型只给答案不触发工具说明 7B 档位的函数调用本地实现不稳定升档或换带原生工具调用的模型。进阶档12–24GB代码解释器与文档问答选什么模型Qwen2.5-14B-Instruct 全精度留足上下文给 RAG预算宽裕上 32B int8复杂任务成功率更高。怎么起本地服务用 vLLM 替掉 Ollama吞吐和长上下文表现更好vllm serve Qwen/Qwen2.5-14B-Instruct --port 8000量化版加--quantization参数。怎么接进 Qwen-Agent接入配置与入门档完全同构只改两处键配置键入门档进阶档modelqwen2.5:7bQwen2.5-14B-Instructmodel_serverlocalhost:11434/v1localhost:8000/v1api_key仍填EMPTY函数调用走 Qwen-Agent 内置的模板解析不需要改 Agent 逻辑。怎么跑通验证让 Agent 调用代码解释器画一张图代码在 Jupyter 沙箱里执行产物落在本地磁盘与宿主环境隔离这是代码解释器安全运行的基本形态。能落出图片文件即通过。生产档多卡并发、多 Agent 与 MCP选什么模型32B–72B 或 MoE 系列按 QPS 和并发数倒推MoE 推理激活参数少同样的卡能多扛一倍并发。怎么起本地服务vLLM 或 SGLang 多卡张量并行。三个硬性要求只监听内网地址、api_key走环境变量不落配置文件、推理服务与工具执行服务分开部署。怎么接进 Qwen-Agentmodel_server指向内网网关地址其余键不变多 Agent 场景里各 Agent 共享同一个 llm 配置字典即可多模态应用接视觉模型也只是把 model 换成 VL 系列。怎么跑通验证固定一组函数调用回归 prompt 做冒烟测试再压一小时负载工具调用成功率和 P95 时延进目标区间才算交付。能力拼装按需加装不装不要能力什么时候要怎么开备注代码解释器数据分析、出图出表function_list加code_interpreter装[code_interpreter]extrasJupyter 沙箱执行隔离宿主PDF 文档问答系统长文档、手册问答装[rag]extrasAssistant(files[pdf 路径])解析与检索均在本地文档不出机器自定义工具开发接内部 API、业务系统继承BaseTool用register_tool(名称)注册参数写清 schema模型才会稳定调用MCP 工具生态接现成工具服务装[mcp]extras经 mcp_manager 挂载适合多 Agent 共享工具验收与调优现象 → 原因 → 一招解决现象可能原因一招解决❌ 连接超时服务没起或端口不对curl一下/v1/models通才是真通不触发工具调用模型太小或模板不匹配换 7B 带原生函数调用的模型工具参数 JSON 解析失败小模型遵循度差工具 description 里补一个参数示例生成慢上下文过长generate_cfg里收紧max_input_tokens显存 OOM批处理或上下文超预算vLLM 加--gpu-memory-utilization 0.9代码解释器无输出Jupyter kernel 未就绪查 code_interpreter 服务日志上生产前迁移检查清单✅ 数据不出域审计一遍依赖确认没有调用任何外部 API 域名模型可替换model和model_server两个键是唯一耦合点换服务不动 Agent 代码可随时回滚旧云端 API 的配置留在环境变量里一条命令切回可观测函数调用轨迹与 P95 时延进日志工具失败率设告警档位定得准闭环跑得快——先把入门档的验证清单走完再决定要不要加卡。【免费下载链接】Qwen-AgentAgent framework and applications built upon Qwen3.0, featuring Function Calling, MCP, Code Interpreter, RAG, Chrome extension, etc.项目地址: https://gitcode.com/GitHub_Trending/qw/Qwen-Agent创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考