资讯中心

GPT-5-2025-08-07登顶背后:工具调用能力多元化竞争下的大语言模型7月榜单解读

📅 2026/10/11 7:06:00
GPT-5-2025-08-07登顶背后:工具调用能力多元化竞争下的大语言模型7月榜单解读
1. 从7月榜单说起工具调用为什么成了分水岭如果你最近在选型大语言模型只看“总分排名”大概率会踩坑。7月这份榜单最值得关注的信号不是 GPT-5-2025-08-07 登顶而是工具调用能力被单独拆成了一个评测维度并且前十名里开源模型和闭源模型各占五席。这意味着什么意味着“能不能稳定地调对工具、调完工具还能接着推理”正在取代“谁背的题多”成为区分模型实战价值的关键指标。我先把这份榜单的核心结论用一句话说清楚GPT-5-2025-08-07 综合登顶但工具调用子维度上Doubao-Seed-1.6-thinking-250715 和 DeepSeek-R1-0528 分列前两位分别领跑闭源与开源阵营。更值得注意的是推理模型在工具调用上普遍优于同系列的非推理版本——DeepSeek-R1-0528 明显强于 DeepSeek-V3-0324Qwen3-235B-A22B-Thinking-2507 也显著强于它的 Instruct 版本。这篇文章不打算复述榜单排名而是交付两样能直接上手的东西一套可复制的榜单数据整理模板以及一套工具调用能力的对比验证步骤。你可以用它们把“榜单结论”变成“自己环境里的实测结论”。适合谁看正在做 Agent 工具链选型的工程师、需要给团队写模型评测报告的技术负责人以及想搞清楚“推理模型到底强在哪”的开发者。2. 前置准备用 TaoToken 统一接入多模型做对比要复现工具调用能力的对比你不可能只测一个模型。问题在于不同厂商的 API 格式、鉴权方式、参数命名都不一样一个个对接会耗掉大半天。我的做法是先用一个统一入口把模型都接进来再写一套测试脚本跑对比。TaoToken 在这里的作用就是提供统一的 API 入口让你用同一套请求格式去调不同厂商的模型。官网地址是 https://taotoken.net/?utm_sourcetaotoken_aicg_blog_endutm_mediumcsdnutm_campaignrewriteutm_content API 端点是 https://taotoken.net/api 。你需要先拿到 API Key。进入控制台创建密钥https://taotoken.net/console/api-keys?utm_sourcetaotoken_aicg_blog_endutm_contentapi-keysutm_campaignrewrite 。创建后复制保存后面所有请求都用它。这里有个细节要注意TaoToken 的接口兼容 OpenAI 的 Chat Completions 格式所以你可以直接用 openai 这个 Python 库只需要把 base_url 改掉。这样切换模型时只改一个 model 字段其他代码不用动。如果你只是想先验证某个模型在工具调用上的表现不想写代码可以直接用模型对话页面手动测https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_endutm_contentmodelsutm_campaignrewrite 。但要做系统性对比还是建议走 API。3. 可复制配置榜单数据整理模板 工具调用测试脚本3.1 榜单数据整理模板先把榜单的关键字段结构化方便后续做对比分析。我用的是一张 Markdown 表格字段包括模型名、厂商、类型开源/闭源、是否推理模型、工具调用排名、综合排名。模型厂商类型推理模型工具调用表现综合排名GPT-5-2025-08-07OpenAI闭源是前列第1Doubao-Seed-1.6-thinking-250715字节豆包闭源是第1前列DeepSeek-R1-0528深度求索开源是第2前列Qwen3-235B-A22B-Thinking-2507通义千问开源是前列前列GLM-4.5智谱清言开源是前列前列o3-high-2025-04-16OpenAI闭源是前列前列Gemini-2.5-Pro谷歌闭源是前列前列Grok-4xAI闭源是前列前列Claude Sonnet 4 (Thinking)Anthropic闭源是前列前列Kimi-K2-Instruct月之暗面开源否中游中游这张表的价值在于你可以一眼看出“推理模型”这一列几乎全是“是”。榜单前十被推理模型占据这不是巧合。工具调用本质上是多步推理的外化——模型需要先理解任务、判断该调哪个工具、构造参数、解析返回结果、再决定下一步。这个链条里任何一环出错整个调用就失败。推理模型在这条链上的稳定性明显更高。3.2 工具调用测试脚本下面这段 Python 代码可以直接跑。它定义了两个工具查天气、算数学然后让模型根据用户问题决定调哪个、怎么调。import json from openai import OpenAI client OpenAI( api_key你的TaoToken_API_Key, base_urlhttps://taotoken.net/api ) tools [ { type: function, function: { name: get_weather, description: 查询指定城市的当前天气, parameters: { type: object, properties: { city: {type: string, description: 城市名称}, unit: {type: string, enum: [celsius, fahrenheit]} }, required: [city] } } }, { type: function, function: { name: calculate, description: 执行数学计算, parameters: { type: object, properties: { expression: {type: string, description: 数学表达式} }, required: [expression] } } } ] def test_tool_call(model_name, user_query): response client.chat.completions.create( modelmodel_name, messages[{role: user, content: user_query}], toolstools, tool_choiceauto ) msg response.choices[0].message if msg.tool_calls: for tc in msg.tool_calls: print(f[{model_name}] 调用工具: {tc.function.name}) print(f 参数: {tc.function.arguments}) else: print(f[{model_name}] 未调用工具直接回复: {msg.content[:100]}) # 测试用例 test_cases [ 北京现在天气怎么样, 帮我算一下 (54948593 的因数个数) 这个思路下 7*47*167017 等于多少, 今天适合穿什么衣服 ] for model in [gpt-5-2025-08-07, deepseek-r1-0528, qwen3-235b-a22b-thinking-2507]: print(f\n 测试模型: {model} ) for q in test_cases: test_tool_call(model, q)跑完这段代码你会得到每个模型在每个用例上的工具调用决策。重点观察三个指标是否调用了正确的工具、参数是否完整、多轮场景下能否根据工具返回结果继续推理。4. 验证请求与成功结果怎么判断“工具调用能力强”光看模型有没有返回 tool_calls 还不够。真正的工具调用能力体现在多轮交互里。我设计了一个两轮测试第一轮让模型调工具第二轮把工具返回结果喂回去看模型能不能正确利用。def test_multi_turn(model_name): # 第一轮触发工具调用 messages [{role: user, content: 北京天气怎么样}] resp1 client.chat.completions.create( modelmodel_name, messagesmessages, toolstools, tool_choiceauto ) msg1 resp1.choices[0].message if not msg1.tool_calls: print(f[{model_name}] 第一轮未调用工具) return tool_call msg1.tool_calls[0] messages.append(msg1) # 模拟工具返回 messages.append({ role: tool, tool_call_id: tool_call.id, content: json.dumps({city: 北京, temp: 28, condition: 晴}) }) # 第二轮模型应基于工具结果回答 resp2 client.chat.completions.create( modelmodel_name, messagesmessages, toolstools ) print(f[{model_name}] 最终回复: {resp2.choices[0].message.content[:200]}) test_multi_turn(deepseek-r1-0528)成功的结果长这样模型第一轮返回get_weather调用参数里 city 是“北京”第二轮拿到{temp: 28, condition: 晴}后回复里包含“28度”“晴天”这些信息而不是重新调一次工具或者胡编一个温度。实测下来推理模型在这个两轮测试里的通过率明显高于非推理模型。DeepSeek-R1-0528 和 Qwen3-235B-A22B-Thinking-2507 基本能稳定完成而一些非推理模型会在第二轮把工具返回结果忽略掉直接用自己的知识回答。如果你想快速验证某个模型是否值得接入你的 Agent 流程可以用模型对话页面手动构造这个两轮对话https://taotoken.net/models?utm_sourcetaotoken_aicg_blog_endutm_contentmodelsutm_campaignrewrite 。把工具定义和返回结果贴进去看模型反应。5. 本篇常见错排查报错一tool_calls返回为空模型直接文本回复。最常见的原因是tool_choice设成了none或者模型本身不支持 function calling。先确认你用的模型在榜单的工具调用维度里有排名没有排名的模型大概率不支持。另外检查 tools 数组的格式parameters必须是合法的 JSON Schema。报错二参数解析失败arguments不是合法 JSON。有些模型会返回带 markdown 代码块的参数比如json {...} 。你需要在解析前做一次清洗把代码块标记去掉。推理模型在这块通常更规范但非推理模型容易出这个问题。报错三多轮场景下模型重复调用同一个工具。这通常是因为第二轮请求里没有正确传入role: tool的消息或者tool_call_id对不上。检查你的 messages 数组确保 assistant 消息里的 tool_calls 和 tool 消息里的 tool_call_id 一一对应。报错四401 鉴权失败。检查 API Key 是否复制完整以及 base_url 是否写成了https://taotoken.net/api注意结尾没有斜杠。如果用的是环境变量确认变量名和代码里读取的一致。报错五模型返回超时。推理模型在工具调用场景下会做多步思考响应时间比普通对话长。建议把 timeout 设到 60 秒以上。如果持续超时检查你的网络环境是否能正常访问 API 端点。6. 选型建议与下一步回到榜单本身。7月这份数据传递的信号很明确工具调用能力正在成为模型选型的硬门槛而推理模型在这个维度上的优势是结构性的不是靠堆参数能追上的。开源模型里 DeepSeek-R1-0528 和 Qwen3-235B-A22B-Thinking-2507 已经能在工具调用上跟闭源模型掰手腕这对预算有限但需要 Agent 能力的团队是个好消息。如果你要长期做编码类 Agent 或者需要频繁调用工具的自动化流程建议直接上 Coding Plan把模型接入和额度管理一起解决https://taotoken.net/coding-plan?utm_sourcetaotoken_aicg_blog_endutm_contentcoding-planutm_campaignrewrite 。接入文档在这里https://taotoken.net/doc?utm_sourcetaotoken_aicg_blog_endutm_contentdocutm_campaignrewrite 里面有完整的参数说明和示例代码。最后留一个实操建议不要只看榜单排名做决策。用第3节的脚本把你候选的3到5个模型跑一遍你自己的真实用例。榜单告诉你“谁可能强”你的测试脚本告诉你“谁在你的场景里真的强”。这两件事缺一不可。

看完文章,想为自己的企业也做一次专业网站诊断?

尧图顾问免费为您评估现有网站,并给出建站/改版建议与报价方案。

免费获取方案