资讯中心

2026 LLM大模型权威排行榜评测网站指南(持续更新)

📅 2026/8/22 17:14:39
2026 LLM大模型权威排行榜评测网站指南(持续更新)
面对不同的大模型排行榜真正困难的不是找到一个名次而是判断这个名次反映的是用户偏好、标准化测试、软件工程能力还是价格与速度.如果只想快速了解当前大模型的综合表现优先查看Arena和Artificial Analysis前者更接近真实用户的使用偏好后者适合同时比较能力、价格和推理速度。专项能力则应结合 LiveBench、SWE-bench 等对应基准判断。网站编号表示推荐阅读顺序不代表对平台权威性的绝对排名动态榜单的结果和维护状态仍可能继续变化。网站汇总评测网站开发/维护团队主要方向更新状态ArenaArena Team起源于 UC Berkeley SkyLab / LMSYS真实用户偏好、文本、多模态、代码、Agent持续更新Artificial AnalysisArtificial Analysis综合能力、价格、速度、Agent、API持续更新LiveBenchAbacus.AI、NYU、NVIDIA、UMD、USC 等研究人员动态题库、抗污染、客观评分代码仓库持续更新官网显示“Showing LiveBench-2026-06-25 — the latest release”SWE-benchSWE-bench Team起源于 Princeton、PLI、UChicago软件工程、Coding Agent持续更新LM Market CapAnalyxa LLC多来源综合排名、价格、速度、上下文与趋势持续更新官方称模型元数据每小时刷新Hugging Face Open LLM LeaderboardHugging Face 与开源社区开放权重模型标准基准官方已停止并归档OpenCompass司南上海人工智能实验室相关团队及开源社区中文、通用能力、多模态、专项评测本文归档为历史参考主榜单最近更新时间为 2026-05-13首选推荐快速了解当前大模型表现1. ⭐ Arena看真实用户偏好与实际对战表现网站简介Arena 是基于真实用户匿名对战与偏好投票进行模型比较的平台。平台最初以 Chatbot Arena 形式出现后更名为 LMArena并于 2026 年 1 月正式更名为 Arena。其公开榜单覆盖文本、视觉、代码、图像、视频、搜索和 Agent 等多种模型与任务。开发团队简介Arena 最初由加州大学伯克利分校UC BerkeleySkyLab 的研究人员创建项目早期属于 UC Berkeley / LMSYS 研究体系。此后项目公司化运营由 Arena Team 持续开发和维护。主要评测方式匿名模型对战真实用户投票基于成对比较数据计算模型排名文本、视觉、Web 开发、图像、视频、搜索、Agent 等分类榜单官方链接及更新时间官网https://arena.ai/更新时间动态更新截至 2026-08-19Arena 官方最近公开的榜单产品更新日期为2026-08-14。排行榜https://arena.ai/leaderboard更新时间动态更新截至 2026-08-19Arena 官方最近公开的榜单产品更新日期为2026-08-14。2. ⭐ Artificial Analysis综合比较模型能力、价格与速度网站简介Artificial Analysis 是独立 AI 基准测试与分析平台公开比较大语言模型和 AI API 服务商的能力、价格、输出速度、延迟、上下文窗口以及其他性能指标。其模型榜单包含 Artificial Analysis Intelligence Index并提供代码、Agent、长上下文、多模态、指令遵循等专项评测。开发团队简介Artificial Analysis 由同名独立 AI 基准测试公司开发和维护。平台业务覆盖语言模型评测、推理性能、AI 硬件、语音、图像与视频生成、Agent 等方向。主要评测方式Artificial Analysis Intelligence Index独立运行的模型能力基准测试Coding、Agentic、Long Context、Multimodal 等专项评测API 输出速度、首 Token 延迟、端到端响应时间测试模型与 API 价格比较官方链接及更新时间官网https://artificialanalysis.ai/更新时间持续更新截至 2026-08-19首页 Changelog 最近一条公开更新为2026-08-18。大模型排行榜https://artificialanalysis.ai/leaderboards/models更新时间动态更新截至 2026-08-19平台最近一批公开语言模型评测更新日期为2026-08-18。其他评测与基准测试网站3. LiveBench强调抗污染的动态评测网站简介LiveBench 是面向大语言模型的基准测试和排行榜目标之一是降低测试集污染对评测结果的影响。其题目来源包括数学竞赛、论文、新闻和数据集等并使用具有客观标准答案的任务进行自动评分。开发团队简介LiveBench 由来自 Abacus.AI、纽约大学NYU、NVIDIA、马里兰大学UMD和南加州大学USC等机构的研究人员共同开发项目由 Abacus.AI 赞助。其论文入选 ICLR 2025 Spotlight。主要评测方式使用较新的信息来源构造题目以限制测试集污染使用可验证的客观标准答案进行自动评分Reasoning、Coding、Mathematics、Data Analysis、Language、Instruction Following 等分类评测官方仓库持续维护模型配置与评测代码官方链接及更新时间官网与排行榜https://livebench.ai/更新时间动态页面展示 Showing LiveBench-2026-06-25 — the latest release.GitHubhttps://github.com/LiveBench/LiveBench更新时间最近提交2026-08-18。4. SWE-bench软件工程与 Coding Agent 评测网站简介SWE-bench 是面向大语言模型和软件工程 Agent 的代码能力评测基准。其任务来自真实 GitHub Issue 和对应代码仓库要求模型理解现有代码库、修改代码并通过项目测试。SWE-bench 官方榜单包括 SWE-bench、SWE-bench Verified、SWE-bench Multilingual、SWE-bench Multimodal、SWE-bench Lite 等版本并在 2026 年继续维护相关榜单和软件工程评测项目。开发团队简介SWE-bench 最初由来自 Princeton University、Princeton Language and IntelligencePLI和 University of Chicago 的研究人员提出。原始论文作者包括 Carlos E. Jimenez、John Yang、Alexander Wettig、Shunyu Yao、Kexin Pei、Ofir Press 和 Karthik Narasimhan。项目由 SWE-bench Team 持续维护。主要评测方式真实 GitHub Issue真实开源代码仓库自动运行测试验证补丁正确性以成功解决任务的比例作为核心指标之一Verified、Multilingual、Multimodal 等不同任务集合官方链接及更新时间官网与排行榜https://www.swebench.com/更新时间动态更新官网 News 最近一项标为2026 年 5 月ProgramBench官方代码仓库截至核对日仍在更新。GitHubhttps://github.com/SWE-bench/SWE-bench更新时间最近提交2026-08-18。5. LM Market Cap综合查看模型排名、价格与使用成本网站简介LM Market Cap 是一个 AI 模型排名与比较平台。它汇总多个公开评测来源为模型计算统一的 LMC Score并集中展示价格、输出速度、上下文窗口、能力特性和排名变化等信息。除了大语言模型网站还收录图像与视频生成模型。LM Market Cap 更适合用来快速筛选和横向比较模型而不是作为某项原始基准测试的官方结果来源。需要核验具体能力时仍应回到 Arena、LiveBench、SWE-bench 等原始评测平台。开发团队简介LM Market Cap 官网将其标注为 Analyxa LLC 旗下产品。官网公开资料主要介绍平台功能和排名方法未提供更详细的开发团队成员信息。主要评测方式汇总 Arena Elo、LiveBench、SWE-bench Verified、模型官方报告等多个来源的数据对不同基准分数进行基线扣除和归一化统一换算到 0100 分LMC Score 由基准测试分数90%、能力特性5%和上下文窗口5%组成在基准测试部分将 Arena Elo 作为 30% 的权重其余任务基准合计占 70%单独展示模型价格、速度、上下文窗口、可用方式和历史排名变化支持按照质量、成本和使用需求调整权重生成自定义排名官方链接及更新时间官网与排行榜https://lmmarketcap.com/更新时间动态更新截至 2026-08-19官网显示榜单处于 Live 状态官方说明模型元数据每小时刷新。排名方法https://lmmarketcap.com/docs/methodology更新时间方法页持续维护截至 2026-08-19页面模型评估方法变更记录的最新版本为v32026 年 4 月。历史参考6. Hugging Face Open LLM Leaderboard已停止维护网站简介Open LLM Leaderboard 是 Hugging Face 曾长期维护的开放大语言模型排行榜主要用于比较公开权重模型在多个标准基准上的表现。该榜单曾广泛用于 Llama、Mistral、Qwen 等开放模型的横向比较。Hugging Face 在2025-03-13正式宣布 Open LLM Leaderboard 退役。官方归档材料继续保留旧版榜单、评测方法和历史结果。开发团队简介该榜单由 Hugging Face 团队及开源社区建设和维护依托 Hugging Face Hub、Datasets 和评测工具运行开放模型基准测试。主要评测方式历史版本使用过 IFEval、BBH、MATH、GPQA、MMLU-Pro 等标准基准评测开放模型。官方链接及更新时间归档文档https://huggingface.co/docs/leaderboards/en/open_llm_leaderboard/archive更新时间归档页面本身未公开单一最后更新时间其中 Open LLM Leaderboard v1 官方记录为2024 年 6 月归档。官方退役公告https://huggingface.co/spaces/open-llm-leaderboard/open_llm_leaderboard/discussions/1135更新时间2025-03-13官方宣布 leaderboard officially retiring。7. OpenCompass司南本文作为历史参考网站简介OpenCompass 是面向大语言模型和多模态大模型的开源评测平台提供模型评测框架、数据集、评测配置和公开榜单。其评测体系支持客观评测和主观评测并覆盖知识、语言、理解、推理、代码、安全及垂直领域等能力。本文将 OpenCompass 的综合大模型排行榜列入“归档/历史参考”。截至 2026-08-19主榜单页面显示的最近一次更新时间为2026-05-13CompassArena 页面显示的榜单更新日期为2026-06-11。OpenCompass 代码仓库仍在维护但官网主页显示的模型已经较为陈旧因此显示归档。开发团队简介OpenCompass 由上海人工智能实验室相关团队开发并维护同时接受开源社区贡献。其开源代码、文档和多个专项评测平台仍可访问。主要评测方式标准数据集客观评测LLM-as-a-Judge 评测主观模型比较CompassAcademic 学术榜单CompassArena 匿名模型对战与用户投票多模态、医疗、金融等专项评测官方链接及更新时间OpenCompass 官网https://opencompass.org.cn/更新时间官网首页未公开单一最后更新时间本文参考的综合主榜单最近一次页面更新时间为2026-05-13。大语言模型主榜单https://rank.opencompass.org.cn/leaderboard-llm-v2更新时间2026-05-13主榜单页面显示的最近更新时间。