大模型全景图
87一站式了解所有主流大模型,覆盖 OpenAI、Anthropic、Google、DeepSeek 等提供商。
模型
规格
ChatGLM-4-9B
开源
文本 智谱 AI
ChatGLM-4-9B 是智谱 AI 推出的轻量级开源模型,在 9B 参数下实现了出色的综合能力。它支持 128K 上下文和多语言对话,在 Agent 工具调用、代码生成和数学推理方面表现突出。ChatGLM-4-9B 可以在消费级 GPU 上高效运行,是开发者进行 AI 应用开发的热门选择。
Claude 3.5 Haiku
商业闭源
文本 Anthropic
Claude 3.5 Haiku 是 Anthropic 最快的模型,专为需要低延迟和高吞吐量的场景设计。它在保持较高推理质量的同时,响应速度极快,非常适合实时对话、内容审核和数据处理等场景。在同等速度级别的模型中,Claude 3.5 Haiku 的智能水平居于领先地位。
Claude 3.5 Sonnet
商业闭源
文本 Anthropic
Claude 3.5 Sonnet 是 Anthropic 的中端旗舰模型,在智能与速度之间取得最佳平衡。它在编程、创意写作和复杂分析中表现卓越,支持 200K tokens 上下文。在 SWE-bench 编码基准上取得突破性成绩,同时保持了 Anthropic 在安全性和可靠性方面的领先标准。
Claude 4.5 Sonnet
商业闭源
文本 Anthropic
Claude 4.5 Sonnet 是 Anthropic 于 2026 年发布的最强编码模型,在 SWE-bench Verified 上达到约 77% 的突破性成绩,成为代码生成和重构的首选模型。它在长文档分析、多步骤推理和复杂编程任务中表现卓越,同时保持了 Anthropic 在安全对齐方面的领先地位。
Claude 4 Opus
商业闭源
文本 Anthropic
Claude 4 Opus 是 Anthropic 最强大的模型,专为需要深度推理、复杂分析和创意写作的高难度场景设计。它在长文档理解、多步骤推理和跨领域知识整合方面表现卓越。Claude 4 Opus 在 GPQA、MMLU 等学术基准上达到顶尖水平,同时保持了 Anthropic 在安全性和可靠性方面的领先优势。
Claude 4 Sonnet
商业闭源
文本 Anthropic
Claude 4 Sonnet 是 Anthropic 的中高端模型,在智能与效率之间取得最佳平衡。它在编程、写作和复杂分析任务中表现卓越,支持 200K tokens 上下文窗口。Claude 4 Sonnet 在 SWE-bench 编码基准上取得新突破,同时在写作质量和安全性方面保持 Anthropic 一贯的高标准。
Claude Fable 5.1
闭源
多模态 Anthropic
Anthropic 于 2026 年 9 月 1 日发布的最先进编程与知识工作模型,长期 Agent 化编码、知识工作与研究能力全面进化。默认 100 万 tokens 上下文、最大 128K 输出、始终开启自适应思考(adaptive thinking),定价 $10/$50 每百万 tokens,提示词缓存读取低至 $0.25 每百万 tokens,是长程 Agent 任务的最优选。
Claude Mythos 5.1
闭源
多模态 Anthropic
与 Claude Fable 5.1 同底座的增强版,2026 年 9 月 1 日发布,具备最强的编程与知识工作能力,但采用不同防护机制(保留网络安全与生物科学限制),仅通过 Project Glasswing 可信合作伙伴计划提供,面向高安全敏感场景。
Claude Opus 4.8
商业闭源
文本 Anthropic
Claude Opus 4.8 是 Anthropic 于 2026 年 5 月发布的旗舰模型,距离上一版本 Opus 4.7 仅 41 天——创造了 Claude 旗舰系列最短迭代记录。在编码、推理和安全对齐方面全面升级,为后续 Claude Science 科研平台和 Claude Mythos 5 奠定技术基础。
Claude Opus 5
商业闭源
文本 Anthropic
Claude Opus 5 是 Anthropic 于 2026 年 7 月 24 日发布的最强旗舰模型。编码多项评估实现 SOTA,100 万 tokens 上下文窗口,知识截止至 2026 年 5 月。定价维持 Opus 4.8 水平但性能翻倍,是当前 Claude Max 默认模型。在代码生成、长文本分析和复杂推理方面全面领先。
Codestral
开源
代码 Mistral AI
Codestral 是 Mistral AI 专为代码生成打造的模型,支持 80+ 种编程语言。它在代码补全、调试和重构方面表现优异,在 HumanEval 和 MBPP 等编码基准上达到了同规模模型的最高水平。22B 参数的高效架构使其可以在消费级 GPU 上运行,是开发者的理想编程助手。
CogView-4
商业闭源
多模态 智谱 AI
CogView-4 是智谱 AI 最新一代文生图模型,在图像质量和文本遵循度方面重大突破。它支持中英双语提示词,可在单张图像中生成清晰可读的复杂文字,支持任意分辨率输出。CogView-4 在图像真实感、创意性和提示词理解方面达到业界领先水平,是国内最强的文生图模型之一。
Command R+
商业闭源
文本 Cohere
Command R+ 是 Cohere 推出的旗舰企业级模型,专为 RAG(检索增强生成)和工具使用场景优化。它在多语言处理、长文档分析和企业级工作流方面表现卓越。Command R+ 内置了强大的引用功能,可以自动为生成的内容提供来源标注,是企业 AI 应用的理想选择。
Command R7B
开源
文本 Cohere
Command R7B 是 Cohere 推出的轻量级开源 RAG 模型,在 7B 参数下实现了出色的检索增强生成能力。它支持 23 种语言的多语言处理,内置引用功能,可在消费级 GPU 上高效运行。Command R7B 将企业级 RAG 能力带到了小模型和边缘设备上,是 RAG 应用开发的热门选择。
DBRX
开源
文本 Databricks
DBRX 是数据平台巨头 Databricks 推出的开源 MoE 模型,采用细粒度专家混合架构。它在编程、数学和通用推理方面表现优异,在 MMLU 上达到 73.7% 的准确率。DBRX 是 Databricks 投入 1000 万美元训练的代表作,展示了企业级平台在大模型领域的实力。
DeepSeek-Coder-V2
开源
代码 DeepSeek
DeepSeek-Coder-V2 是 DeepSeek 专为代码场景打造的开源模型,基于 MoE 架构,在 338 种编程语言上训练。它在 HumanEval、MBPP 等编码基准测试中超越了 GPT-4 Turbo,在代码补全、调试和重构方面表现优异。支持 128K 上下文,可处理大型代码库,是开发者的理想编程助手。
DeepSeek-Janus-Pro
开源
多模态 DeepSeek
DeepSeek-Janus-Pro 是 DeepSeek 推出的统一多模态理解和生成模型。它采用创新的解耦视觉编码架构,既支持图像理解(描述、问答、OCR),又支持图像生成(文生图)。7B 参数的设计使其可以高效运行,在统一多模态模型中开辟了新的技术路线。
DeepSeek-R1
开源
推理 DeepSeek
DeepSeek-R1 是 DeepSeek 推出的推理增强模型,也是首个开源的大型推理模型。它通过强化学习训练实现了链式思维推理能力,在数学、编程和科学推理等任务上的表现与 OpenAI o1 不相上下。R1 的完全开源引发全球 AI 社区震动,证明了开源模型在推理能力上可以媲美最先进的商业闭源模型。
DeepSeek-V2.5
开源
文本 DeepSeek
DeepSeek-V2.5 是 DeepSeek-V2 的重大升级版本,融合了 DeepSeek-Coder-V2 的代码能力和 DeepSeek-V2 的通用能力。它在数学、编程和通用任务上均达到业界领先水平,并支持联网搜索和文件上传等实用功能。V2.5 以极低的部署成本提供了接近 GPT-4o 的性能。
DeepSeek-V3
开源
文本 DeepSeek
DeepSeek-V3 是 DeepSeek 的旗舰 MoE 模型,总参数量达 671B,每次推理仅激活 37B 参数。它采用多头潜在注意力(MLA)和 DeepSeekMoE 架构,训练成本仅 557 万美元,却达到了与 GPT-4o、Claude 3.5 Sonnet 相当的性能水平。在数学和编码任务中表现尤为突出,是开源社区最具影响力的模型之一。
DeepSeek-V3.1
开源
文本 DeepSeek
DeepSeek-V3.1 是 DeepSeek 于 2025 年 8 月发布的重大升级版本,被定义为「迈向 Agent 时代的第一步」。它采用混合推理架构,一个模型同时支持思考模式和非思考模式,原生支持工具调用和 Agent 能力。在 Agent 基准测试中大幅超越前代,保持 MIT 开源协议。
DeepSeek-V3.2
开源
文本 DeepSeek
DeepSeek-V3.2 是 DeepSeek 最新旗舰模型,在编码和通用能力上全面升级。API 定价低至 $0.14/M tokens,被称为「最便宜的顶级模型」。支持 Agent 能力、长上下文理解和多语言对话,在 SWE-bench 和 LMArena 上排名前列。
DeepSeek-V4.1-Flash
开源
多模态 DeepSeek
DeepSeek-V4.1-Flash 是 DeepSeek 于 2026 年 9 月 10 日发布的新架构家族最小尺寸成员。552B 总参数 MoE,采用全新 Causal-Encoder-Decoder(CED)非对称架构,输入侧仅激活 8B、输出侧激活 16B,专为 Agent 时代「输入重、输出轻」的真实负载设计。支持 100 万 tokens 上下文与最大 384K 输出,原生多模态视觉理解,KV Cache 相比上一代 HBM 需求降至 1/4。基准全面超越旗舰 V4 Pro,API 定价低至缓存命中 ¥0.02/百万 tokens,是 Agent 时代最具性价比的开源模型。
DeepSeek V4 Flash
开源
文本 DeepSeek
DeepSeek V4 Flash 是 DeepSeek 于 2026 年 7 月 31 日发布的最新开源模型,284B 总参数 MoE 架构,推理仅激活 13B 参数。100 万 tokens 上下文,API 缓存命中后输入成本低至 ¥0.02/百万 tokens。性能对标 GPT-5,Agent 能力超越 Claude Opus 4.8,发布当天 Unsloth 即推出本地运行版本。该模型已于 2026 年 9 月 10 日随 DeepSeek-V4.1-Flash 发布而退役,原有 API 请求自动由 V4.1-Flash 承接并按 Flash 价格计费。
豆包 Doubao-1.5-pro
商业闭源
文本 字节跳动
豆包 Doubao-1.5-pro 是字节跳动推出的旗舰级大语言模型,采用大规模 MoE 架构,在中文语言理解、知识问答和创意写作方面表现突出。它拥有 256K tokens 的超长上下文窗口,在长文档处理和多轮对话场景中具有显著优势。通过豆包平台和火山引擎对外提供服务,深度集成字节跳动产品生态。
文心一言 4.0 Turbo
商业闭源
多模态 百度
文心一言 4.0 Turbo 是百度推出的旗舰级大模型,基于文心大模型 4.0 架构优化而来。它具备理解、生成、逻辑和记忆四大核心能力,在中文场景中表现尤为出色。支持文本生成、图像理解、代码编写等多种任务,并通过百度智能云千帆平台提供企业级 API 服务,是国内使用最广泛的大模型之一。
Falcon 3
开源
文本 TII
Falcon 3 是阿布扎比 TII 推出的第三代开源模型系列,在 14 万亿 tokens 上训练。它在 MMLU、HellaSwag 等基准上超越了同规模的其他开源模型,包括 Llama 3.2 和 Qwen 2.5。Falcon 3 采用 Apache 2.0 协议,完全开放商用,是中东地区 AI 力量的代表作。
Gemini 2.5 Flash
商业闭源
多模态 Google
Gemini 2.5 Flash 是 Google 的高效思考型模型,在速度与智能之间取得优化平衡。它同样支持 100 万 tokens 上下文和原生多模态,并具备思考推理能力。相比 Pro 版本,Flash 以更低的延迟和成本提供了接近的智能水平,是大多数生产场景的理想选择。
Gemini 2.5 Pro
商业闭源
多模态 Google
Gemini 2.5 Pro 是 Google 最先进的思考型模型,能够在回答前进行深度推理。它拥有 100 万 tokens 的超长上下文窗口,原生支持文本、图像、视频、音频和代码的多模态理解。在 LMArena 排行榜上长期位居前列,数学和科学推理能力尤其突出,适合需要复杂推理和跨模态理解的专业场景。
Gemini 2.5 Pro (Thinking)
商业闭源
推理 Google
Gemini 2.5 Pro 的思考增强版本,在回答前进行更深入的推理链分析。它特别强化了数学、科学和逻辑推理能力,在需要多步骤推导的复杂问题中表现远超普通版本。支持 100 万 tokens 上下文和原生多模态输入,是 Google 目前最强大的推理模型。
Gemini 3.5 Flash
商业闭源
多模态 Google
Gemini 3.5 Flash 是 Google 在 I/O 2026 发布的高效多模态模型,在速度与智能之间取得新突破。它继承了 Gemini 3 Pro 的核心能力,以更低延迟和成本提供服务。支持文本、图像、视频、音频和代码的全模态理解,是多模态应用大规模部署的理想选择。
Gemini 3.7 Flash
闭源
多模态 Google
Google 于 2026 年 8 月 13 日推出的编程与智能体主力模型,在软件工程、Web 开发与 Agentic Workflows 方面显著改进,是当前最智能的编程与智能体主力模型之一,2026 年 12 月 31 日前以初次体验价提供。
Gemini 3.8 Flash
闭源
多模态 Google
Google 于 2026 年 9 月发布的新一代 Flash 系列模型,同步推出面向网络安全场景的 Gemini 3.8 Flash Cyber 版本,延续 3.x 系列的编程与智能体能力路线。
Gemini 3 Pro
商业闭源
多模态 Google
Gemini 3 Pro 是 Google 于 2025 年 11 月发布的最强大模型,拥有 200 万 tokens 的超长上下文窗口和原生视频生成能力。它是唯一能与 GPT-5.2 正面竞争的模型,在多模态理解、代码生成和科学推理方面全面领先。Gemini 3 Pro 标志着多模态 AI 进入新阶段。
Gemini Omni 1.1 Flash
闭源
多模态 Google
Google 全模态世界模型 Gemini Omni 系列于 2026 年 8 月推出 1.1 Flash 版本,支持 Agentic 视频理解,提供更强的构建控制能力,可处理文本、图像、视频与音频的联合理解。
Gemma 3
开源
多模态 Google
Gemma 3 是 Google 推出的开源轻量级模型系列,基于 Gemini 2.0 技术构建。它提供 1B 到 27B 四种规格,支持文本和视觉多模态输入,拥有 128K tokens 上下文窗口。Gemma 3 在同参数规模模型中性能领先,可运行在单 GPU 甚至手机上,是开源社区进行模型微调和部署的优质选择。
GLM-4-Plus
商业闭源
多模态 智谱 AI
GLM-4-Plus 是智谱 AI 推出的旗舰级大模型,采用 MoE 架构,在语言理解、代码生成和图像理解等方面全面升级。它支持 All-Tools 模式,可自动调用搜索、代码解释器、绘图等工具,并具备强大的 Agent 能力。GLM-4-Plus 在中文任务上表现优异,是国内企业级 AI 应用的重要选择。
GLM-5.3-Flash
开源
多模态 智谱 AI
智谱 2026 年 8 月发布的 GLM-5 系列首个原生多模态模型,总参数 320B、激活 18B,采用稀疏注意力与线性注意力混合架构,以更低成本提供超越 GLM-5.2 的智能水平。支持 1M 上下文与 128K 输出,原生支持图像、视频与文件输入,可在代码、浏览器与图形界面之间协同完成任务。
GPT-4.1
商业闭源
文本 OpenAI
GPT-4.1 是 OpenAI 专为开发者打造的新一代模型,在代码生成、指令遵循和长上下文理解方面相比 GPT-4o 有显著提升。它支持高达 100 万 tokens 的上下文窗口,能够处理超长文档和代码库。在前端代码生成、API 调用和结构化输出等任务中表现突出。
GPT-4.1-mini
商业闭源
文本 OpenAI
GPT-4.1-mini 是 OpenAI 推出的高效模型,在保持 GPT-4.1 核心能力的同时大幅降低成本和延迟。它同样拥有 100 万 tokens 上下文窗口,在大多数任务中表现接近 GPT-4.1,但价格仅为后者的 1/5。是预算敏感场景和大规模部署的最佳选择。
GPT-4.1-nano
商业闭源
文本 OpenAI
GPT-4.1-nano 是 OpenAI 最快、最经济的模型,专为简单任务和超高吞吐量场景设计。它拥有 100 万 tokens 上下文窗口,在分类、提取、简单问答等任务中表现出色。延迟极低,价格仅为 GPT-4.1 的 1/20,是自动化流水线和大规模数据处理的理想选择。
GPT-4o
商业闭源
多模态 OpenAI
GPT-4o 是 OpenAI 的旗舰多模态模型,原生支持文本、图像、音频的输入与输出。它在理解视觉内容和语音交互方面表现卓越,平均响应速度比 GPT-4 Turbo 快 2 倍,成本降低 50%。作为 OpenAI 目前最全能的模型,GPT-4o 在 MMLU、HumanEval 等多项基准测试中保持领先地位。
GPT-4o-mini
商业闭源
文本 OpenAI
GPT-4o-mini 是 OpenAI 最具成本效益的小型模型,旨在以极低价格提供 GPT-4o 级别的核心能力。它支持文本和视觉输入,在 MMLU 上得分 82%,在数学推理和编码任务中超越了同级别的 GPT-3.5 Turbo。适合大规模生产环境中的简单任务处理。
GPT-5
商业闭源
多模态 OpenAI
GPT-5 是 OpenAI 于 2025 年 8 月推出的旗舰大模型,原生支持 Agent 能力和工具调用。它具备深度推理、多模态理解(文本/图像/音频/视频)和代码生成能力,在 SWE-bench 和 GPQA 等基准上刷新记录。GPT-5 的 Agent Plugins 规范成为 AI 智能体插件打包标准。
GPT-5.2 Instant
商业闭源
文本 OpenAI
GPT-5.2 Instant 是 GPT-5.2 系列的高效版,在速度与质量间取得最佳平衡。它继承了 GPT-5.2 Pro 的核心能力,以更低的延迟和成本提供服务,是生产环境和大规模部署的理想选择。支持 Agent 插件和工具调用。
GPT-5.2 Pro
商业闭源
推理 OpenAI
GPT-5.2 Pro 是 OpenAI 最强推理模型,2025 年 12 月发布。在专业知识工作领域(电子表格、演示文稿、复杂报告)中能力最强,深度思考模式下可处理多步骤复杂推理。与 Instant 和 Thinking 组成 GPT-5.2 系列三变体。
GPT-5.2 Thinking
商业闭源
推理 OpenAI
GPT-5.2 Thinking 是 GPT-5.2 系列的思考增强版,专为需要深度推理的数学、编程和科学场景设计。在保持 GPT-5.2 核心能力的基础上,通过增强的链式思维推理机制实现更深入的分析,是性价比最高的推理模型。
GPT-5.5 Instant
商业闭源
文本 OpenAI
GPT-5.5 Instant 是 OpenAI 于 2026 年 5 月推出的旗舰级免费模型,全员零门槛使用。它在保持 GPT-5.5 核心能力的同时实现极低推理延迟,涵盖写作、编程、分析等全场景需求,是 OpenAI 有史以来最普惠的旗舰模型。
GPT-5.6 Sol
商业闭源
推理 OpenAI
GPT-5.6 Sol 是 OpenAI 当前最强旗舰推理模型,2026 年 7 月发布。GPT-5.6 系列分三个层级:Luna(入门免费)、Terra(中端)和 Sol(旗舰)。Sol 通过创新的滑块机制统一了 Instant 和 Thinking 模式,在编码、推理和多模态任务中全面刷新 SOTA。
GPT-6 Astra
闭源
多模态 OpenAI
OpenAI 于 2026 年 9 月 3 日发布的旗舰模型,训练动用约 10 万颗 NVIDIA Grace Blackwell NVLink72,定位面向工作场景的下一代智能模型。具备高级推理、计算机操作、软件工程、网络安全与科学能力,支持浏览器使用与多步骤工作流,上下文 100 万 tokens。API 定价输入 $10/百万 tokens、输出 $50/百万 tokens,并提供能力更强的 GPT-6 Astra Pro。
Grok 3
商业闭源
多模态 xAI
Grok 3 是马斯克旗下 xAI 推出的第三代大模型,使用 20 万张 H100 GPU 集群训练而成。它在数学推理、科学问答和编程竞赛中表现卓越,具备 DeepSearch 深度搜索和 Think 推理模式。Grok 3 以追求真理和极客精神为设计理念,在 AIME 数学竞赛中取得 93% 以上的高分,是目前 AI 竞赛中最具竞争力的模型之一。
Grok 4.2
商业闭源
多模态 xAI
Grok 4.2 是马斯克旗下 xAI 于 2026 年 2 月发布的最新大模型。拥有 200 万 tokens 的超长上下文窗口,支持极速推理和超低幻觉。在数学、科学和编程竞赛中持续领先,具备实时信息获取和 DeepSearch 能力。Grok 4.2 继承了前代追求真理的设计理念,在复杂推理和实时互动方面表现突出。
Grok 4.6
闭源
多模态 xAI
xAI 于 2026 年 8 月 12 日发布的旗舰模型,属于 1.5T 规模模型家族,重心转向长程 Agent、Coding、知识工作与交互式项目开发,综合能力与 GPT-5.6 Sol 持平,MedAgentBench 以 95.9% 准确率拿下全球第一,DeepSWE v1.1 在 xhigh 思考强度下达 67.0%。
Hunyuan-Large
开源
文本 腾讯
Hunyuan-Large 是腾讯混元团队推出的开源 MoE 模型,拥有 389B 总参数和 52B 活跃参数。它是目前最大的开源 MoE 模型之一,在 MMLU、CMMLU 等基准测试中表现优异。Hunyuan-Large 在中文场景中表现尤为突出,在长文本处理、知识问答和代码生成方面均有出色表现。
Hunyuan Turbo
商业闭源
多模态 腾讯
Hunyuan Turbo 是腾讯混元的最新旗舰商业闭源模型,基于大规模 MoE 架构,在推理速度和智能水平上全面升级。它支持原生多模态(文本、图像、视频理解),拥有 256K tokens 超长上下文,在编程、数学和创意写作方面表现优异。深度集成微信和腾讯生态,是国内用户量最大的 AI 模型之一。
Jamba 1.5
开源
文本 AI21 Labs
Jamba 1.5 是 AI21 Labs 推出的创新开源模型,融合了 Mamba 状态空间模型和 Transformer 架构的优势。它拥有 256K tokens 的超长上下文窗口,在处理长文档时具有极高的吞吐量和低内存占用。Jamba 1.5 在长上下文处理效率和推理质量上达到了新的平衡,Mini 版(52B)可在单 GPU 上运行。
Kimi K2
商业闭源
文本 月之暗面
Kimi K2 是月之暗面(Moonshot AI)推出的超大规模 MoE 模型,总参数量超过 1 万亿,是目前参数量最大的大语言模型之一。它在长文本理解、深度推理和知识问答方面表现卓越,继承了 Kimi 系列一贯的长上下文处理优势。Kimi K2 在专业领域知识问答和复杂文档分析场景中具有独特优势。
Kimi K3
开源
多模态 月之暗面
月之暗面于 2026 年 7 月 16 日发布,是目前全球参数最大的开源模型。总参数 2.8 万亿、激活 104B,采用 Kimi Delta Attention(KDA)+ Attention Residuals 架构与 Stable LatentMoE(896 专家激活 16),原生视觉理解,100 万 tokens 上下文,面向软件工程、知识工作、深度研究、多模态理解等复杂任务,整体缩放效率约为 K2 的 2.5 倍。
Llama 3.2
开源
多模态 Meta
Llama 3.2 是 Meta 推出的多模态模型系列,首次在 Llama 系列中引入视觉理解能力。它提供 1B、3B 的轻量纯文本模型和 11B、90B 的多模态模型,覆盖从手机到数据中心的全部部署场景。90B 版本在图像理解、文档分析和多模态对话方面表现优异。
Llama 3.3
开源
文本 Meta
Llama 3.3 是 Meta Llama 3 系列的最终版本,在 70B 参数规模下实现了接近 Llama 3.1 405B 的性能水平。它采用密集架构(非 MoE),在文本生成、代码编写和多语言任务方面表现出色。Llama 3.3 以更低的部署成本提供了高质量的文本生成能力,是开源社区最受欢迎的基座模型之一。
Llama 4.1
开源
多模态 Meta
Llama 4.1 是 Meta 于 2026 年发布的最新一代开源多模态模型,延续 Llama 4 系列的 MoE 架构并全面升级。在编码、数学和视觉理解方面大幅提升,上下文窗口扩展至 1000 万 tokens。Llama 4.1 强化了 Agent 工具调用和代码执行能力,是开源社区最具竞争力的模型之一。
Llama 4 Maverick
开源
多模态 Meta
Llama 4 Maverick 是 Meta 的高性能开源多模态模型,同样采用 MoE 架构,拥有 400B 总参数和 17B 活跃参数。它在图像理解、编码和推理领域表现卓越,性能与 GPT-4o 相当。Maverick 拥有 1000 万 tokens 的超长上下文窗口,在长文档分析、代码库理解和多模态对话方面具有显著优势。
Llama 4 Scout
开源
多模态 Meta
Llama 4 Scout 是 Meta 推出的轻量级开源多模态模型,采用 MoE 架构,拥有 17B 活跃参数和惊人的 1000 万 tokens 上下文窗口。它原生支持文本和图像理解,可在单张 H100 GPU 上运行。Scout 在长文档处理和代码理解方面表现突出,是开源模型中上下文窗口最长的选择。
MiniMax-Text-01
商业闭源
文本 MiniMax
MiniMax-Text-01 是 MiniMax 推出的超大规模 MoE 模型,拥有 456B 总参数和 100 万 tokens 的超长上下文窗口。它采用创新的 Lightning Attention 和 Softmax Attention 混合机制,在长文档处理中具有显著优势。在 MMLU 和中文基准测试中达到业界领先水平,是国产 AI 模型的重要力量。
Ministral 8B
开源
文本 Mistral AI
Ministral 8B 是 Mistral AI 的边缘端模型,专为本地设备和离线场景设计。它在 8B 参数规模下实现了出色的推理能力和多语言支持,可在笔记本电脑和手机上流畅运行。Ministral 8B 在知识问答、翻译和摘要等任务中表现出色,是边缘 AI 部署的最佳选择之一。
Mistral Large 2
商业闭源
文本 Mistral AI
Mistral Large 2 是 Mistral AI 的旗舰模型,拥有 123B 参数,在代码生成、数学推理和多语言处理方面表现卓越。它支持数十种自然语言和 80 多种编程语言,在 MMLU 上达到 84.0% 的准确率。Mistral Large 2 以相对较小的参数规模实现了接近 GPT-4o 的性能,是欧洲 AI 力量的杰出代表。
Muse Glimmer
开源
多模态 Meta
Meta 超级智能实验室于 2026 年 8 月 10 日推出的开源模型,标志 Meta 重回开源模型赛道,以开源方式发布模型权重,服务于个人超级智能战略下的基础模型布局。
Muse Spark 1.3
闭源
多模态 Meta
Meta 于 2026 年 9 月 2 日发布的闭源智能体模型,重点强化智能体与编程任务能力,是 Muse Spark 系列的最新迭代(继 7 月 9 日 1.1、8 月 5 日 1.2 之后),支撑 Meta 个人 AI 智能体 Muse 的底层能力。
o3
商业闭源
推理 OpenAI
o3 是 OpenAI 最强大的推理模型,采用链式思维(Chain-of-Thought)深度推理机制,在数学、编程和科学推理方面达到前所未有的水平。它在 2025 年 IOI 金牌级别的编程竞赛中取得优异成绩,在 GPQA 博士级科学推理基准上超越人类专家。适合需要深度思考的复杂推理任务。
o4-mini
商业闭源
推理 OpenAI
o4-mini 是 OpenAI 推出的高效推理模型,在保持 o3 核心推理能力的同时大幅降低计算成本。它采用优化的推理架构,在数学、编程和科学任务中表现优异,是 o3 系列的轻量替代方案。适合需要推理能力但预算有限的场景,在性价比上达到了新的平衡。
Phi-4
开源
文本 Microsoft
Phi-4 是微软研究院推出的 14B 参数模型,以极小的参数规模实现了令人惊叹的推理能力。它通过高质量合成数据训练,在数学和科学推理方面超越了多款大得多的模型。Phi-4 在 GPQA 和 MATH 基准上表现突出,证明了小模型通过优质数据训练也能达到高水平的推理能力。
Phi-4-multimodal
开源
多模态 Microsoft
Phi-4-multimodal 是微软推出的超轻量多模态模型,仅有 5.6B 参数,却支持语音、视觉和文本的全模态处理。它可以在移动设备上实时运行,支持语音识别、图像理解和文本生成。Phi-4-multimodal 在小模型多模态领域创造了新的标杆,是边缘 AI 设备的多模态首选方案。
Pixtral Large
开源
多模态 Mistral AI
Pixtral Large 是 Mistral AI 的旗舰视觉语言模型,基于 Mistral Large 2 架构,新增了先进的视觉编码器。它在文档理解、图表分析和多模态推理方面表现卓越,支持 128K tokens 上下文和多语言处理。Pixtral Large 在开源视觉语言模型中处于领先地位,可处理复杂的图文混合任务。
Qwen2.5-Coder
开源
代码 阿里云
Qwen2.5-Coder 是阿里云专为代码场景打造的开源模型系列,在 5.5 万亿 tokens 的代码数据上训练。它在 HumanEval、MBPP、LiveCodeBench 等编码基准上全面领先同规模模型,32B 版本的编码能力甚至超越了 GPT-4o。支持 92 种编程语言,是开源社区最强大的代码模型之一。
Qwen2.5-Math
开源
推理 阿里云
Qwen2.5-Math 是阿里云专为数学推理打造的开源模型,在英文和中文数学数据上训练。它在 MATH、GSM8K 等数学基准上达到了业界领先水平,72B 版本在竞赛级数学问题上表现尤为突出。支持 CoT 和 TIR(工具集成推理)两种推理模式,是数学教育和研究的理想工具。
Qwen2.5-Max
商业闭源
文本 阿里云
Qwen2.5-Max 是阿里云推出的旗舰级商业闭源模型,采用大规模 MoE 架构,在综合能力上对标 GPT-4o 和 Claude 3.5 Sonnet。它在中文理解、知识问答和复杂推理方面表现突出,特别优化了中英文混合场景下的应用体验。通过阿里云百炼平台提供服务,面向企业级客户。
Qwen2.5-VL
开源
多模态 阿里云
Qwen2.5-VL 是阿里通义千问团队的视觉语言模型,支持图像、视频和文档的深度理解。它能够动态分辨率处理任意尺寸的图片,支持长达数小时的视频分析,并能精准定位图像中的物体坐标。72B 版本在多模态基准测试中达到业界领先水平,是开源视觉语言模型的标杆之一。
Qwen3
开源
文本 阿里云
Qwen3 是阿里通义千问团队发布的最新开源模型系列,提供从 0.6B 到 235B 的多种规格。旗舰版 Qwen3-235B 采用 MoE 架构,在编码、数学和通用能力上全面对标 DeepSeek-V3。Qwen3 系列特别强化了思考模式(Thinking Mode),支持工具调用和 Agent 能力,是开源社区最具竞争力的模型系列之一。
Qwen3.5-Plus
开源
文本 阿里云
Qwen3.5-Plus 是阿里云于 2026 年 2 月开源的新一代旗舰模型,底层架构全面革新,登顶全球最强开源模型榜单。Qwen 系列累计下载量突破 10 亿次,超越 Llama 成为 Hugging Face 上下载最多的开源模型。它在编码、数学和通用能力上全面领先,支持思考模式和 Agent 工具调用。
Qwen3.8-27B
开源
多模态 阿里云
阿里 2026 年 8 月 14 日开源的原生多模态稠密模型,262K 原生上下文(YaRN 可外推至 1M),Apache 2.0 协议可商用。SWE-bench Pro 61.7、QwenSWEBench 79.0、LiveCodeBench v6 90.3、GPQA Diamond 89.2、OSWorld-Verified 84.3,是性能与成本的黄金平衡点,低门槛部署即可覆盖多数真实业务场景。
Qwen3.8-Flash
开源
多模态 阿里云
通义千问 2026 年 8 月推出的多模态大模型,兼具理解与生成能力,原生支持百万级上下文,一次处理超长文档、代码仓库与复杂对话。兼容 OpenAI 与 Anthropic 主流接口,可无缝接入 Claude Code、Codex 等开发者工具,编程辅助、智能体协作、图文理解场景表现突出,推理成本极具竞争力。
Qwen3.8-Max
开源
多模态 阿里云
阿里通义千问 2026 年 8 月发布的旗舰系列开源版本,稀疏 MoE 架构总参数 2.4 万亿、每步激活约 950 亿,混合注意力机制支持 100 万 tokens 上下文与 131K 输出,编码深度与长程自主开发能力突出,可驾驭复杂工程级项目。基准 GPQA Diamond 92.6、PaperBench 93.0、OSWorld 86.1、BabyVision 82.0、CodeArena 全球第 4。定价输入 ¥12/百万 tokens、输出 ¥36/百万 tokens(缓存命中 ¥1.5)。
SenseNova 5.5
商业闭源
多模态 商汤科技
SenseNova 5.5 是商汤科技「日日新」大模型的最新版本,在多模态理解和生成方面全面升级。它在图像理解、视频分析和 3D 内容生成方面具有独特优势,深度集成商汤的计算机视觉技术积累。SenseNova 5.5 在自动驾驶、医疗影像和智能安防等垂直场景中应用广泛。
星火 4.0
商业闭源
多模态 科大讯飞
星火认知大模型 4.0 是科大讯飞推出的最新版本,在语音交互、多模态理解和教育场景方面具有独特优势。它深度集成了讯飞在语音识别和合成方面的技术积累,支持 37 种语言的高质量语音交互。星火 4.0 在教育、医疗、法律等垂直行业有丰富的应用实践。
Step-2
商业闭源
多模态 阶跃星辰
Step-2 是阶跃星辰推出的万亿级 MoE 多模态大模型,在数学、逻辑推理和图像理解方面表现突出。它采用创新的多模态融合架构,在图像生成、视频理解和代码编写方面均有出色表现。Step-2 在多个国际基准测试中达到业界领先水平,是国内多模态 AI 领域的重要力量。
Yi-Large
商业闭源
文本 零一万物
Yi-Large 是零一万物推出的旗舰模型,在综合能力上对标 GPT-4.0。它拥有 200K tokens 的超长上下文窗口,在中文理解、知识问答和逻辑推理方面表现突出。Yi-Large 在 MMLU 上达到 88.5% 的准确率,是国产模型中最早达到 GPT-4 级别性能的代表之一。
Yi-Lightning
商业闭源
文本 零一万物
Yi-Lightning 是零一万物推出的极速大模型,采用 MoE 架构,在保持高质量输出的同时实现了极低的推理延迟。它在 LMArena 排行榜上以高速响应著称,在中文场景中表现尤为出色。Yi-Lightning 以高性价比定位,适合需要快速响应的实时对话和客服场景。
没有匹配的模型,试试更换筛选条件。