Model Observatory

模型观察

不做一张把所有能力压成总分的榜单。这里记录八个长期对象的产品层次、实质变化、开放方式与限制;价格、地区和别名以官方实时页面为准。

资料核验:2026-10-07 · 厂商性能均视为官方报告,尚未替代本站私人测试。

Read the Table

先分清四件事

模型决定基础能力。

产品叠加搜索、文件、记忆与界面。

工具真正执行外部动作。

套餐与地区决定你实际上能不能使用。

Eight Families

八个长期跟踪对象

01

OpenAI

GPT

GPT-6 Astra · GPT-6.1 Sol · GPT-6 Luna

通用模型、工具生态与 Agent 产品的主要参照。

实质变化
形成旗舰、平衡和低成本三层;Sol 强调编码、工具与计算机操作。
边界
ChatGPT、Codex、API 和专用图像/语音模型属于不同产品层。
上下文
约 1.05M
开放方式
闭源 API / 产品
02

Anthropic

Claude

Fable 5.1 · Opus 5.5 · Sonnet 5.5 · Haiku 4.5

长任务、编程、知识工作和模型安全的重要参照。

实质变化
前三者为 1M 上下文、128K 最大输出,形成多层能力与成本组合。
边界
Claude 应用、Claude Code/Cowork 与 API 功能不能混写。
上下文
1M / Haiku 200K
开放方式
闭源 API / 产品
03

Google

Gemini

Gemini 3.1 Pro · 3.8 Flash · 3.8 Live

原生多模态、实时语音与 Google 生态的参照。

实质变化
通用、低延迟语音、扩展思考、TTS、图像和视频已分为明确产品线。
边界
稳定、预览和专用生成模型必须分开记录。
上下文
依具体模型
开放方式
闭源 API / 产品
04

DeepSeek

DeepSeek

DeepSeek V4.1 Flash · V4 Pro

中文、开放权重、成本与 Agent 编程生态的参照。

实质变化
V4.1 Flash 原生视觉,支持思考/非思考、工具调用与 Responses API。
边界
别名可能自动路由;厂商基准不等于本站实测。
上下文
1M
开放方式
开放权重 + API
05

Alibaba

Qwen

Qwen3.8 Max · Qwen3.8-27B · Qwen3.7 Plus/Flash

中文、多模态、开放权重与云端/本地双路线的参照。

实质变化
3.8 Max 面向编程与协作;3.8-27B 提供开放权重。
边界
开放模型、托管模型和地区可用版本并不完全相同。
上下文
最高 1M(依版本)
开放方式
开放权重 + API
06

Meta

Muse / Llama

Muse Spark 1.1 · Llama 4 Scout/Maverick

消费级产品模型与开放权重生态分化的观察对象。

实质变化
Muse 强调多模态推理与工具;Llama 4 提供可下载的开放权重路线。
边界
Muse 的开放度与 Llama 不同,不能统称为最新开源 Llama。
上下文
Llama 4 Scout 标称 10M
开放方式
产品模型 + 开放权重
07

xAI

Grok

Grok 4.7 · Voice · Imagine

实时搜索、X 数据入口和多媒体产品线的参照。

实质变化
Grok 4.7 提供可调推理和 Agent 工具;语音、图像和视频使用专用 API。
边界
实时信息必须显式启用 Web/X Search。
上下文
500K
开放方式
闭源 API / 产品
08

Mistral AI

Mistral

Mistral Medium 3.5 · OCR 4

欧洲厂商、可部署权重、文档处理和企业应用的参照。

实质变化
Medium 3.5 面向多模态、Agent 与编码;OCR 4 单列文档结构能力。
边界
通用模型、开放权重和专用服务许可证各不相同。
上下文
依具体模型
开放方式
开放权重 + API

Watchlist

观察名单

Kimi、GLM、MiniMax 具有明显中文用户价值。首期先在具体任务比较中记录,不各自建立长期页面;只有当官方资料、更新频率和用户需求足以支撑维护时,才提升为长期跟踪对象。