Model Observatory
模型观察
不做一张把所有能力压成总分的榜单。这里记录八个长期对象的产品层次、实质变化、开放方式与限制;价格、地区和别名以官方实时页面为准。
资料核验:2026-10-07 · 厂商性能均视为官方报告,尚未替代本站私人测试。
Read the Table
先分清四件事
模型决定基础能力。
产品叠加搜索、文件、记忆与界面。
工具真正执行外部动作。
套餐与地区决定你实际上能不能使用。
Eight Families
八个长期跟踪对象
01
OpenAI
GPT
GPT-6 Astra · GPT-6.1 Sol · GPT-6 Luna通用模型、工具生态与 Agent 产品的主要参照。
- 实质变化
- 形成旗舰、平衡和低成本三层;Sol 强调编码、工具与计算机操作。
- 边界
- ChatGPT、Codex、API 和专用图像/语音模型属于不同产品层。
- 上下文
- 约 1.05M
- 开放方式
- 闭源 API / 产品
02
Anthropic
Claude
Fable 5.1 · Opus 5.5 · Sonnet 5.5 · Haiku 4.5长任务、编程、知识工作和模型安全的重要参照。
- 实质变化
- 前三者为 1M 上下文、128K 最大输出,形成多层能力与成本组合。
- 边界
- Claude 应用、Claude Code/Cowork 与 API 功能不能混写。
- 上下文
- 1M / Haiku 200K
- 开放方式
- 闭源 API / 产品
03
Gemini
Gemini 3.1 Pro · 3.8 Flash · 3.8 Live原生多模态、实时语音与 Google 生态的参照。
- 实质变化
- 通用、低延迟语音、扩展思考、TTS、图像和视频已分为明确产品线。
- 边界
- 稳定、预览和专用生成模型必须分开记录。
- 上下文
- 依具体模型
- 开放方式
- 闭源 API / 产品
04
DeepSeek
DeepSeek
DeepSeek V4.1 Flash · V4 Pro中文、开放权重、成本与 Agent 编程生态的参照。
- 实质变化
- V4.1 Flash 原生视觉,支持思考/非思考、工具调用与 Responses API。
- 边界
- 别名可能自动路由;厂商基准不等于本站实测。
- 上下文
- 1M
- 开放方式
- 开放权重 + API
05
Alibaba
Qwen
Qwen3.8 Max · Qwen3.8-27B · Qwen3.7 Plus/Flash中文、多模态、开放权重与云端/本地双路线的参照。
- 实质变化
- 3.8 Max 面向编程与协作;3.8-27B 提供开放权重。
- 边界
- 开放模型、托管模型和地区可用版本并不完全相同。
- 上下文
- 最高 1M(依版本)
- 开放方式
- 开放权重 + API
06
Meta
Muse / Llama
Muse Spark 1.1 · Llama 4 Scout/Maverick消费级产品模型与开放权重生态分化的观察对象。
- 实质变化
- Muse 强调多模态推理与工具;Llama 4 提供可下载的开放权重路线。
- 边界
- Muse 的开放度与 Llama 不同,不能统称为最新开源 Llama。
- 上下文
- Llama 4 Scout 标称 10M
- 开放方式
- 产品模型 + 开放权重
07
xAI
Grok
Grok 4.7 · Voice · Imagine实时搜索、X 数据入口和多媒体产品线的参照。
- 实质变化
- Grok 4.7 提供可调推理和 Agent 工具;语音、图像和视频使用专用 API。
- 边界
- 实时信息必须显式启用 Web/X Search。
- 上下文
- 500K
- 开放方式
- 闭源 API / 产品
08
Mistral AI
Mistral
Mistral Medium 3.5 · OCR 4欧洲厂商、可部署权重、文档处理和企业应用的参照。
- 实质变化
- Medium 3.5 面向多模态、Agent 与编码;OCR 4 单列文档结构能力。
- 边界
- 通用模型、开放权重和专用服务许可证各不相同。
- 上下文
- 依具体模型
- 开放方式
- 开放权重 + API
Watchlist
观察名单
Kimi、GLM、MiniMax 具有明显中文用户价值。首期先在具体任务比较中记录,不各自建立长期页面;只有当官方资料、更新频率和用户需求足以支撑维护时,才提升为长期跟踪对象。