大模型更新太快!我做了一个持续更新AI动态的小程序
这是学习笔记的第 2534篇文章

大模型发展风风火火,有时候让我有些迷茫,因为感觉隔几天就会发布一款大模型,基本上都是按月做大版本迭代的了,动不动就颠覆这个行业,那个岗位,颠覆了快1年多了,让人甚至有些麻木了。加上中美大模型的差距在明显缩小,使用模型的人也是收益者,毕竟模型强了,使用成本低了,至少对个人来说手里有了家伙事儿,能干很多事情了,原来很多做不了的事情现在一个人都能干了。至于对于行业的颠覆,也不是个体行为,至少得跟上时代的步伐。
为了缓解我的疑问和这种模型焦虑,我做了下数据分析,也把分析结果做成了可持续更新迭代的小程序,放到了开源洞察助手里面。

这是我盘点的大模型按照时间线发布的频率,一个点就是一个大模型版本产品。纵轴是综合评分,也就意味着大模型的综合能力更强。

AA 综合评分指第三方测评机构 Artificial Analysis 发布的 Intelligence Index(综合智能指数),汇总多项测试来衡量模型的整体能力。官方介绍与排行榜
当前系统引用 v4.3.2,包含 10 项评测,按四类能力加权:
|
|
|
|---|---|
|
|
|
|
|
|
|
|
|
|
|
|
具体测试集、权重和测试设置可看官方评分方法。该指数主要评测英语文本能力,语音、图像和多语言能力另行评测。
之前K3发布的时候,还不是很理解为什么是一个重大的变更,看了这张图算是比较清晰了。
K3直接从不到30分大幅度提升到了45分左右,已经超越了Opus 4.8的水平,另外这是开源模型持平赶超闭源模型的一个里程碑,从后续的闭源版本迭代情况来看,尽管发布迭代了很多,K3还是在这个阵营之内。

目前看Claude版本已经进入了一种很微妙的状态,Opus 5.5一骑绝尘,现在的重心竟然是把sonnet 5.5提升到了和Opus 5.5接近的程度,token消耗能够大大降低,和haiku的差距也迅速缩小,haiku按照指标已经和Opus 4.8接近了,从我的理解来看,claude要么最近开始聚焦一些多模态的能力,要么就得再出更强的模型能力,目前偏多模态的可能性比较大一些。
后续的GLM 5.3也持平到了和K3相似的层级。
值得一提的是,拉胯的google和meta的新模型能力已经赶上来了,还有小米的模型也出现在了靠前的位置。
四、看模型成本
接下来是重头戏,就是看成本,Opus虽然好,但是太贵,我个人比较喜欢Opus 4.8和sonnet 5, 因为大部分的需求,我觉得这两个模型的能力就完全可以交付了,所以分别以这两个模型作为基线看看对应的模型成本情况,看看在保持Opus 4.8能力的基础上,还有哪些模型的成本更低更合适。
模型成本统计维度也比较多,我按照百万token为基线来盘点成本。
以sonnet 5为基线,GPT的Luna-6真是神器,综合成本比deepseek-v4.1还要便宜,但是能力可以,如果有claude账号,haiku5.5也是很不错的选择。

以Opus 4.8为基线,GLM 5.3-flash的性价比很高,小米的MiMo-v2.6-pro也不错,至少从成本上来看,K3虽好,但是价格还是有些高。

以上的分析内容,大部分在小程序里面都可以看到。
可以查看近期最新发布的模型进展

因为模型比较多,支持全屏查看,也支持模型版本时间线等功能。

各大平台都可以找到我
-
微信公众号:杨建荣的学习笔记 -
个人网站:www.jeanron100.com -
Github:@jeanron100 -
CSDN:@jeanron100 -
知乎:@jeanron100 -
头条号:@杨建荣的学习笔记 -
网易号:@杨建荣的数据库笔记 -
腾讯云+社区:@杨建荣的学习笔记
热文:
个人视频号:

