KDZNR网

 找回密码
 立即注册
搜索
热搜: 活动 交友 discuz
查看: 15|回复: 0

近期AI模型盘点:承诺兑现了多少

[复制链接]
匿名
匿名  发表于 昨天 17:56 |阅读模式
上期各家 AI 实验室许诺了权重、接口和降价,本期必须交货。下面是真正发出来的东西,分门别类,附原始出处。



三十天里七笔承诺到期,五笔兑现

七笔承诺的兑现情况:

Kimi K3 开放权重|上期承诺、本期提前交付|Hugging Face 上放出 1.4 TB,比自己定的截止日还早|已兑现
FLUX 3 Video 开放访问|上期承诺、本期如期|正式可用,按秒计费|已兑现
Ling-3.0-flash 权重|上期承诺、本期兑现|MIT 协议;FP8 版可装进 128 GB|已兑现
Seedance 2.5 公开接口|上期测试版预告、本期开放|面向 BytePlus 与火山引擎开发者开放|已兑现
Qwen3.8-Max 权重|上期预告、本期兑现|2.4T 检查点,采用自定义协议|已兑现
GLM-5.3 权重|上期承诺|安全评审后暂缓,截至本期发稿仍无仓库|待兑现
Mistral 开放前沿家族|上期放风|仍在早期体验,无权重、无模型卡|待兑现

以上是上期盘点里我们记下的每一条开放承诺,以及本期发稿时的状态。每一行在正文里都链向一手出处,没有一条凭记忆引用。

本期有两家相隔重洋的实验室,在九天之内各发一款前沿模型,最后价格却一模一样:每百万输入 token 2 美元、每百万输出 token 6 美元。这个数字不是巧合,它是一个月贴身厮杀贴在价签上的结果。而这只占本期故事的一半,另一半是各家实验室在还账:上期宣布、放风或许诺的几乎所有东西,都得真的发出来。

这是第二期月度盘点,做法和第一期一样:下面每一个价格、规格都在本周对照过出处并就地链接,只有厂商自测的跑分会明确标注,最响的几件什么也没发生的事放在最后点名。在这期覆盖的三十天里,十一家厂商的十七个发布入选。其中三件会真正改变你的选择。

速读:三件值得在乎的发布

如果你按顶配买 token,Grok 4.6 把地板价重画了。xAI 这款新发布在独立综合测试中宣称达到前沿水平,却保留 Grok 4.5 的每百万输入 2 美元、输出 6 美元定价,成为价格最低、又敢自称前沿的模型。

如果你做微调或自托管,Qwen3.8-Max 改变了开放二字的含义。阿里这款 2.4 万亿参数旗舰发布九天之后做了一件此前 Max 级 Qwen 从没做过的事:把真正的检查点放出来供下载。

如果你跑的是干活档,Gemini 3.7 Flash 把你的账单砍了一半。Google 在 Gemini 3.6 Flash 之后 23 天就发出它,价格腰斩,编程分数涨了十六分。其余一切,都是在评论同一个结构性事实:上期的承诺——尤其是开放权重——大部分在本期变成了真能下载的文件,而价格在这个过程中继续往下掉。

本期发布一览,按时间顺序:

Kimi K3 权重|开放|2.8T 旗舰放出 1.4 TB,提前于承诺
DeepSeek-V4-Flash-0731|开放|284B 总参、13B 激活的智能体再训练版,首发即 MIT 权重
Seedance 2.5|视频|正式发布;公开开发者接口随后开放
Qwen3.8-Max|文本|2.4T MoE,每百万 token 2/6 美元,1M 上下文;月中放出权重
FLUX 3 Video|视频|正式可用:20 秒片段带原生声音,每秒 0.06 美元起
Qwen-Image-3.0|图像|上期邀约定制本期公开,每张图 0.03 美元起
Ling-3.0-flash|开放|MIT 协议;BF16 255 GB,FP8 128 GB
Muse Spark 1.2 加 Muse Code|文本|1M 上下文、仓库级训练,外加智能体框架测试版
GPT Transcribe|音频|转写每分钟 0.0045 美元,比 whisper-1 低 25%
Think Fast 2.0 live|音频|上期语音对语音预告上线,每分钟 0.08 美元
GPT-5.6 Luna 免费默认|文本|免费版 ChatGPT 换底;一周后免费用户 unlimited 文本对话
Grok Imagine Image 2.0|图像|双榜图像世界第二;仅应用内,接口待定
Grok 4.6|文本|宣称追平前沿,2/6 美元,与 Grok 4.5 持平
Seed 2.1 Turbo|文本|多模态编程加智能体模型,0.5/2.5 美元,262K 上下文
Gemini 3.7 Flash|文本|比它 23 天前的前辈便宜一半,编程大涨
GLM-5.3|文本|智能体能力大涨;承诺的权重仍在安全评审中
GLM-5.3-Flash|开放|320B/18B 多模态 MoE,首发即 MIT 权重,0.15/0.5 美元

开放标记的是发布当天就能下载权重的产品。



文本:输入 2 美元、输出 6 美元,成了前沿新价

Grok 4.6 是这股趋势最干净的表达。输入 2、输出 6 美元的费率和 Grok 4.5 一样,500K 上下文窗口也一样,但 xAI 称它在 Artificial Analysis 智能指数上已追平 GPT-5.6 Sol,落后 Claude Fable 5 一分,DeepSWE 编程分从 54 涨到 65.9。两条诚实的脚注:所谓追平,是拿 Grok 的默认档位对标对手的最高档位;而小字条款重新给一切定了价。提示词超过 200K token 之后,请求里每个 token 都按翻倍的 4/12 美元计费,缓存输入价悄悄涨了 67%。读费率卡,别读标题。

Qwen3.8-Max 从另一个方向选中了同一个价签:2/6 美元,换来一个 2.4 万亿参数的 MoE、1M token 上下文、能吃文字图像视频输入。阿里自己的表显示它在智能体电脑操作上领先,编程成绩则好坏参半;发布时还没有独立跑分,所以这张表应该按它应得的方式去读——厂商自测表。更大的新闻九天后才到:这款旗舰现在可以下载了。

Google 只用价格回应。Gemini 3.7 Flash 发布价 0.75/3.75 美元,是 Gemini 3.6 Flash 首发价的一半,DeepSWE 从 49.0% 涨到 65.3%。坑在于日历:这个价是优惠 introductory 价,约四个月后翻倍到 1.5/7.5 美元,所以任何按首发价搭出来的成本模型,保质期只有四个月。菜单更下面,字节的 Seed 2.1 Turbo 以 0.5/2.5 美元提供一个多模态编程加智能体模型,262K 上下文;Meta 的 Muse Spark 1.2 加上了 1M token 窗口和仓库级训练。

OpenAI 本期把力气花在分发而不是前沿宣称上:GPT-5.6 Luna 在这周成为免费档默认模型,一周后免费用户 unlimited 文本对话(仅文本,上传和图片仍有上限)。预算党记一个截止日:Anthropic 对 Claude Sonnet 5 的促销价 2/10 美元即将结束,恢复为 3/15 美元。如果你的流水线已经按那个价标准化,下周账单就会动。

本期文本模型每百万输出 token 要多少钱(首发厂商挂牌价,灰色柱是更早发布用于对照,柱长按对数刻度):

Claude Fable 5(更早,对照)|50 美元
Claude Opus 5(更早,对照)|25 美元
Kimi K3(更早,对照)|15 美元
Grok 4.6|6 美元
Qwen3.8-Max|6 美元
Gemini 3.7 Flash|3.75 美元
Seed 2.1 Turbo|2.50 美元
GLM-5.3-Flash|0.50 美元
DeepSeek-V4-Flash|0.28 美元

两家相隔重洋的实验室,在自称前沿的模型上落到同一个 6 美元价签;与此同时一个 320B 开放模型首发只要 0.5 美元。而不久之前,旗舰价还是 50 美元。

图像:最好的新工具偏偏不开放接口

本期最强的新图像工具,没法用代码调用。Grok Imagine Image 2.0 作为 Grok 应用和网站里的质量模式发出,支持区域级编辑、抠背景、最多五张参考图生成,排版明显更好。它在文生图和图像编辑两个 Arena 榜上首发就排到世界第二,仅次于 OpenAI 自家图像模型。接口在计划中。开发者只能眼睁睁看着消费者用一个自己还没法出货的模型。

阿里通过发布回答了上期悬着的一个问题。Qwen-Image-3.0 从邀约定制变成公开端点,每张图 0.03 美元,2K 分辨率的 Pro 档 0.075 美元,瞄准 12 种语言下密集、文字多的排版。它发出时仍然没有跑分、没有模型卡,所以诚实的标签还是便宜但未经验证。生产环境出图的人记一笔:Google 关停了 Imagen 4 端点,转向 Gemini 品牌的图像模型——又一次提醒,图像接口退役的速度比建在它上面的产品还快。

视频:30 秒片段终于有了公开价签

上期的视频新闻都锁在企业门后面,本期把门打开了。字节的 Seedance 2.5 正式发布,公开开发者接口也随之开放:一次生成最长 30 秒、音画同步;最多用 30 张参考图加视频和音频参考来引导生成;对已有片段做到时间戳级编辑。验证过的输出封顶 1080p,所以上期谈的 4K 当作路线图看就好。我们做过上一代的正面对比(含第一条直出),2.5 的公开接口让任何人都能做这种测试。

Black Forest Labs 按期兑现了上期承诺。FLUX 3 Video 正式可用:最长 20 秒片段,对白、音效、环境音一起生成,草稿每秒 0.06 美元,HD 0.17 美元,全 HD 0.29 美元。一段 20 秒草稿 1.2 美元,这让 AI 视频从预算项变成了故事板阶段的零头。BFL 自己的 Arena 数字称它在文生视频上领先 Seedance 2.0 六十六个 Elo;那是内部评测,而它上期放风的开放权重 Dev 版仍然没有日期。

音频:OpenAI 自己砍了 Whisper

本期的音频故事,是一家公司在跟自己竞争。GPT Transcribe 把语音转文字定价每分钟 0.0045 美元,约合每小时 0.27 美元,比 whisper-1 一直以来的每分钟 0.006 美元低 25%,还带上了 whisper 从没有过的关键词提示和多语言提示。转写本来就便宜,现在便宜到连转写行业自己都觉得过分;有意思的效应在下游——当每段录音默认都带一份文字稿之后,人们会拿它去索引、搜索、总结什么。

另一条音频条目了了上期的一桩悬案。Grok Voice 的 Think Fast 2.0 上期宣布时我们因为太新没下判断,本期已对全部 Grok Voice 流量开启:语音对语音每分钟 0.08 美元,首音频延迟 0.7 秒。一边是一毛钱一小时的转写,一边是亚秒级语音智能体,整条语音回路越来越便宜;从上期到本期没变的一点是,最好的那部分仍然只有云端。

开放权重:上期的欠条基本都还了

我们上期盘点结尾的开放权重部分警告过:一个模型开放不开放,看下载链接能不能用,而不是看新闻稿怎么说。本期就是这句话的考场,结果比我们预期的好。Moonshot 第一个还:Kimi K3 权重落在 Hugging Face,比它自己定的十天截止日还早,也比我们上期盘点发稿早三天——上期那篇还把这条记在待兑现里。在此更正:2.8 万亿参数,104B 激活,1M token 上下文,约 1.4 TB 文件,采用 Moonshot 自家的 Kimi K3 License。这是有史以来最大的一次开放权重发布。

然后欠条一张张清。DeepSeek-V4-Flash-0731 首发即 MIT,284B 总参、13B 激活,磁盘上 166.9 GB,是一次面向智能体的再训练,在它自家公布的全部九项智能体基准上超过 DeepSeek 更大的 V4-Pro 预览版,托管接口 0.14/0.28 美元。蚂蚁集团如期交出 Ling-3.0-flash,MIT 协议,FP8 版 128 GB。阿里做了那件没人太敢信的事:完整的 Qwen3.8-Max 检查点上线,FP8 约 2.5 TB,采用带收入门槛条件的自定义协议,而不是 Apache。就算带着种种限制,一个可下载的 2.4T 前沿旗舰,一个月前还不存在。

反例也有教益。Z.ai 推出 GLM-5.3,自家基准上的智能体数字亮眼,Terminal-Bench 从前代的 4.6 涨到 28.3,并承诺权重在安全评审后分阶段放出。本期发稿时仍无仓库。它给出的理由值得认真对待而不是冷嘲:Z.ai 称模型在网络安全评测中表现出多阶段漏洞利用规划能力,而把一个一旦放出就收不回的检查点先卡住,正是安全评审存在的意义。但记分牌就是记分牌:上期七笔承诺清了五笔,剩下两笔——GLM-5.3 和 Mistral 放风的开放家族——都要算在它们真正发布的那个月头上。

就在本期截稿前一天,Z.ai 让自己的反例变复杂了。GLM-5.3-Flash 是一个 320B 参数、18B 激活的 MoE,原生多模态吃文字、图像、视频输入,1M token 上下文,发布当天权重就以干净的 MIT 协议上了 Hugging Face,FP8 约 306 GiB。它在 Artificial Analysis 智能指数上拿 57 分,比 Gemini 3.7 Flash 高一分,接口价 0.15/0.5 美元。这款模型发布头一周一直匿名以 Ox Alpha 名义对外服务,据 Z.ai 称完全跑在国产芯片上。发布一天的数字值得被审视一个月之后再动你的默认选择,但按这些数字,它是本期每美元最强的开放发布,也让带门槛的 GLM-5.3 看起来像 Z.ai 产品目录里的例外而非常态。

本地能跑的:真正的礼物是 17 GB

TB 级检查点关乎托管商和大学,不关乎你桌上这台机器,所以下面是诚实排序。大多数读者真正跑得起的一个发布是 Qwen3.8-27B:稠密模型,Apache 2.0,4-bit 量化后约 17 GB,在 Artificial Analysis 智能指数上拿 52 分,前代是 38 分。这个下载能塞进一块 24 GB 显卡或一台 32 GB 的 Mac,装的当天就取代旧 27B 成为本地 Qwen 默认。

硬件往上一档,DeepSeek-V4-Flash-0731 的 167 GB 和 Ling-3.0-flash 的 128 GB FP8 版,都能装进 192 GB 统一内存的 Mac 或双显卡工作站,激活参数低让生成速度还算舒服;我们的 DeepSeek 本地指南覆盖了这个家族小得多的量化版。GLM-5.3-Flash 的 306 GiB FP8 检查点暂时还在工作站够不着的地方,要等更小的量化版;Kimi K3 和 Qwen3.8-Max 仍是多节点工程。你自己这台机器装得下什么的算术没变,内存与显存指南仍然用一次减法算清楚。

我们故意没写的

砍掉了什么,为什么。GLM-5.2 Turbo:上一代模型的速度刷新,发布三天就被自己的继任者盖过;如果你在选 Z.ai 模型,决策直接看 GLM-5.3 或它的开放 Flash 兄弟。OpenAI 的数学成果:十个带机器可验证证明的开放问题被解出,是真正的研究新闻,但它不是模型、不是产品、也不是价格。Wan 3.0:整月传着要发,没有厂商帖子、没有仓库、没有市场上架,按本盘点规则它还不存在。Mistral 开放家族:仍在早期体验,无权重无模型卡,和上期一样。下载链接能用之前,我们会一直写这句话。

这是第二期。下一期照旧做法:一手出处、发布当日价格、一份跳过清单。两条信息值得记着:欧盟对通用 AI 义务的执法已经开始适用,正在影响这些模型在哪儿、什么时候发布;Gemini 3.7 Flash 的半价窗口即将关闭。两期之间,那张可排序的模型对比表保持更新。如果本期有哪个发布改变了你默认伸手去拿的那个模型,它配得上标题。对大多数人来说,正好有三个。
回复

使用道具 举报

您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

Archiver|手机版|小黑屋|KDZNR网

GMT+8, 2026-9-26 22:26 , Processed in 0.052842 second(s), 20 queries .

Powered by Discuz! X3.4

© 2001-2023 Discuz! Team.

快速回复 返回顶部 返回列表