宏观大盘行业板块个股策略
资讯池

DeepSeek和智谱接连更新模型 但都没能炸场

日期: 2026-08-15 11:05来源: 界面新闻域名: finance.eastmoney.com
溯源
重要性:背景级 · 50·对象槽:unmatched·对象关系:sector_transmission·影响对象:sector:AI·来源/栏目:东方财富·抓取时间:2026-08-15 11:06:02·信任分层:优先源

没有一家模型厂商最近能够放松警惕。前后大概不到48小时,DeepSeek和 智谱 相继更新了自己的模型进展。

先是DeepSeek于8月12日晚将API文档更新为DeepSeek-V4-Pro正式版,又于13日对官宣内容进行了回撤和重新发布,但调整期间保留API服务;再是8月14日, 智谱 GLM-5.3正式发布。

抛开DeepSeek回撤和重新发布不谈,其API文档更新为DeepSeek-V4-Pro正式版, 智谱 GLM-5.3正式发布。

在Agent相关评测集中,其总体成绩与Kimi K3、Opus 4.8和Fable 5在同一水平线上。

智谱GLM-5.3则继续强调编程能力。该模型与前代GLM-5.2使用完全相同的基座模型,主要通过后训练提升性能,利用强化学习(基于IndexShare、SAO以及新一代Slime框架)扩展了长程任务环境和训练时长。

从评测集表现来看,GLM-5.3的部分能力接近Fable 5和GPT-5.6 Sol,并在展示出来的多个榜单中成绩超过了Kimi K3,但在聚焦长程软件工程与持续代码修改能力的DeepSWE v1.1上仍然不及K3。

安全是GLM-5.3强调的另一个特性,此前Anthropic的Mythos 5曾引起模型安全性能的话题热度。

据其介绍,在CyberGym测试中,模型从白盒源代码出发,通过触发程序故障来识别和验证漏洞,GLM-5.3得分为84.5%,略高于Mythos 5的83.8%和GPT-5.6 Sol的83.6%;在更考验深度推理能力的ExploitBench中,GLM-5.3得分为54.4%,低于Mythos 5的78.0%和GPT-5.6 Sol的76.5%。

在用户层面,或是由于DeepSeek-V4-Pro正式版受到初期问题的影响,多名完成测试的受访者对界面新闻记者表示,在编程任务上,GLM-5.3的体验比DeepSeek-V4-Pro正式版更好。

不过,其中一名开发者明确表示,这两者可能都不会作为工作流主力,“国产模型里面,目前还是只有K3在第一梯队。”他说,这不仅体现在能力提升全面上,在性价比层面也有意义。

这个结论的一个重要背景是DeepSeek对其API定价策略进行了调整。

其API将首次采用峰谷定价模式,其中闲时段的使用价格将降至高峰时段的一半。但从DeepSeek V4 Pro高峰期价格来看,其缓存命中输入和缓存未命中输入单价分别同比增长1100%及200%,输出价格同比增长350%。

细致到K3与DeepSeek-V4-Pro正式版之间,涨价前,前者缓存命中输入价格为后者约一千倍,目前则是十倍左右,缓存未命中输入价格则从6倍有余减少到约2倍(高峰期),输出价格也从过去的16倍左右降低到现在的约4倍。

曾经一度悬殊的性价比表现,如今再将任务的对话轮次、完成质量、整体时长考虑其中,不同诉求的开发者再作抉择时答案可能会发生变化。

事实上,无论是DeepSeek-V4-Pro正式版还是GLM-5.3,都是在上一代基座模型基础上进行后训练迭代,Kimi K3实现性能突破则源于对基座模型再度扩大规模训练。这两种选择说明了什么问题?

一名AI领域投资人表示,从模型技术层面来说,这至少说明两点,预训练Scale Up仍然有用、现有规模后训练也有极大提升空间——在这一点上,更好的证据是1.5T的Grok 4.6,几乎达到了GPT-5.6、Opus 5的同等水平。

对国产模型厂商而言,这意味着代际层面的性能跨越,或许仍然绕不开基座模型的Scale Up,而与此同时,在它们实现这一点之前,Kimi K3的潜能显然也还没有充分挖掘

打开原文 ↗