先前通过手动方式关闭自动续费服务的客户,公司将会分批次重新启用续费功能,同时老用户升级套餐等操作也将逐步解锁;至于全新套餐,现阶段因算力资源存在限制尚不能购买,具体恢复购买的时间尚未明确公布。

根据公司官方发布的信息,这次系统调整更像是出于有限算力资源考虑,对新增用户和现有用户体验进行重新分配,并非要对会员体系进行改动。

K3发布消息传出后,国内外开发者社群迅速出现大量体验分享和评测文章,不少人将其与Claude、GPT等国际知名模型进行比较,关于推理成本、GPU资源占用、服务稳定性等方面的讨论,开始取代传统的基准测试,成为人工智能领域新的关注焦点。

K3究竟有多受关注?

K3问世后,很快成为全球人工智能模型讨论的热点话题。

独立人工智能模型评测组织Artificial Analysis最新公布的“智能指数(Intelligence Index)”显示,Kimi K3的综合评分是57分,在全球范围内排名第三,排在Claude Fable 5(60分)和GPT-5.6 Sol(59分)之后,并且领先Claude Opus 4.8(56分)。

在此同时,K3完成每项任务的平均费用大约是0.94美元,几乎与GPT-5.6 Sol持平,仅是Claude Opus 4.8的一半多一点。

对业内的研究者来说,更为关键的是,这是首个进入Artificial Analysis综合排名前三的开源模型。长期以来,"开源模型整体落后于闭源模型半个版本"几乎成了行业内的普遍看法,而K3的面世,让这种差距进一步缩小。

文章配图-1

除了评分表现外,K3自身的参数大小同样引起业内的重视。K3是月之暗面开发的首款万亿级参数的MoE(Mixture of Experts)模型,其总参数量达到了2.8万亿。

一位国产人工智能芯片行业的工作者向界面新闻报道,今年到目前为止,随着Anthropic等海外企业陆续发布更大参数的模型,国内模型的竞争再次集中在“大参数、长上下文”这个方向上,万亿级参数、百万元级的上下文长度已经成为了头部模型的重要竞争指标。

在他看来,K3之所以能快速走红,不仅是因为模型的能力表现,更因为它标志着国产开源模型首次达到这一参数量级。“对于整个行业来说,2.8T本身就具有里程碑式的意义。”

行业内的关注迅速传递到了开发者社群中。

在X(Twitter)、Reddit、OpenRouter、Linux.do、V2EX等平台上,众多开发者第一时间分享了使用体验,不少人将K3集成到Cursor、Cline、OpenCode等人工智能编程工具中进行实际测试。从代码生成、Agent任务执行到工具使用,K3几乎成为最近几天人工智能领域讨论最热烈的模型。

讨论主要集中在三个方面:第一,它能否真正替换Claude用于编程任务?第二,它的水平是否已经达到国际顶尖水平?第三,迁移使用它的价值究竟如何?

不少开发人员觉得,K3最突出的部分并非对话能力,而是在长流程Agent任务和代码生成方面。一些体验者表示,在处理复杂代码修改、工具操作等任务时,K3已经能够和Claude、GPT等国际领先模型一较高下。

但也有反馈指出,在真实工程环境下,尽管该模型表现优异,但仍会漏掉部分细节需要人工调整;此外,在复杂统计推理等任务上,它的表现还存在不稳定的情况。

另一类讨论则集中在成本问题上。有用户觉得,尽管K3的单价相当有优势,但由于复杂任务的Token消耗比较多,实际使用成本未必像预期的那样低,特别是在长流程Agent任务中,这种成本问题更为明显。

K3的热度也迅速传播到了海外的人工智能圈。

美国科技投资公司Atreides Management的创办人Gavin Baker将K3称为人工智能发展过程中的一个“转折点(inflection point)”,他认为高质量的开源模型正在推动人工智能技术的普及,其影响将不仅仅局限于模型生产商,还会惠及整个人工智能应用生态。

也有研究者持保留态度。

长期研究人工智能对工作影响问题的宾夕法尼亚大学沃顿商学院教授Ethan Mollick在X上表示,他曾经让Kimi K3对其一项之前完成的学术研究进行复杂统计审查,但模型在很多方面出现了失误,其中包括错误使用统计分析方法。

Mollick认为,K3已经非常接近全球顶尖水平,但在复杂专业任务中的稳定性和可靠性,仍需要更多实际场景的验证,不能仅仅依靠基准测试的成绩来判断。

这一观点也反映了当前人工智能社群对新模型的普遍看法:一方面,K3在代码生成、Agent等应用场景的表现赢得了众多开发者的认可;另一方面,该模型在复杂专业任务中的稳定性和可靠性,还需要更多真实环境的持续验证,而不能单凭榜单成绩下结论。

算力资源依然紧张

也正是在开发者大量涌入、请求数量持续增加的背景下,月之暗面很快又面临了一个新挑战——算力不足。

过去几年间,人工智能行业更常见的说法是“训练一个模型需要多少GPU”、“参数规模达到了多少”,而不是因为用户过多而不得不暂停开放订阅服务。

事实上,模型训练完成并不代表算力投入就结束了,特别是在人工智能编程、Agent等功能快速发展的当下,模型需要不断调用外部工具、读取上下文信息、执行多轮推理,一个请求占用GPU资源的时间远比传统聊天场景要长得多。模型的性能越强、上下文信息越长、用户请求越频繁,对推理算力的需求就越高。

“目前最大的瓶颈还是算力,特别是高质量的推理算力。”上海国投孚腾资本的投资总监陈雨沁在之前接受界面新闻报道时谈道,即便是头部模型企业,也已经开始取消无限制的使用政策、提高服务费用,这本质上都反映出推理资源依然非常紧张。“如果基础建设方面的问题没有得到解决,很多应用公司其实是不敢真正大规模推广产品的。”

“从供需关系来看,国内人工智能算力长期处于供应不足的状态,而随着头部模型的集中发布,这种情况会进一步加剧。”上述芯片制造商的工作人员向界面新闻表示。

他介绍,目前像月之暗面、智谱、MiniMax等独立模型企业,获取算力主要有两种途径:一是租用公有云服务商提供的算力服务,二是建立自有的算力集群。但前者资源有限,后者属于重资产投入,需要较长的建设周期,所以模型企业的算力供应始终存在一定压力。

“业内普遍觉得,要支撑万亿参数模型的训练和推理,万卡级的集群已经成为基本门槛。”他表示,从2024年开始至今,真正具备万卡级部署能力的厂商仍然不多,很多已经宣布建设的大规模集群项目,实际落地周期往往以年为单位计算,因此供需之间仍然存在长期的缺口。

今年在WAIC期间,一个细节让这位国产芯片行业的从业者印象深刻。

他告诉界面新闻,在展示超节点产品的时候,被问得最多的两个问题就是:“能不能支持万卡集群?”“能不能支持万亿参数模型训练?”

与过去围绕单卡性能、芯片参数展开讨论的情形相比,现在技术链条更加关注的是超大规模集群能力,以及支撑头部模型持续训练、推理的基础设施建设。

这一变化,也显现出了大模型竞争逻辑的演变。

过去,模型公司比拼的是参数大小、训练能力以及基准测试的成绩;现在,随着越来越多模型进入实际生产环境中,推理效率、服务稳定性、成本控制能力以及基础建设水平,开始成为新的竞争层次。

K3暂停开放新用户注册,或许只是一次短期的资源调配行为,却让外界第一次如此清晰地看到,大模型竞争已经进入了新的阶段。模型能力决定产品能否吸引消费者,而推理算力、基础建设布局以及持续服务水平,则决定它能否真正实现大规模应用落地。