Skills Plugins MCP Prompt Model 导航 博客 资讯 我的中心

智谱GLM-5.3-FlashX上线:最高 200 tokens/s

智谱今天端出了新模型 GLM-5.3-FlashX,官方标出的最高速度冲到了每秒200个 token,给企业开发者的体验按下了加速键。 这款提速型号的底子,是那款此前以"Ox Alpha"之名先和全球开发者见面的 GLM-5.3-Flash——它靠着同尺寸里最能打的智能水平,在海外内圈了一波口碑,调用量一路往上爬。需求涨得太快,智谱索性在10万张国产芯片撑起的推理算力之上,继续往 Infra 基建

正文

智谱今天端出了新模型 GLM-5.3-FlashX,官方标出的最高速度冲到了每秒200个 token,给企业开发者的体验按下了加速键。

这款提速型号的底子,是那款此前以"Ox Alpha"之名先和全球开发者见面的 GLM-5.3-Flash——它靠着同尺寸里最能打的智能水平,在海外内圈了一波口碑,调用量一路往上爬。需求涨得太快,智谱索性在10万张国产芯片撑起的推理算力之上,继续往 Infra 基建和推理优化里砸资源。于是 FlashX 不只是快,而是把智能、价格、速度这三张牌第一次同时攥在了手里。

目前 GLM-5.3-FlashX 的 API 已经上线,开发者调用时认准 Model Key:GLM-5.3-FlashX 即可。对苦于大模型"想得慢、等得久"的生产场景来说,每秒200token 这条线,意味着它能在不牺牲聪明程度的前提下,把响应延迟压到一个相当轻快的档位。

数据来源:公开 AI 资讯聚合目录,版权归原文作者及媒体所有;本站仅作索引与摘要展示,如有异议可联系我们删除。

每日精选 Skill 推荐,免费送到你邮箱

输入邮箱,每天接收一个精选 AI Agent 技能推荐。完全免费,持续更新。

提交后我们会发送一封确认邮件,点击邮件里的链接才会开始收信。

完全免费,取消任意时间。我们不会发送垃圾邮件。