9月1日,科大讯飞全资子公司词元星火正式推出并开源星火X2.5-4B和星火X2.5-1.7B两款端侧通用大模型。这是端侧模型中首个原生支持最长100万Token上下文的模型,把百万级信息处理能力带到了本地设备。

两款端侧模型的开源,恰恰选在9月7日旗舰大模型星火X2.5(293B)正式发布之前。一大一小,云端和终端同时布局,这个时间窗口的选择,意图清晰。
100万Token塞进4B,不是做减法,是重新设计
端侧模型的竞争逻辑,过去几年基本被“参数规模”锁定。面壁智能的MiniCPM系列在2B以下组别做到同尺寸领先,谷歌Gemma 4的E2B版本内存占用压至1.5GB以下,各家都在参数上做文章,谁的参数大、谁的压缩率高,谁就领先。
但端侧设备的核心约束不只是参数,还有内存和算力。参数堆得再高,装不进手机、跑不动车载芯片,就没有意义。
星火X2.5走了一条不同的路。4B和1.7B两个“小个子”,原生支持100万Token上下文窗口,使用覆盖长篇文档、技术资料等场景的千亿Token级高质量数据训练。两款模型采用混合注意力架构,围绕智能体、代码、数学和指令遵循等核心能力优化。综合实测,相关能力领先业界同尺寸一流开源模型。
不是在大模型上做减法,是在端侧重新设计架构。100万Token塞进4B,靠的是重构。

从实际场景看,百万级上下文解决的不是“塞下更多字”的问题。以产品售后为例,用户将完整的产品售后手册导入星火X2.5-4B后,模型可以梳理不同场景下的售后规则并标注对应章节。当用户进一步询问“购买10天后设备故障,且使用过第三方耗材,是否符合换货要求”时,模型能够关联退换货、故障处理和例外条件等跨章节规定,给出综合判断。面对偏远地区、设备存有家庭地图等新增条件,模型还能保持前文情境,结合物流、数据清除、费用承担和处理时限等规则持续提供建议。
过去端侧模型处理长内容,常常要把文档切成几段分别问,容易忘记前情、遗漏信息。星火X2.5让“切文档”这件事变得不再必要。
能干活的端侧模型,才是真端侧
长上下文解决的是“信息能不能看全”。智能体和工具调用能力解决的,是“看完之后能不能动手”。
这才是端侧模型真正的分水岭。
在个人办公场景中,星火X2.5端侧模型可覆盖数据处理、文档生成和文档翻译等环节。以实际案例来说,用户上传销售明细表并提出销售分析和中英文部门业绩报告的交付需求后,星火X2.5-4B首先编写脚本完成数据汇总、关键指标提取和趋势分析,随后生成约3000字的中文部门业绩报告,并沿用原有结构和格式生成英文版报告,最后完成内容、结构和排版校验。从原始数据分析到双语报告交付,全部在本地完成。
在代码开发场景中,星火X2.5-4B在算法实现、代码补全与生成等任务中,可对标参数规模大2至3倍的云端模型。代码编写、脚本生成和调试辅助工作不出本地直接完成,模型还具备低延迟、离线使用和代码资产本地化管理等优势。
智能硬件场景的测试数据更具说服力。在Domux智能家居测试集上,星火X2.5-1.7B控制指令端到端执行正确率达到90.3%,平均响应时间仅为0.85秒。兼顾准确度与速度——这正是端侧模型在真实场景中的价值所在。

两款模型同样适用于机器人等需要持续感知和连续执行的场景,可部署在机器人本体或边缘设备中,支持操作控制、目标追踪、导航决策等任务,减少对云端连接和固定预设程序的依赖。
从“能对话”到“能干活”——端侧AI迈过了最关键的一道坎。
写在最后:
星火X2.5-4B和1.7B基于全国产算力平台完成全流程训练,使用约20万亿Token多样化数据进行预训练。部署层面支持英伟达、华为、海光及后摩等硬件平台,兼容vLLM、SGLang、llama.cpp等主流推理框架。模型权重已在Hugging Face、GitHub等平台开放,API已上线讯飞星辰MaaS平台,限时免费。
全国产算力训练解决“能不能自己做”的问题,多平台部署解决“能不能随便用”的问题。两条腿走路,给端侧AI画了一条开放的路。
行业还在堆参数的时候,讯飞选择了一条更务实的路径,让4B的模型能干大模型的活。端侧AI的竞争逻辑正在被重新书写。
9月7日,科大讯飞还将正式发布全新一代旗舰通用大模型星火X2.5,进一步升级代码和智能体等核心能力。端侧打底,云端冲锋,这套组合拳能走多远,很快就能看到答案。