太长不看
| 你的情况 | 建议 | 原因 |
|---|---|---|
| 想在云端调用、写代码或跑 Agent 工作流 | 走旗舰版 293B 的 API | 256K 上下文、原生兼容 Anthropic / Responses 两种协议,改个 base_url 就能接进现有工具 |
| 数据不能出内网,或者想离线用 | 部署 Spark-X2.5-4B | Apache-2.0 可商用,q4 量化后约 2.6GB,6~8GB 显存甚至纯 CPU 都能跑 |
| 只是想做长文档摘要、翻译、简单问答 | 先试 1.7B 端侧版 | BF16 权重 3GB 出头,四比特量化后减半,手机上都能跑 |
| 英文长文深度阅读、海外 SaaS 调试、多模型交叉验证 | 星火不够用 | 见第七节,这类任务仍然得海外模型兜底 |
| 预算极紧、只想先跑通 | 端侧模型的 MaaS API 目前限时免费 | 先用免费额度验证效果,再决定要不要上付费旗舰 |
先说结论:这次发布最值得关注的不是那 293B 的旗舰参数,而是”旗舰 + 端侧 + 双协议兼容”这三件事被拼到了一条线上。 一个模型家族同时覆盖云端调用和离线部署,还愿意适配别家工具的协议,这在国产模型里不算常态。
一、九月上旬到底发了什么
节奏很密,三天一件事:
- 9 月 1 日:子公司词元星火在 Hugging Face 开源 Spark-X2.5-4B 与 Spark-X2.5-1.7B 两款端侧模型
- 9 月 7 日:旗舰版星火 X2.5(293B-A30B)发布,上线讯飞开放平台与星辰 MaaS
- 9 月 8 日:官方稿件正式宣布旗舰版上线,同步给出限时五折价格
按官方口径,两款端侧模型原生支持最长 100 万 Token 上下文,是端侧模型里少数做到这个量级的产品;4B 版本在开源后不久冲上 Hugging Face 趋势榜第一,这个信号比任何跑分都直观——社区真的把它拉下来跑了。
旗舰版这边,核心是四个数字:总参数 2930 亿、每次推理激活 300 亿、上下文 256K、覆盖 200 余种语言。官方强调的升级点是代码生成和智能体(工具调用)能力,而不是闲聊质量。
另一个容易被忽略的细节:全流程训练与推理都跑在国产算力集群上。 对政企、涉密场景来说,这是选型的硬门槛,比多几分跑分重要得多。
二、价格:五折是不是真的便宜
先看官方公布的旗舰版定价(限时五折期间的价目):
| 计费项 | 折后价(元 / 百万 Token) | 原价 |
|---|---|---|
| 输入 | 1.6 | 3.2 |
| 输入(缓存命中) | 0.24 | 0.48 |
| 输出 | 6 | 12 |
怎么看这个价目表,有三点值得说:
第一,缓存命中的差价很大。 输入 1.6 元、缓存命中 0.24 元,差了将近 7 倍。这意味着”把固定的系统提示词和长文档放在前面、让后面反复命中缓存”这种用法,成本会明显低于你的直觉估算。做 Agent 的人尤其要注意这一点——长系统提示词是刚需,缓存策略直接决定账单。
第二,输出才是大头。 输出价格是输入的近 4 倍。所以”让模型先长篇解释再给答案”的提示词写法很贵,直接要结构化输出更划算。
第三,五折是限时。 别按折后价做长期预算模型。订阅制产品的定价窗口期都不长,按原价估、按折后价用,是更稳的财务习惯。
三、API 怎么接:两种原生协议是关键
这次最实用的设计是原生支持 Anthropic 与 Responses 两种协议。官方明确提到可以快速接入 Claude Code、Codex、OpenClaw 等第三方 Harness 框架,这意味着你不需要为它专门写一层适配代码。
原理很简单:这些工具都允许把请求地址指向自定义的兼容端点。以 Claude Code 一类工具为例,通常设置两个环境变量就能切换:
1 | export ANTHROPIC_BASE_URL="<讯飞控制台提供的兼容端点>" |
端点地址和模型名以讯飞开放平台的控制台文档为准,各家兼容层命名可能随版本调整,接入前先确认一次,别照抄第三方博客里的旧地址。
如果你要自己写调用代码,走标准 HTTP 请求即可:
1 | curl -X POST "$BASE_URL/chat/completions" \ |
⚠️ 三个实操提醒:
- 不要把 API Key 写进代码再提交到 Git。 用环境变量或密钥管理服务,这是最低要求。
- 先跑通一条最短链路——一次简单请求返回正常,再去接 Harness。跳过这步的代价通常是花两小时排查工具配置,结果发现是 Key 没配好。
- 留意协议兼容的边界。 兼容协议不等于功能完全对等,某些工具的高级特性(比如特定的工具调用格式、思考块)可能只在原生协议上完整支持。接入后务必跑一轮真实任务验证,别只看”能连上”。
四、端侧 4B:本地跑长上下文要多少显存
这部分对个人用户最实用。因为权重开源、协议宽松(Apache-2.0,可免费商用,微调后无需开源),Spark-X2.5-4B 可以真正部署在自己的机器上。
先看体积与硬件需求(官方与社区整理的口径):
| 精度版本 | 文件体积 | 建议配置 |
|---|---|---|
| BF16 原版 | 约 8.2GB | 12GB 显存以上 |
| q8_0 量化 | 约 4.4GB | 6GB 显存起步,8GB 更稳 |
| q4_k_m 量化 | 约 2.6GB | 4GB 显存可试,纯 CPU 也能跑 |
具体怎么跑起来,走 llama.cpp 这条路最省事:
1 | # 1. 从 Hugging Face 或 ModelScope 找到 Spark-X2.5-4B 的 GGUF 仓库 |
Ollama 和 LM Studio 也都支持,图形界面用户可以直接在模型库里搜,具体 tag 名以官方仓库为准。
这里要说一句可能不太好听的话:官方宣传的”1M 上下文”,在端侧是理论值,不是许愿池。
1M Token 的 KV 缓存是实打实的显存开销,即便模型用了 1 层全注意力 + 3 层滑动窗口交替的混合架构(官方称长文本显存占用约为传统全局注意力的四分之一),普通 8GB 显卡也撑不住跑满。务实做法是按需设置 --ctx-size:日常问答给 32K,读长手册给 64K~128K,真要用满百万级上下文,那是云端该干的活。
顺带一提,1.7B 版本体积更小——BF16 权重 3GB 出头,四比特量化后体积还能减半,官方称可以在普通手机上运行。作为手机上做翻译、摘要、简单指令分发的小模型,定位是合理的。
五、实测与基准:哪些数字能信
搜了一圈媒体实测,能提取的事实性结论有这么几条:
- 智东西把星火 X2.5 接进 DeepSeek Harness 做了实测,测的是游戏开发等真实任务,而不是单轮问答
- 另一篇实测把它接进 Codex 跑了三道任务:生成粒子动画、解析一份 61 页财报、顺手查出一段代码里的 Bug
- 官方演示的场景里,长任务是重点——给一堆零散报表,让它读取、核对、画图、写总结一条龙做完
关于跑分,4B 版本官方自测的部分 Agent、编程、数学基准超过了 Qwen3.5-9B 和 Gemma4-12B;1.7B 在 MCP-Atlas 评测拿到 23.4 分,官方称是同尺寸最高;在 Domux 智能家居测试集上控制指令端到端正确率 90.3%、平均响应 0.85 秒。
这些数字要打三个折扣看:
一是自测口径。厂商自己跑的分数,环境、提示词、评测集版本都可能有优化空间。二是场景特化。智能家居指令类测试的分高,不代表开放域问答也强——小模型做窄场景,本来就有优势。三是Agent 能力的天花板受框架影响很大。同一模型接进不同 Harness,实际表现可以差出一截,所以”某模型 Agent 能力强”这种结论,最好绑定具体工具一起说。
六、和 GLM、Qwen、DeepSeek 怎么选
不列跑分排行榜,列几条真正影响决策的维度:
| 维度 | 星火 X2.5 | 选型时怎么想 |
|---|---|---|
| 算力来源 | 全流程国产算力 | 涉密、政企、有自主可控要求 → 权重最高的一项 |
| 协议兼容 | 原生支持 Anthropic / Responses | 已在用 Claude Code 一类工具、不想改工作流 → 换模型成本最低 |
| 本地可部署 | 4B / 1.7B 开源,Apache-2.0 | 数据不能出内网、要离线 → 只有开源权重这条路 |
| 长上下文 | 旗舰 256K,端侧标称 1M | 长文档处理是主场景 → 注意端侧实际能跑多少 |
| 生态成熟度 | 相对较新 | 要大量现成教程和社区方案 → 老牌家族仍占优 |
一个务实的组合建议:主力工作流用你已经在用的那家(迁移成本是真实成本),把星火当作”第二意见”和”涉密场景备胎”。 多模型交叉验证本来就是降低幻觉的常用手段,多一家国产选择,对做跨境业务的人尤其有价值——毕竟海外模型的链路抖动是你控制不了的变量。
七、绕不开的一节:跨境链路
这里要说清一个容易混淆的问题:用国产模型,本身不需要任何跨境网络。 星火的 API 就在国内,直连即可。
但现实里,很多人是这样用它的:
- 把星火接进 Claude Code、Codex 这类 Harness 当后端模型——这些工具本身以及它们默认的海外模型调用需要稳定的国际链路
- 一边用国产模型处理内部资料,一边用 Claude、GPT 读英文长文档、调试海外 SaaS 的 SDK,后者对链路稳定性更敏感
- 长时 Agent 任务跑到一半断线,几小时的上下文直接作废,这类损失不是”重试一次”能补的
所以如果你的工作流是”国产模型 + 海外工具”的混合形态,一条稳定的国际网络链路仍然是前置条件,不是可选项。
八、FAQ
Q1:免费额度够用吗? 端侧模型对应的 API 目前限时免费,旗舰版是五折付费。个人试水用免费额度足够验证效果;一旦进入日常使用,按量付费比找免费额度更省时间。
Q2:4B 模型能替代云端旗舰吗? 不能,也不该这么比。4B 的价值是”离线、私有、零调用成本”,适合长文档解析、本地知识库问答、简单脚本生成。正经复杂编码任务,27B 以下的模型普遍吃力,这是社区的共识口径,不是某一家的短板。
Q3:1M 上下文是噱头吗? 不算噱头,但要看代价。原生支持百万级上下文意味着模型架构上做了准备,实际能用多少取决于你的显存和 KV 缓存预算。云端按量付费的旗舰版更能发挥这个能力。
Q4:本地部署会不会很难? Ollama、LM Studio 这类工具已经把下载、量化、加载封装好了,会装软件就能跑起来。真正需要技术判断的是三件事:选哪个量化版本、上下文开多大、显存够不够——这三件事我在第四节给了参考值。
Q5:企业用它要注意什么? 数据边界永远是第一位。不管是走云 API 还是本地部署,先确认数据存放位置、保留期限、以及会不会用于训练。功能可以后补,数据边界出问题很难补救。
Q6:迁移成本高吗? 如果你的工具支持自定义兼容端点,成本主要在验证环节——跑一轮真实任务确认行为一致。如果是从头写调用代码,那要考虑提示词适配和评估基线重建,这才是真正的迁移成本。
Q7:现在入场会不会太早? 不算早。旗舰版已经上线开放平台,端侧模型已经开源可下载,官方还提到会在 1024 开发者节推出基于全国产算力的新一代主力模型,说明迭代节奏还会继续。现在跑通一条链路,等新版本出来迁移成本很低。
Q8:和 DeepSeek 相比谁更强? 这个问题没有稳定答案,两者迭代都快。判断标准应该是”我的任务上谁更稳”,而不是”谁分数高”。自己拿三件真实任务各跑一遍,得到的结论比任何评测都可靠。
总结
星火 X2.5 这次发布,值得记住的是三件事:
- 它不是单点产品,是一个家族。 云端旗舰管复杂任务,端侧 4B / 1.7B 管离线场景,两套价格体系覆盖了从个人到政企的不同预算。
- 双协议兼容是这次最聪明的设计。 降低迁移摩擦,比多几个基准分更能换来真实用户。
- 国产算力全流程跑通的意义在特定场景才显现。 对普通用户它是背景信息,对政企和涉密业务它是决定性的。
先拿一件手上真实的麻烦事去试,比看完十篇评测都有用。唯一要提醒的是:宣传口径里的”1M 上下文”“同尺寸第一”,都是起点不是结论,自己跑一遍才算数。
推荐服务
国产模型直连不需要跨境链路,但现实工作流往往是混合的——Claude Code、Codex 一类工具跑海外模型,或者你的 Agent 任务本身要访问海外文档与服务。这类长时任务断一次线,进度和上下文可能全丢。下面几家是长期验证过的方案:
| 服务商 | 特点 | 适合人群 |
|---|---|---|
| 👉 访问光速云官网 | IEPL + IEPL专线 多路复用,100+ 节点,主力推荐 | 重度 AI 用户、追求稳定 |
| 👉 访问飞猫云官网 | 老牌 IEPL,链路稳定 | 长时间挂机、agent 长任务 |
| 👉 访问飞猫云官网 | IEPL 专线 + 住宅 IP,节点覆盖广 | 多地区切换、账号环境 |
| 访问 微风网络 官网 | 全球 80+ 地区,¥6.99/月起 | 学生党、轻度使用先跑通 |
选择建议:跑长时 Agent 任务优先选带 IEPL专线 / IEPL 抗断流的方案,别为省几块钱选普通中转——任务跑到一半断线,省下的钱不够赔时间的。
更新日期:2026 年 9 月 14 日。模型能力、价格与部署工具更新频繁,请以讯飞开放平台官方页面为准。
相关阅读: GLM-5.3 上手指南 2026 | Qwen3.8-Max 上手指南 | DeepSeek Harness 上手指南 | 2026 年打工人必备 AI 工具清单 | 本地部署大模型:从 Ollama 到私有知识库