跳转到正文

智算中心介绍与商务合作说明

智算中心介绍

智流FluxLane已建成新一代智算中心,部署基于 NVIDIA Blackwell Ultra B300 的高性能 GPU 算力集群,并完成 DeepSeek、GLM、Kimi、Qwen、Llama等主流开源大模型的部署与适配。智算中心已通过高并发、高吞吐、长上下文及持续稳定性等多维度自测,并完成多家合作企业的真实业务场景验证,可为企业提供稳定、高效、弹性扩展的大模型推理与 AI 应用基础设施。

TEST SNAPSHOT / 2026-08-27

测试概览

流式测试 · NVIDIA DGX B300 整机

测试模型
6 款 × 5 轮
连通测试
30 / 30
连通成功率
100%
可用模型
12 款在架
最优首字
0.78s
吐字峰值
149 tok/s
长上下文测试
958K tokens
实测上下文
958K tokens

01 模型与实测性能

以下为需求量较高的6款模型,全部采用流式方式测试,每款模型测试5轮,并记录最优值与中位数。

FluxLane 当前可用模型以模型广场实时目录为准。

模型 ID最优首字首字中位吐字峰值吐字中位官网上下文本次实测
glm-5.21.28s1.73s74.969.21M948K
glm-5.31.98s3.86s132.6116.01M948K
deepseek-v4-flash0.78s2.89s149.4117.81M948K
deepseek-v4-pro1.58s2.27s132.287.61M948K
kimi-k33.84s8.90s47.330.41M948K
kimi-k3-fast6.23s7.02s68.632.61M948K

说明:

  • 吐字速率单位为 tok/s,首字耗时即 TTFT;带有星号的数值代表本轮测试最优。
  • -fast 为快速响应版本,主要面向高 TPS 等特殊场景。
  • 上下文数据已与官网标注逐条核对。本次实测是单次探针实际发送并被正常接收的 prompt_tokens,用于验证上下文长度。
  • 完整模型目录请前往智流 FluxLane 模型广场查询,价格与上下文以官网实时标注为准。

峰值不承诺恒定

上表峰值为实测最优值,受当时负载、上下文长度、输出长度影响,不代表任何时刻都能达到。偶发长尾在5%以内属正常现象,请在压测口径中预留余量。需要稳定下限的,请查看下方保底方案。

02 第三方评测与全量跑测

除基础连通性测试外,智流FluxLane 也接受客户指定的标准化评测,并保留完整测试日志。

KVV 测试套件

已完成全量跑测。其中标准 Tools 函数调用与 JSON Schema 结构化输出共 398 / 408 通过,通过率为 97.55%。

完整分项报告可按需提供,也支持客户携带自有测试套件在智流 FluxLane 节点上复跑。

两轮多模态跑测

  • MMMU Pro Vision 全量:1,730 / 1,730 样本,100%交付,准确率0.8243。
  • OCRBench 全量:同步完成,独立报告可单独提供。

评测报告

以上报告均可作为附件随合同提供,用于甲方内部立项与技术评审。

03 站内价格

发票说明

默认不开具6%增值税专用发票。

以上价格均为不含税价格。如需强制开具6%专用发票,相关税点由客户方补足,请在报价阶段提前说明,以免影响后续结算。

04 支付与合作方式

支付方式

支持以下四种支付渠道:

  • 微信
  • 支付宝
  • 对公转账

小额合作可采用随充随用方式;对公转账更适合大额及长期合作。

合作协议

支持签订模型保真协议,以合同形式约定模型来源与版本一致性。

同时支持对公合同签订,可配合甲方的采购、法务与审计流程。

付款条件

合作一律采用预付款方式。

这是智流 FluxLane 能够提供上述折扣的前提条件,请在项目评估阶段纳入考虑。

05 企业对接-容量如何申报

本节用于确定智流 FluxLane 为客户预留的资源数量,请按照真实业务形态进行申报。容量申报不准确,可能直接影响服务质量与成本。

路径A:随充随打,无需报数

不需要保底资源、可以接受共享池波动的客户,无需申报具体用量,充值后即可使用。

适合验证期、中小流量、波峰不明显的业务。这是大多数客户的起步方式。

路径B:保底 TPM,需要提供四组数据进行定制化排产

如果需要 智流FluxLane 锁定稳定的 TPM 下限,必须提供:

  1. 日均 TPM 曲线
  2. TPM 峰值
  3. 峰值持续时长
  4. 日 Token 消耗总量

缺少任何一项,智流FluxLane 都无法准确推算所需资源,也无法提供保底承诺。

容量申报注意事项

  • 硬并发、RPM、TPM需要分开申报。三者对应的资源约束不同,只提供单一指标无法完成排产。
  • 业务曲线比单一峰值更重要。“峰值4000万 TPM,仅持续10分钟”和“持续24小时”属于完全不同的资源方案,成本差异较大。
  • 预付款同样适用于保底资源方案。

大额专线说明

例如“24小时持续4000万 TPM”这类大额专线需求,需要 FluxLane 提前预定机房资源,预计3至5个工作日开通。

资源开通后即产生实际占用成本,不接受今天开通、次日停止的临时使用方式。客户申报高容量需求后,需要保证对应的实际用量。

如果无法确保真实用量,建议选择“路径A:小额随充随打”,对双方更合适。

非流式长握手说明

接入前请注意:智流FluxLane 默认链路经过边缘节点防护,边缘读取超时时间为 120秒。如果一次请求从发出到收到第一个字节超过120秒,可能会被边缘节点中断并返回 524。

这通常不是模型本身的问题,而是 CDN 的保护策略。

  • 建议默认开启流式响应:stream: true。流式响应在首字返回后会持续产生数据,大多数场景不会触发超时。本次30轮流式测试无一次超时。
  • 流式无法解决模型预填充本身超时的问题。上下文极长时,首字之前本来就没有字节可发。实测94.8万token冷启动下,各模型首字耗时46至120秒,其中 kimi-k3 有一次落在128秒,被判定为 524。
  • 如果业务经常使用50万token以上的超长上下文,或对超时零容忍,请与 智流FluxLane 签约使用直连专线,绕开 CDN 限制。

智流 FluxLane · 数据实测于 2026-08-27,价格与模型目录以 FluxLane 官网实时标注为准。

合规使用 FluxLane,并遵守相关服务条款。