1Panel AI一体机(方案三)实测报告:双卡RTX Pro 5000部署Qwen3.8-Flash-Next

在 1Panel AI 一体机(方案三,2 × NVIDIA RTX Pro 5000 Blackwell 72GB / 128GB 内存)上,使用 vLLM 部署 Qwen3.8-Flash-Next 完成压力测试,并接入 WorkBuddy 在飞致云生产环境中连续运行一周。本文完整呈现该配置的软硬件参数与测试口径,给出从 1 到 16 并发的压力测试数据,以及在真实办公负载下的首字延时与吞吐表现,为评估部门级私有化 AI 部署提供一份可复现的实测参考。

1Panel AI一体机(方案三)实测报告:双卡RTX Pro 5000部署Qwen3.8-Flash-Next

在 1Panel AI 一体机的产品序列中,双卡方案处在一个需要被具体验证的位置:向上,四卡与八卡方案性能更强,但预算接近翻倍;向下,单卡方案成本更低,可选的模型尺寸却相对有限。不少用户在考察过多种配置之后,会提出同一个问题——想要承载更大尺寸的模型,双卡方案在实际业务场景里到底够不够用?

这个问题很难通过参数表回答。参数表会给出显存容量与算力数值,却不会说明十人同时使用时是否会出现卡顿,也不会说明把一份八万字的代码库交给模型需要等待多久。这些只能由压测数据来回答。近期,我们在 2 张 NVIDIA RTX Pro 5000 Blackwell 72GB 加速卡上完成了 Qwen3.8-Flash-Next 模型的压力测试,并在生产环境中进行了为期一周的持续验证,获得了一组可供参考的实测数据。

一、双卡承载 Qwen3.8-Flash-Next 的配置逻辑

Qwen3.8-Flash-Next 是面向智能体(Agent)场景打造的效率型模型。作为 Qwen4 架构预览版 MoE 大模型,其总参数为 125B,单 Token 仅激活 6B。模型搭配 51B 独立 N-gram Embedding 查表权重,N-gram 层可卸载至内存,几乎不增加算力占用,同时强化短语表征能力。该模型原生支持 262K 上下文,并可扩展至 1M Token。

在 Artificial Analysis 的 Agentic real-world work tasks 评测中,Qwen3.8-Flash-Next 在真实工作任务的完成度与稳定性上,与体量大得多的模型处在同一梯队,而参数量与显存占用则低得多。这意味着该模型对硬件门槛的要求更低,可以支撑更高并发,同时降低单次推理成本。

硬件层面,单卡是入场配置,四卡是旗舰配置,双卡则处在性价比的拐点上:

  • 显存够用:2 张卡提供 144GB 总显存,可完整承载 Qwen3.8-Flash-Next 的模型权重,同时为 KV Cache 和并发调度留出余量;
  • 算力提升:相较单卡方案,张量并行(TP=2)使可用算力接近翻倍,直接体现在首字延时和整机吞吐上;
  • 成本可控:一次硬件投入,可覆盖一个部门级团队(几十人规模)的日常 AI 用量,边际调用成本趋近于零;
  • 扩展平滑:双卡配置向上可平滑扩展至四卡集群,系统构建无须推倒重来。

表 1 为 Qwen3.8-Flash-Next 在该配置下的存储资源分布情况:

组成 占用 存放位置
模型权重(NVFP4) 约 90GB 显存
N-gram 嵌入表(PLE) 约 50GB 主机内存

二、部署环境与测试口径

1Panel AI 一体机(方案三)的软硬件配置与部署参数如下:

  • CPU:2 颗 Intel Xeon Silver 4510
  • 内存:128GB
  • 加速卡:2 张 NVIDIA RTX Pro 5000 Blackwell 72GB
  • 推理引擎:vLLM
  • 推理镜像:vllm/vllm-openai:qwen38-flash-next
  • 管理软件:1Panel 企业版

该配置的几个关键点:双卡提供 144GB 总显存,承载模型权重后仍有充足的 KV Cache 空间,这是支撑高并发的物理基础;NVIDIA RTX Pro 5000 Blackwell 支持 ECC 大显存,适合企业内部长期无人值守运行;vLLM 推理引擎提供高性能推理服务与标准 OpenAI 兼容接口,开箱即用;1Panel 企业版负责模型、资源和应用的统一管理。

本次测试关注四项核心指标:

  • 首字延时(TTFT,单位:秒):从发出提问到模型吐出第一个字之间的等待时间,直接决定用户体感;
  • TPOT:生成每个 Token 所需的平均时长;
  • 输出吞吐 TPS(tokens/s):每秒生成的 Token 数,分为“整机”(整机输出吞吐 TPS)与“单路”(人均输出吞吐 TPS)两个子指标;
  • 端到端吞吐(E2E TPS):将输入处理一并计入的整体处理速度,在长输入场景下更接近真实负载。

三、方案性能实测

1. 压力测试数据

压力测试模拟 WorkBuddy 办公智能体的真实负载特征:输入 84k Tokens、输出 0.5k Tokens,Prefix Cache 命中率为 90%。

表 2 为压力测试数据汇总:

并发 Mean TTFT(ms) Mean TPOT(ms) 单路输出吞吐(tps) 整机输出吞吐(tps) 整机 E2E 吞吐(tps)
1 704.54 6.01 135.60 135.60 22,382.09
4 4561.59 7.85 53.46 213.85 40,763.82
8 6995.52 12.71 37.51 300.11 49,536.61
10 7985.68 16.31 30.38 303.79 50,143.88
12 9276.12 46.94 22.12 265.43 53,382.99
16 11745.74 28.67 20.31 324.89 56,945.50

各项指标的表现特征如下:

  • 首字延时(TTFT):1 并发时 TTFT 为 704ms,低并发下响应迅速;随并发上升,TTFT 逐步增长,10 并发时接近 8s;
  • 整机输出吞吐:并发从 1 提升至 10,整机输出 TPS 稳步上升,10 并发时达到 303.79 tokens/s;继续提升至 16 并发,整机输出 TPS 冲高至 324.89 tokens/s,但更高的整机吞吐是以牺牲时延体验为代价的;
  • 单路输出吞吐:单路 TPS 对应单个用户实际感受到的文本输出速度。单并发时独享 GPU 算力,人均 TPS 可达 135.60 tokens/s。随着并发增加,分配给每个会话的算力被稀释,人均 TPS 持续下降:8 并发时为 37.51 tokens/s,办公智能体场景仍处于可接受区间;超过 12 并发后降至 20–22 tokens/s 区间,单用户文本生成速度明显变慢。

2. 生产环境实测数据

压测数据反映的是模型服务的性能上限,真实生产环境的表现还会受 KV Cache、Prefix Cache 命中率波动、请求上下文长度分布、后端调度开销等多重因素影响。我们将 1Panel AI 一体机(方案三)接入 WorkBuddy,在飞致云生产环境中承担以 AI 办公为主的负载,经过为期一周的持续验证,在 6 并发场景下取得的实测数据如下:

表 3 为真实生产环境数据汇总:

指标 真实办公负载实测(6 并发)
平均首字延时(TTFT) < 8s
整机输出吞吐(TPS) ~300 tokens/s
单路输出吞吐(TPS) ~50 tokens/s

注:以上数据基于真实办公环境生产环境调用大模型的监控数据得出。

在实际使用中,WorkBuddy 依托约 91% 的前缀缓存命中率,改善了超长上下文的首次响应延时与端到端吞吐表现;得益于 MTP 投机解码加速,真实的整机输出吞吐会高于压力测试的结果。在 6 人同时使用的办公场景下,每个人获得的输出速度约为正常阅读速度的两倍,能够满足企业日常 AI 办公的流畅度要求。

四、场景适配参考

综合上述数据,以下适配判断可作为实际部署时的参考。适合采用双卡方案(方案三)的场景包括:

  • 部门级 AI 办公团队:几十人规模,日常以问答、文档处理、代码辅助为主;
  • Agent 智能体 / AI Coding 重度用户:需要将 8 万 Tokens 级别的代码库与工程上下文交给模型处理;
  • 数据敏感型业务部门:法务、财务、经营分析等场景,内部资料要求不出域;
  • 希望锁定长期成本的团队:一次性硬件投入,后续边际调用成本趋近于零。

在以下情况下,则应考虑扩展至四卡方案:

  • 并发需求持续超过 10:此时人均生成速度已明显下滑,单用户体验衰减明显,单纯拉高并发换取整机吞吐的性价比偏低;
  • 超长上下文 Agent 任务且并发要求高:84K 上下文场景下的稳定并发上限在 6–8 之间,更高并发需要扩容;
  • 追求推理能力上限:Qwen3.8-Flash-Next 属于效率型模型,超高难度推理及超长链路复杂任务建议选用旗舰模型;
  • 单机同时部署多个模型:双卡 144GB 显存会被单个大模型占满,需要扩容。

五、总结

实验室里的峰值性能只能说明模型“能跑”,只有生产环境中连续运行过的数据,才能说明方案是否“可用”。我们通过压力测试摸到双卡配置的能力上限,再将 1Panel AI 一体机(方案三)接入 WorkBuddy,在飞致云真实生产环境中以 AI 办公负载为主连续运行一周,取得真实环境数据。上限数据与真实数据相互印证,方案的可行性才具备实际参考价值。

“双卡 RTX Pro 5000 Blackwell + Qwen3.8-Flash-Next”这一组合,在生产环境中证明了它作为部门级私有化 AI 部署配置的适用性。两张卡、一个部门、一台一体机,是中型企业落地私有化 AI 时值得纳入评估的一个选项。