Qwen3.8-27B 5090双卡部署,支持完整262k上下文,总吞吐800 token/s
面向双 NVIDIA RTX 5090 32GB 的 Qwen3.8-27B NVFP4 推理环境,提供 OpenAI 兼容 API。
| 项目 | 配置 |
|---|---|
| 模型 ID | qwen3.8-27b-nvfp4-262k |
| 权重路径 | /model/ModelScope/RadixArk/Qwen3.8-27B-NVFP4 |
| 上下文上限 | 26,214,4 tokens |
| 最大并发 | 5 |
| API 端口 | 30000 |
| 权重量化 | NVFP4 |
| KV Cache | FP8 |
| Attention | FlashInfer |
| 运行环境 | CUDA 13 / PyTorch 2.11 |
595.80/model/ModelScope/RadixArk/Qwen3.8-27B-NVFP4