优云智算
控制台
立即注册
qwen3.8-27b-vllm-256k
Qwen3.8-27B vLLM 推理服务(256K上下文/128并发/qwen3_xml工具调用/API鉴权/开机自启动)
star0
0.05/小时
v26.081501
最新

qwen3.8-27b-vllm-256k

镜像简介

一键部署 Qwen3.8-27B(千问3.8) 大模型推理服务,开箱即用、开机自启动。

  • 功能: 提供 OpenAI 兼容的 vLLM 推理 API,支持对话生成、256K 超长上下文、函数调用(Function Calling)、思考等级控制。
  • 特点: 预装 vLLM 0.25.1 推理框架与全部编译缓存,已集成开机自启动(supervisor),实例创建后无需任何人工干预,数分钟内自动对外提供 API 服务。

环境与依赖

  • 框架及版本: vLLM 0.25.1(含 FlashAttention v3、FlashInfer 0.6.13)
  • CUDA版本: CUDA 13.2
  • 其他依赖:
    • Python 3.12(conda 环境 py312
    • PyTorch 2.11.0(cu130)
    • Ubuntu 22.04
    • 推荐 GPU:NVIDIA H20(96GB)

配置方法

  1. 创建实例(使用本镜像):

    compshare instance create \
      --region cn-wlcb --zone cn-wlcb-01 \
      --gpu H20 --count 1 --cpu 16 --memory 240GiB \
      --image <本镜像ID> --image-source custom \
      --disk 100GiB --charge Postpay --yes
    
  2. 等待自动启动:实例创建后,supervisor 会自动拉起 vLLM 服务并加载模型(约 5-10 分钟,无需登录操作)。

  3. 开放端口:在控制台防火墙放行 8000 端口。

  4. 调用 API:见下方"环境验证代码"。

模型说明: 模型权重通过共享存储 /model/ModelScope/Qwen/Qwen3.8-27B 自动挂载,不占用镜像体积;若新实例无此挂载,需先将模型下载至该路径。

环境验证代码

⚠️ 安全提示: 下方 API Key 为镜像内置的默认演示 Key,仅用于本地快速验证。正式对外开放服务前,务必修改为自己的 Key(修改步骤见「常见问题 Q1」)。

# 方式一:curl 验证
curl http://<公网IP>:8000/v1/models \
  -H "Authorization: Bearer sk-3sdrins_O6gsSBu4_stRG2iDT5n3v762MFBizemhlwg"
# 方式二:OpenAI SDK(Python)
from openai import OpenAI

client = OpenAI(
    base_url="http://<公网IP>:8000/v1",
    api_key="sk-3sdrins_O6gsSBu4_stRG2iDT5n3v762MFBizemhlwg",
)

resp = client.chat.completions.create(
    model="Qwen3.8-27B",
    messages=[{"role": "user", "content": "你好,1+1 等于几?"}],
    max_tokens=256,
)
print(resp.choices[0].message.content)

预期返回模型正常回答(如"1+1 等于 2")即环境配置成功。

服务核心参数

项目
模型Qwen3.8-27B(BF16,51.75 GiB)
最大上下文256K(262144 tokens)
并发上限128 路
服务端口8000(OpenAI 兼容)
API 鉴权已开启(默认 key 为 demo 用途,正式使用需修改)
函数调用已开启(qwen3_xml parser)
思考等级xhigh(默认)/ medium / low

思考等级与工具调用

# 控制思考等级(三选一)
resp = client.chat.completions.create(
    model="Qwen3.8-27B",
    messages=[{"role": "user", "content": "9.11 和 9.9 哪个大?"}],
    extra_body={"reasoning_effort": "low"},   # xhigh / medium / low
)

# 函数调用
tools = [{
    "type": "function",
    "function": {
        "name": "get_weather",
        "description": "获取城市天气",
        "parameters": {
            "type": "object",
            "properties": {"city": {"type": "string"}},
            "required": ["city"],
        },
    },
}]
resp = client.chat.completions.create(
    model="Qwen3.8-27B",
    messages=[{"role": "user", "content": "北京天气怎么样?"}],
    tools=tools,
    tool_choice="auto",
)
print(resp.choices[0].message.tool_calls)

相关链接

常见问题

Q1:API 返回 401 未授权?如何修改默认 API Key? A1: 服务已开启鉴权,请求需携带 Authorization: Bearer <api-key> 头。

⚠️ 重要: 镜像内置的默认 Key(sk-3sdrins_O6gsSBu4_...仅为演示用途。任何获取本镜像的人都能看到该 Key,正式对外开放服务前必须更换,否则任何人都可盗用你的 GPU 资源。

修改 API Key 步骤:

  1. 生成新 Key(登录实例执行,或本地执行):

    python3 -c "import secrets; print('sk-' + secrets.token_urlsafe(32))"
    
  2. 编辑 supervisor 配置

    vi /etc/supervisor/conf.d/vllm.conf
    

    找到 --api-key sk-3sdrins_O6gsSBu4_stRG2iDT5n3v762MFBizemhlwg,替换为你生成的新 Key。

  3. 重启 vLLM 服务使配置生效:

    supervisorctl restart vllm
    

    等待约 2 分钟服务重新就绪(supervisorctl status 显示 RUNNING)。

  4. 验证:旧 Key 应返回 401,新 Key 应返回 200:

    curl -o /dev/null -w "%{http_code}" -H "Authorization: Bearer <旧Key>" http://localhost:8000/v1/models   # 期望 401
    curl -o /dev/null -w "%{http_code}" -H "Authorization: Bearer <新Key>" http://localhost:8000/v1/models   # 期望 200
    

Q2:公网 8000 端口无法访问? A2: 需在 CompShare 控制台的防火墙/安全组中放行 8000 端口(uhost 实例不支持 CLI 自定义端口映射)。

Q3:创建实例后服务没自动启动? A3: 登录实例执行 supervisorctl status 查看 vllm 状态;首次加载模型约需 4-5 分钟,属正常现象。日志位于 /var/log/vllm.log

Q4:模型权重在哪?占用镜像空间吗? A4: 模型位于共享存储 /model/ModelScope/Qwen/Qwen3.8-27B(约 52GB),不占用镜像体积(镜像约 40GB)。若实例无该挂载,需自行下载模型到对应路径。

Q5:如何关闭思考(加速简单问答)? A5: 请求时传 extra_body={"enable_thinking": False},或使用较低思考等级 reasoning_effort: "low"

@AI氧气瓶
镜像信息
已使用0
运行时长
0 H
支持自启动
镜像大小
40GB
最后更新时间
2026-08-15
支持卡型
H20
+1
框架版本
vLLM-0.25.1
CUDA版本
13.2
应用
JupyterLab: 8888
自定义开放端口
8000
+1
版本
v26.081501
2026-08-15
vLLM:0.25.1 | CUDA:13.2 | 大小:40.00GB
logo

隶属于优刻得科技股份有限公司

股票代码:688158

优刻得是中立、安全的云计算服务平台