vllm-project/vllm-ascend

[Community Test] Qwen3-235B-A22B-W8A8 部署验证

Open

#11.738 geöffnet am 9. Juli 2026

Auf GitHub ansehen
 (0 Kommentare) (0 Reaktionen) (0 zugewiesene Personen)C++ (1.318 Forks)github user discovery
help wanted

Repository-Metriken

Stars
 (2.180 Stars)
PR-Merge-Metriken
 (Durchschn. Merge 4T 5h) (559 gemergte PRs in 30 T)

Beschreibung

Source: 推理众测任务书-vllm.xlsx row 3. This issue tracks one community testing task for vLLM-Ascend.

Task Information

任务概述

在A2单机环境上部署Qwen3-235B-A22B-w8a8模型,发起请求并成功返回

核心要求

3.1任务范围: 参考https://docs.vllm.ai/projects/ascend/en/v0.18.0/tutorials/models/Qwen3-235B-A22B.html社区文档,使用官方镜像创建容器,拉起服务,curl请求可以成功返回。 3.2功能实现要求 服务拉起正常,curl请求可以正常返回。

验收标准 / 交付件

交付件 交付件 说明 部署文档 Markdown格式的完整部署指南 部署脚本 服务部署的Python或者shell脚本 测试结果 服务验证的输出日志/截图 问题记录 部署过程中遇到的问题及解决方案 交付标准 维度 标准 功能 服务成功启动并能正常响应推理请求 文档 文档完整、步骤清晰、可复现 精度 推理结果正常,无明显异常

测试方法

服务拉起后向大模型发起请求可以正常返回。

对接信息

  • 技术对接人: 应宇轩  郑志崇  崔青
  • PAE/小巧灵: 邹长江 00888932 宋洋 00835984
  • 工作量: 暂无
  • 任务书路径: 任务书\vllm任务书\修改任务书\任务书-cjw2.docx

任务问题和需求

1、vllm服务启动loading模型高并发读取要3小时 2、vllm bench 随机数性能测试报404,export VLLM_USE_MODELSCOPE=True vllm bench serve --model vllm-ascend/Qwen3-235B-A22B-w8a8 --dataset-name random --random-input-len 200 --num-prompts 200 --request-rate 1 --save-result --result-dir ./

Contributor Guide