优云智算
控制台
立即注册

小米ASR目标语音识别模型

🏆 多说话人 SOTA:小米Xiaomi-CocktailASR-1 目标说话人语音识别ASR,在多个主流多说话人测试集(AliMeeting、AMI、LibriMix 等)上达到最优性能。

镜像大小
70 GB
当前版本
v1.0
累计部署
0
累计运行
0 h
最近更新
2026-09-18

运行环境

框架版本
PyTorch-2.8.0
CUDA版本
12.8
应用
JupyterLab: 8888
支持卡型
RTX40系RTX50系
+3

镜像简介

  • 🏆 多说话人 SOTA:在多个主流多说话人测试集(AliMeeting、AMI、LibriMix 等)上达到最优性能。
  • 🎯 单说话人兼容:单说话人测试集上性能与普通 ASR 模型可比。只需同一模型,便能同时兼顾单人与多人场景,无需切换普通 ASR 模型。
  • 🚫 负样本拒识:具备对全非目标说话人音频的拒识能力,有效降低误触发。
  • 🧠 思维链推理:支持 Chain-of-Thought(CoT)模式,对识别结果提供可解释的推理过程。

配置方法

  1. 该镜像初始化后,需要等待服务启动,大概 3 分钟左右。
  2. 启动后点击按钮 “YZY启动器” 或者 “9000” 直接访问服务。
  3. 首次生成加载模型比较耗时。
  4. 服务运行日志查询,可以输入命令 tail -f /start.d/log/*
  5. 输出目录: /root/cocktailasr/outputs,也可以可直接在生成页面下载。

视频教程

详细步骤,可在 哔哩哔哩 余子越Talk 博主页面搜索 cocktailasr 观看视频教程!

相关链接

效果截图

云.jpg

常见问题

0 个镜像 · 被使用 0
交流与支持
交流群二维码
扫码加入交流群
作者与用户在群内答疑
版本日志
v1.0最新
2026-09-18
🏆 多说话人 SOTA:小米Xiaomi-CocktailASR-1 目标说话人语音识别ASR,在多个主流多说话人测试集(AliMeeting、AMI、LibriMix 等)上达到最优性能。
评分
0.0
暂无评分
我的评分
未评分
小米ASR目标语音识别模型一键部署 | 优云智算