腾讯混元发布语音识别模型 Hy ASR 3.0 preview,元宝已首发上线
最新 8 月 4 日消息,腾讯混元今日发布了新一代语音识别模型 Hy ASR 3.0 preview。
官方表示,基于最新一代大语言模型 Hy3 的语言理解能力,Hy ASR 3.0 preview 融合高精度语音识别与深度语义理解能力,在通用识别、上下文感知、多场景鲁棒性以及方言覆盖等核心维度实现全面提升,能够在更复杂的真实输入中给出准确、连贯且更接近用户意图的转写结果,从“逐字转写、单点优化”演进为“理解语境、兼容场景、一键直出”。
Hy ASR 3.0 preview 在多个开源评测集和自建评测集上整体表现领先。在开源评测集中,Hy ASR 3.0 preview 在多语种的 WER( Word Error Rate,词错误率)上都控制在 3% 左右,其中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%。

在自建评测集上,Hy ASR 3.0 preview 在通用识别、方言识别、上下文 Context 理解、专词理解、复杂声学场景(高噪、耳语)等场景化评测中,WER 也保持较低水平。

官方表示,元宝深度参与共研并已完成首发上线,用户打开元宝按住说话即可体验方言识别、上下文智能纠错与复杂环境稳定转写等能力提升,语音输入更准、更稳,且免费开放;WorkBuddy 等产品也在陆续接入中。
目前 Hy ASR 3.0 preview 已上线腾讯云官网对外提供 API 服务,可广泛应用于智能客服、内容理解、语音搜索等场景。
最新附相关链接:
腾讯混元:https://aistudio.tencent.com/visual
腾讯云:https://cloud.tencent.com/document/product/1093/135476
《腾讯混元发布语音识别模型 Hy ASR 3.0 preview,元宝已首发上线》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
铠侠官宣 GP1 XL-FLASH PCIe Gen6 固态硬盘,随机读取 100M IOPS
其采用铠侠第二代 XL-FLASH 存储级内存,允许更精细的 512 字节粒度数据访问,耐久度可达 50 DWPD,支持将高速闪存介质引入显存系统的新兴 AI 存储架构。... -
三星发声明:将封禁可共享用户网络的智能电视应用
安全研究显示多款三星智能电视热门应用内嵌住宅代理代码,可共享用户网络,甚至可能被改造成恶意僵尸网络。三星已宣布将下架相关应用,推行更严格审核政策。#三星智能电视安全问题#... -
微软测试其首款自研全双工 AI 语音 MAI Realtime 模型:支持中文等 16 种语言、2 种风格
科技媒体 TestingCatalog 于 8 月 2 日发布博文,报道称微软正测试其首款原生实时语音模型 MAI Realtime,支持 16 种语言、2 种语音,可在对话中听说并行,支持自动识别和中途切换语言。... -
全球第一!OpenRouter 称上周 DeepSeek-V4-Flash 调用超 7.22 万亿 Token 登顶
根据全球最大 AI 聚合平台 OpenRouter 的 OpenRouter 的周度统计中,DeepSeek-V4-Flash 以 7.22 万亿 Token 的调用量位居全球第一,单日峰值突破 8 万亿 Token。... -
中美 AI 大模型竞争加剧:OpenAI 等海外巨头大幅降价对标 Kimi、DeepSeek
为应对月之暗面 Kimi K3 和 DeepSeek V4 Flash 等中国模型的竞争,OpenAI 大幅下调 ChatGPT 5.6 Luna 价格 80%,中端模型 Terra 也降价 20%。尽管降价刺激使用,但高昂的算力成本与持续亏损让盈利前景蒙上阴影。 #AI价格战#...












