小米宣布开源声音理解大模型MiDashengLM-7B
创始人
2025-08-04 14:41:44

今天发布和全量开源了 MiDashengLM-7B 模型。MiDashengLM-7B 基于 Xiaomi Dasheng 作为音频编码器和 Qwen2.5-Omni-7B Thinker 作为自回归解码器,通过创新的通用音频描述训练策略,实现了对语音、环境声音和音乐的统一理解,声音理解性能在22个公开评测集上刷新多模态大模型最好成绩(SOTA),单样本推理的首 Token 延迟(TTFT)仅为业界先进模型的 1/4,同等显存下的数据吞吐效率是业界先进模型的 20 倍以上。

MiDashengLM 以 Xiaomi Dasheng 音频编码器为核心组件,是 Xiaomi Dasheng 系列模型的重要升级。在当前版本的基础上,小米已着手对该模型做计算效率的进一步升级,寻求终端设备上可离线部署,并完善基于用户自然语言提示的声音编辑等更全面的功能。

相关内容

热门资讯

原创 万... 这个春节,大模型彻底“杀疯了”。 从腾讯元宝的10亿红包在微信里“炸群”,到千问的“30亿免单”掀起...
AI 广告全面入侵超级碗 文 | 寻空的营销启示录 今年的超级碗结束后,很多人有一个共同感受:AI 广告多得有点不正常。 从...
AI数据分析学习 模块一:数据分析基础与AI入门 数据分析核心概念 数据分析的流程与目标 数据清洗、探索性分析...
康养+AI?东软集团有新动作 东软集团等在福州成立康养公司,注册资本1000万 投资时间网、标点财经快讯 天眼查App显示,近日...