OpenAI升级转录和语音生成AI模型
创始人
2025-03-21 08:11:26
0

OpenAI 正在为其 API 引入新的转录和语音生成 AI 模型,该公司声称这些模型比以前的版本有所改进。

对于 OpenAI 来说,这些模型符合其更广泛的代理愿景:构建能够代表用户独立完成任务的自动化系统。

代理的定义可能存在争议,但 OpenAI 产品负责人 Olivier Godement 描述了一种解释,即可以与企业客户交谈的聊天机器人。

Godement 在简报会上告诉 TechCrunch:未来几个月,我们将看到越来越多的代理出现。因此,总体主题是帮助客户和开发人员利用有用、可用且准确的代理。

OpenAI 声称,其新的文本转语音模型gpt-4o-mini-tts不仅可以提供更细致入微、听起来更逼真的语音,而且比上一代语音合成模型更可控。

开发人员可以指导 gpt-4o-mini-tts 如何用自然语言说话——例如,像疯狂的科学家一样说话或像正念老师一样用平静的声音说话。

OpenAI 产品人员杰夫哈里斯 (Jeff Harris) 告诉 TechCrunch,他们的目标是让开发人员定制语音体验和语境。

与传统不同的是,OpenAI 并不打算公开其新的转录模型。该公司过去曾根据 MIT 许可发布过 Whisper 的新版本,供商业使用。

哈里斯表示,gpt-4o-transcribe 和 gpt-4o-mini-transcribe比 Whisper 大得多,因此不适合公开发布。

「它们不是那种可以在笔记本电脑上本地运行的模型,就像 Whisper 一样,」他继续说道。「我们希望确保,如果我们要以开源形式发布产品,我们会深思熟虑,并且我们有一个真正针对特定需求而精心打造的模型。我们认为,终端用户设备是开源模型最有趣的案例之一。」

相关内容

热门资讯

关联MCN公司谈司马南偷税:他... 界面新闻记者 | 赵孟 蔡星卓 界面新闻编辑 | 刘海川 2025年3月21日,国家税务总局北京...
小米AI眼镜突传消息!多股涨停 值得注意的是,此前多次有爆料称小米将打造AI眼镜,预计在3月至4月发布。 3月24日,AI眼镜板块领...
珍爱网回应闭店:全面核查整改,... 图片来源:视觉中国 3月24日,珍爱网发布《消费者权益保障工作声明》称,近日,个别合作商运营问题引发...
原创 李... 近日,李嘉诚拟向美国贝莱德财团出售43个港口。据媒体报道,双方已经谈妥了所有细节,贝莱德集团高层计划...
3月17日基金净值:前海开源瑞... 证券之星消息,3月17日,前海开源瑞和债券A最新单位净值为1.0433元,累计净值为1.2293元,...
聚焦“AI焦虑”“AI幻觉”,... 人工智能(AI)技术近年来发展迅猛,已迅速蔓延至各个领域,尤其是今年初,国产DeepSeek大模型的...
3月17日基金净值:前海开源公... 证券之星消息,3月17日,前海开源公用事业股票最新单位净值为2.7367元,累计净值为2.7367元...
爆冷!戴维斯30分利夫26+1... 【搜狐体育战报】北京时间3月11日CBA常规赛第39轮,卫冕冠军在上半场领先的情况下惨遭逆转,最终主...
华为大动作,高手看好AI医疗概... 本周,市场风格出现高低切换,市场炒作新热点,如阿里玄铁芯片、AI智能体、军工、小金属等,而一些老热点...
如何在CentOS上设置共享桌... CentOS共享桌面配置指南 在服务器管理与运维场景中,CentOS因其稳定性和开源性被广泛使用,对...