DeepSeek灰度测试语音对话功能,上线四种朗读音色

9月12日,据多名用户反馈,DeepSeek在App端启动语音对话功能的灰度测试。获得测试资格的用户可在App右上角看到一个小喇叭按钮,点击后即可开启语音实时对话,AI将以语音形式回复。

设置页面同步新增“朗读音色”选项,提供四种风格:贝壳(百变活泼)、白浪(明朗坚定)、海星(俏皮甜美)、暗潮(低沉浑厚),名称均取自海洋意象,与DeepSeek的蓝色鲸鱼品牌标识相呼应。

据测试用户反馈,DeepSeek的语音对话声音“比较自然”,断句和语调处理较为流畅,不是传统机器音的生硬感,但也有用户提到“稍有AI味”,自然度仍有提升空间。

有用户反映部分长句朗读节奏略显生硬。另有测试者发现,当朗读内容为歌词时,DeepSeek会尝试唱出来,但跑调较为明显。

荣耀回应魔法画报耽误拨打120争议,当事人经沟通后致歉

此前DeepSeek已支持长按说话转文字输入,用户语音输入后AI以文字形式回复。本次新增语音回复能力,补齐了从语音输入到语音输出的完整链路。

据DeepSeek对媒体的回应,此次测试为小范围灰度,并非全量开放,网页端暂不支持,需更新手机App才能体验,官方未公布全量上线时间表,也未就是否支持全双工实时对话、随时打断等功能作出说明。从功能形态看,当前版本更接近文本转语音朗读,距离实时语音通话仍有差距。

语音交互方面,字节跳动旗下豆包走在前列。今年4月,豆包App全量上线原生全双工语音功能,支持边听边说、随时打断;8月,豆包进一步接入音视频全双工大模型SeedRealtime,实现边看、边听、边说的连续交互。OpenAI于7月推出GPT-Live,同样采用全双工架构,谷歌Gemini Live则支持摄像头和屏幕共享。

此次灰度测试的时间节点与 DeepSeek 近期的模型迭代节奏接近。9 月 10 日,DeepSeek 刚发布 V4.1‑Flash 模型,官方称其具备原生多模态视觉理解能力,推理速度和吞吐量均有提升,API 价格同步下调,官方宣布后续 V4‑Pro 的 API 请求将自动路由至 V4.1‑Flash。