a day ago 现在gpt的语音聊天模型是多元一体,还是纯粹tts音频?|实现语音聊天体验 靠的是提示词还是训练🌐 链接: https://linux.do/t/topic/2724068🔍 关键词: #gpt🏷️ 分组: LinuxDo论坛🕒 时间: 2026-08-08 18:41:15 LINUX DO 现在gpt的语音聊天模型是多元一体,还是纯粹tts音频?|语音聊天 靠的是提示词还是训练 也就是说他是由语音识别模型,识别用户的话,转成文字,发给文本模型,然后再通过tts模型将文本转化成语音, 还是说直接全模态处理一切信息,直接理解用户说了什么,并且将它转化为字幕 同时,直接输出音频,并将自己的音频也转化成字幕(当然转换成字幕这一步也有可能是语音识别模型做的 或者AI的那一边可能是语音识别模型自己主动做的) 无论如何,今天玩上一个Plus 好陌生的词,我好像是第一次玩Plus 🤔 懒得翻设置,也懒得聊天了,打算以后留作改网站的备用 因为新登录,所以自然而然又给我推了一下新的voice,然后就去体验了一下…