
xiaomi-any2speech将任意内容(文本/文件/音频/视频)转为可直接播放的语音节目或单人 TTS,最长约 10 分钟,输出 WAV 音频。当用户提到以下任意意图时使用:做成播客/相声/辩论/有声书/Rap/新闻播报/脱口秀/情感电台/课程讲解、帮我读一下/朗读/念出来/转成语音/TTS/生成音频/转成音频、发语音/语音回复/做成XX发给我。
xiaomi-any2speech-beyondtts声音世界模型(Speech World Model):不只是 TTS,而是理解场景、角色、情绪并自主规划表达的语音大模型。 原生支持长文+多人、中英双语,也支持上传参考音频进行音色克隆(Voice Prompt / voice cloning),内置高能创作模板,将任意内容转为播客/有声书/相声/Rap/广播剧等...