mimo-v25-ttsMiMo V2.5 TTS 语音合成。使用小米 MiMo V2.5 TTS 系列模型生成语音。当需要将文字转为语音、发送语音消息、朗读内容、或用户要求「说出来」「语音回复」时激活此 skill。支持预置音色、音色设计、音色克隆三种模式,支持自然语言控制、导演模式,支持语气、情绪、方言的风格标签控制,预置音色支持唱歌。
Install via ClawdBot CLI:
clawdbot install xcchenx345/mimo-v25-ttsGrade Fair — based on market validation, documentation quality, package completeness, maintenance status, and authenticity signals.
Calls external URL not in known-safe list
https://api.xiaomimimo.com/v1Uses known external API (expected, informational)
open.feishu.cnAudited May 24, 2026 · audit v1.0
Generated Oct 7, 2026
企业客服系统接入MiMo TTS,根据用户咨询内容实时生成自然语音回复,支持预置音色与情绪控制,提升客户体验。可结合音色克隆复刻品牌专属客服声音,增强品牌一致性。
网文、新闻、知识付费等内容平台利用TTS将文字批量转为有声书或播客。支持多音色、方言、唱歌等能力,满足不同题材的演绎需求,大幅提升内容生产效率。
营销团队为短视频、广告片快速生成多风格配音,通过导演模式和自然语言控制调节语气、情绪与节奏。支持一次生成多版本供后期挑选,降低配音成本与周期。
为视障用户或有阅读障碍的人群提供文字朗读服务,支持自然语言控制语速与情感表达。结合音色克隆可复刻亲友声音,增强陪伴感和个性化体验。
游戏与虚拟人应用需要为角色生成符合人设的语音,利用音色设计和音色克隆定制独特声线。音频标签可控制台词中的情绪起伏与声音动作,提升角色表现力。
面向开发者与企业按生成字符数或调用次数收费,提供免费额度用于试用。根据模型类型(预置音色、音色设计、音色克隆)设定差异化价格,满足不同精度需求。
提供开箱即用的在线语音合成工作台,集成音色库、文本编辑、批量生成与导出功能。按月或按年订阅,面向中小创作者和团队提供不同档位套餐。
为大型企业提供私有化部署、专属音色克隆、品牌语音资产管理与系统集成服务。包含技术实施、定制开发和持续运维支持,按项目或年度收取服务费。
💬 Integration Tip
使用前需配置MIMO_API_KEY并安装openai和python3依赖,长文本拼接场景建议额外安装ffmpeg;调用前请将$SKILLS_PATH替换为实际部署路径,并通过--context参数传入自然语言指令以获得更佳效果。
Scored Oct 7, 2026
Transcribe audio files with speaker diarization (who speaks when). Supports 100+ languages, automatic language detection, and timestamps. Use for meetings, interviews, podcasts, or voice messages. Requires AssemblyAI API key.
使用 poocr 库识别发票并导出 Excel。当用户需要识别增值税发票、批量处理发票文件或提取发票信息到 Excel 时调用此技能。
Use when the user has audio or video and wants a timestamped transcript (SRT) in the source language. Routes by source language — Chinese defaults to Volcano...
Create, manage, and deploy ElevenLabs conversational AI agents. Use when the user wants to work with voice agents, list their agents, create new ones, or manage agent configurations.
Voice note transcription and archival for OpenClaw agents. Powered by Deepgram Nova-3. Transcribes audio messages, saves both audio files and text transcript...
Text-to-Speech (TTS) and Speech-to-Text (ASR) using coze-coding-dev-sdk. Returns results directly to stdout.