byted-voice-to-text语音转文字(ASR)。使用火山引擎 BigModel ASR 识别语音,包含极速版(≤2h/100MB 同步快速返回)和标准版(≤5h 异步识别)两种模式。支持飞书语音消息、本地音频文件及音频 URL。当收到语音消息或音频附件(.ogg/.mp3/.wav)时使用本技能。
Install via ClawdBot CLI:
clawdbot install volcengine-skills/byted-voice-to-textGrade Fair — based on market validation, documentation quality, package completeness, maintenance status, and authenticity signals.
Calls external URL not in known-safe list
https://www.volcengine.com/docs/6561/1354870Uses known external API (expected, informational)
open.feishu.cnAudited Apr 16, 2026 · audit v1.0
Generated Jul 12, 2026
在飞书群聊或机器人对话中,当用户发送语音消息(ogg格式),技能自动下载并调用极速版ASR在数秒内返回文字,识别准确率高,支持多语言,适合内部协作场景。
用户提供本地或URL音频文件(MP3/WAV/OGG),系统根据时长和大小自动选择极速版(≤2h/100MB)或标准版(≤5h)进行识别,输出文字结果。适用于会议记录、采访整理等场景。
在客服平台中集成该技能,客户上传语音问题或发送语音消息,系统自动转文字并触发后续处理,提升客服效率。
利用火山引擎ASR的多语言能力,将外语语音文件(如英文、日文)转为文字,进一步用于翻译、情感分析或内容审核。
对于超过5小时的音频(如讲座、课程),技能指导用户切片后逐段调用极速版ASR,实现长音频的完整转录。
火山引擎ASR按调用量收费,技能本身开源,可嵌入SaaS产品中,根据用量向终端用户收费。
在企业协作工具中作为高级功能,如飞书机器人订阅付费后自动转录语音消息,提供高准确率识别。
集成到内容生产平台,帮助播客、视频创作者快速生成字幕或文字稿,节省人工听写成本。
💬 Integration Tip
确保设置MODEL_SPEECH_API_KEY环境变量,并在使用前运行inspect_audio.py探测音频属性以选择合适的ASR模式。
Scored Jul 12, 2026
Local speech-to-text with the Whisper CLI (no API key).
Transcribe audio files with speaker diarization (who speaks when). Supports 100+ languages, automatic language detection, and timestamps. Use for meetings, interviews, podcasts, or voice messages. Requires AssemblyAI API key.
Secure, offline, OpenAI-compatible local Whisper ASR endpoint for OpenClaw. Features faster-whisper (large-v3-turbo), built-in privacy with no cloud telemetr...
Turn your AI into JARVIS. Voice, wit, and personality — the complete package. Humor cranked to maximum.
Text-to-speech conversion using node-edge-tts npm package for generating audio from text. Supports multiple voices, languages, speed adjustment, pitch contro...
使用 poocr 库识别发票并导出 Excel。当用户需要识别增值税发票、批量处理发票文件或提取发票信息到 Excel 时调用此技能。