xia-zhuan-audio🎵 音视频格式转换与处理工具箱。基于 FFmpeg + Whisper AI,支持:格式转换、视频提取音频、合并、分割、压缩、查看信息、音频转文字。
Install via ClawdBot CLI:
clawdbot install luis1213899/xia-zhuan-audioGrade Limited — based on market validation, documentation quality, package completeness, maintenance status, and authenticity signals.
Calls external URL not in known-safe list
https://github.com/luis12123899/xia-zhuan-audioAudited Apr 16, 2026 · audit v1.0
Generated May 8, 2026
用户需要将大量不同格式的音视频文件(如m4a、wav、mp4)统一转换为mp3或flac等通用格式,以便在特定设备或软件上播放。支持超过20种格式,可设置码率。
录制视频会议后,提取音频并使用Whisper AI自动转写为文字,生成txt或srt字幕文件,便于存档、搜索或翻译。支持多语言和多种模型精度选择。
播客创作者需要合并多个录音片段、截取特定时间段、调整音质压缩大小,以及将最终音频转换为平台要求的格式。一站式完成剪辑和后期处理。
图书馆或档案馆需将老旧音频格式(如ape、wma)转换为标准格式(如flac),并提取元数据信息(时长、码率等),以便长期保存和分类管理。
在线教育平台需将教学视频中的音频单独提取,转换为低码率mp3供学生离线收听,同时将课堂录音转文字生成讲义。支持批量和自动化处理。
提供云端音视频处理服务,用户按需订阅,按处理时长或文件大小计费。可集成到第三方平台,如在线课程制作工具或社交媒体管理后台。
核心功能开源免费,但提供高级功能(如高速转码、优先技术支持、whisper模型优化)的付费版本。类似GitHub Sponsors或Open Collective模式。
将音视频处理能力封装成RESTful API,供开发者调用。按API调用次数或处理时长收费。适合集成到自动化工作流、移动应用或聊天机器人中。
💬 Integration Tip
建议通过OpenClaw的自然语言界面使用,无需编写命令;若需自动化,可调用命令行接口,并设置环境变量如XZA_FFMPEG指定FFmpeg路径。
Scored May 8, 2026
Local speech-to-text with the Whisper CLI (no API key).
Transcribe audio files with speaker diarization (who speaks when). Supports 100+ languages, automatic language detection, and timestamps. Use for meetings, interviews, podcasts, or voice messages. Requires AssemblyAI API key.
Turn your AI into JARVIS. Voice, wit, and personality — the complete package. Humor cranked to maximum.
Text-to-speech conversion using node-edge-tts npm package for generating audio from text. Supports multiple voices, languages, speed adjustment, pitch contro...
使用 poocr 库识别发票并导出 Excel。当用户需要识别增值税发票、批量处理发票文件或提取发票信息到 Excel 时调用此技能。
Use when the user has audio or video and wants a timestamped transcript (SRT) in the source language. Routes by source language — Chinese defaults to Volcano...