通过 OpenAI 音频转写接口,将语音录音快速转成文本或说话人分段结果。
整体看这是一个低复杂度的本地技能,主要通过脚本调用转录接口;未见明显的凭证滥用、可疑注入或超范围系统权限迹象。由于会读取本地音频并可能向配置的 OpenAI 兼容端点发送内容,属于常规需留意而非高风险。
需要 OPENAI_API_KEY,或从 OpenClaw 配置文件读取 apiKey;这是常规密钥使用,材料未显示额外凭证收集或泄露迹象。
会把音频上传到 /v1/audio/transcriptions,并可通过 OPENAI_BASE_URL 指向 OpenAI 兼容代理或本地网关;存在用户音频外发,但端点是声明中的已知目标。
README 显示通过 scripts/transcribe.sh 本地执行脚本完成转录;属于技能/工具的常规本机进程执行能力,未见额外系统权限申请。
脚本读取用户指定的本地音频文件并默认输出 .txt/.json 到本地路径;访问范围看起来仅限于用户提供的输入与输出文件。
来源为 GitHub 开源仓库且社区星标很高,通常降低供应链疑虑;但许可证未声明、维护状态未知,仍建议按可审计但需留意处理。
复制安装指令,让 AI 自动完成配置 · 推荐新手
请帮我安装 askskill 上的 "openai-whisper-api" 技能: 1. 下载 https://raw.githubusercontent.com/openclaw/openclaw/main/skills/openai-whisper-api/SKILL.md 2. 保存为 ~/.claude/skills/openai-whisper-api/SKILL.md 3. 装好后重载技能,告诉我可以用了
请用 openai-whisper-api 把这段会议录音转写为中文文本,按自然段整理,并保留时间顺序。
一份可阅读的中文会议转写稿,内容按顺序整理。
请用 openai-whisper-api 处理这段采访音频,输出带说话人区分的转写结果,并标注每段是谁在说话。
一份包含说话人标签的采访逐段转写文本。
请用 openai-whisper-api 将这段英文播客转写成英文文本,尽量保留专有名词,供后续做摘要和内容整理。
一份较准确的英文播客转写文本,可继续用于摘要或编辑。
Transcribe audio through /v1/audio/transcriptions. Set OPENAI_BASE_URL for an OpenAI-compatible proxy or local gateway.
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a
Defaults:
gpt-4o-transcribe<input>.txt{baseDir}/scripts/transcribe.sh /path/to/audio.ogg --model gpt-4o-transcribe --out /tmp/transcript.txt
{baseDir}/scripts/transcribe.sh /path/to/audio.ogg --model gpt-4o-mini-transcribe
{baseDir}/scripts/transcribe.sh /path/to/audio.ogg --model gpt-4o-transcribe-diarize --json
{baseDir}/scripts/transcribe.sh /path/to/audio.ogg --model whisper-1
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --language en
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --prompt "Speaker names: Peter, Daniel"
{baseDir}/scripts/transcribe.sh /path/to/audio.m4a --json --out /tmp/transcript.json
Notes:
mp3, mp4, mpeg, mpga, m4a, wav, webm.chunking_strategy=auto and rejects --prompt.Set OPENAI_API_KEY, or configure it in the active OpenClaw config file ($OPENCLAW_CONFIG_PATH, default ~/.openclaw/openclaw.json). Optionally set OPENAI_BASE_URL:
{
skills: {
"openai-whisper-api": {
apiKey: "OPENAI_KEY_HERE",
},
},
}
帮助你创建、整理、校验并重构 AgentSkills 与 SKILL.md 技能文件。
为 OpenClaw 代理创建的 GitHub PR 或议题自动添加脱敏执行记录。
帮助用户进行网页搜索、内容提取与研究资料整理,快速获取可靠信息。
快速搭建一次性原型,验证方案可行性并给出对比结论。
帮助用户编写、理解与调试 Lobster 编程语言代码。
帮助用户管理飞书云空间中的文件、文件夹与存储内容。
使用本地 Whisper CLI 将音频语音快速转成文本,无需 API 密钥。
将音频或视频中的语音转成文字,并可区分说话人与整理访谈记录。
将音频快速转写为多语言文本,并可结合 GPT 做后处理优化。
将音频转写为文本并区分说话人,便于整理会议与访谈内容。
将音频自动转写为含说话人、时间戳、摘要和行动项的结构化文档
使用本地语音识别与说话人分离,快速生成多角色音频转写文本。