将音频或视频中的语音转成文字,并可区分说话人与整理访谈记录。
整体风险较低。该技能来自高可信开源仓库且社区采用广,但文档中提到会调用 OpenAI 转写 CLI/API、读取本地音频并生成输出,因此相关维度更适合评为需留意而非高风险。
元数据称“无密钥/环境变量”,但 README 明确要求设置 OPENAI_API_KEY 才能进行实时 API 调用;该密钥属于敏感凭证,若在本机环境中配置不当可能被其他进程或日志暴露。文档同时明确不要在聊天中粘贴完整密钥,降低了直接泄露风险。
材料显示该技能用于“using OpenAI”进行转写,说明音频内容及可选说话人参考音频在启用实时调用时会发送至 OpenAI 服务。未声明其他第三方端点,且来源仓库可信,因此属于与声明功能一致的常规外发风险。
README 指示通过 python3 运行 bundled CLI(transcribe_diarize.py),并在缺失依赖时安装 openai 包;这意味着会在本机执行脚本并可能触发依赖安装。此类本地进程执行属于工具常规能力,材料中未见请求越权系统权限的红旗。
该技能需要读取用户提供的音频/视频文件路径、可选的已知说话人参考文件,并将结果写入 output/transcribe/ 或用户指定输出路径。访问范围与其转写/分离说话人功能相匹配,未见要求广泛扫描无关目录或过度授权。
来源为 GitHub 上的 openai/skills 开源仓库,具备可审计源码且社区采用度高(约 2.2 万 star),这是明显的正面信号。许可证与维护状态在所给材料中未明确,但不足以抵消其官方/高信任来源带来的低风险判断。
复制安装指令,让 AI 自动完成配置 · 推荐新手
请帮我安装 askskill 上的 "transcribe" 技能: 1. 下载 https://raw.githubusercontent.com/openai/skills/main/skills/.curated/transcribe/SKILL.md 2. 保存为 ~/.claude/skills/transcribe/SKILL.md 3. 装好后重载技能,告诉我可以用了
Transcribe audio using OpenAI, with optional speaker diarization when requested. Prefer the bundled CLI for deterministic, repeatable runs.
OPENAI_API_KEY is set. If missing, ask the user to set it locally (do not ask them to paste the key).transcribe_diarize.py CLI with sensible defaults (fast text transcription).output/transcribe/ when working in this repo.gpt-4o-mini-transcribe with --response-format text for fast transcription.--model gpt-4o-transcribe-diarize --response-format diarized_json.--chunking-strategy auto.gpt-4o-transcribe-diarize.output/transcribe/<job-id>/ for evaluation runs.--out-dir for multiple files to avoid overwriting.Prefer uv for dependency management.
uv pip install openai
If uv is unavailable:
python3 -m pip install openai
OPENAI_API_KEY must be set for live API calls.export CODEX_HOME="${CODEX_HOME:-$HOME/.codex}"
export TRANSCRIBE_CLI="$CODEX_HOME/skills/transcribe/scripts/transcribe_diarize.py"
User-scoped skills install under $CODEX_HOME/skills (default: ~/.codex/skills).
Single file (fast text default):
python3 "$TRANSCRIBE_CLI" \
path/to/audio.wav \
--out transcript.txt
Diarization with known speakers (up to 4):
python3 "$TRANSCRIBE_CLI" \
meeting.m4a \
--model gpt-4o-transcribe-diarize \
--known-speaker "Alice=refs/alice.wav" \
--known-speaker "Bob=refs/bob.wav" \
--response-format diarized_json \
--out-dir output/transcribe/meeting
Plain text output (explicit):
python3 "$TRANSCRIBE_CLI" \
interview.mp3 \
--response-format text \
--out interview.txt
references/api.md: supported formats, limits, response formats, and known-speaker notes.一键串联暂存、提交、推送并用 GitHub CLI 创建拉取请求。
帮助用户生成或编辑位图图像,用于插画、照片、贴图与透明抠图等视觉素材。
用于为 Codex 快速创建并搭建插件目录、配置文件与市场清单条目。
帮助用户创建或更新技能,扩展 Codex 的知识、流程与工具能力
帮助用户从精选列表或 GitHub 仓库安装 Codex 技能到本地环境。
帮助用户在 Linear 中查看、创建和更新工单、项目与团队流程。
帮助用户检索录音内容、总结会议要点并自动生成剪辑与流程。
将音频自动转写为含说话人、时间戳、摘要和行动项的结构化文档
帮助你检索播客节目并获取带真实说话人姓名的整洁转录稿。
将音视频与播客批量转写为带说话人和时间轴的字幕文本。
将音频转写为文本并区分说话人,便于整理会议与访谈内容。
通过 OpenAI 音频转写接口,将语音录音快速转成文本或说话人分段结果。