本地高精度语音转文字

openai-whisper

OpenAI Whisper CLI 本地语音转文字工具,无需 API 密钥,纯离线运行

1.0.0版本 S+安全等级 Codex / 编程支持工具
01 场景说明

什么时候用这个 Skill?

核心用法

openai-whisper 是一款基于 OpenAI Whisper 模型的本地语音转文字 CLI 工具封装 Skill。用户通过简单的命令行指令即可完成音频转录:

  • 基础转录whisper /path/audio.mp3 --model medium --output_format txt --output_dir .
  • 翻译模式whisper /path/audio.m4a --task translate --output_format srt

首次运行会自动下载模型到 ~/.cache/whisper,默认使用 turbo 模型以平衡速度与精度。支持多种输出格式(txt/srt/json等)和大小模型切换(tiny/base/small/medium/large/turbo)。

显著优点

  1. 完全本地运行:无需联网、无需 API Key,保护隐私数据不外流
  2. 多语言支持:Whisper 原生支持 99 种语言的语音识别与翻译
  3. 高精度转录:large-v3 模型在多数基准测试中达到人类级准确率
  4. 零成本:开源免费,无按量计费或订阅费用
  5. 格式灵活:支持 mp3/wav/m4a/flac 等主流音频格式,输出字幕/纯文本/时间戳

潜在局限

  • 硬件要求:大模型(large)需 10GB+ 显存或充足内存,低配设备仅能运行 tiny/base
  • 初次下载:模型文件 1-3GB,首次使用需等待下载
  • 实时性:非流式架构,需等待完整音频处理,不适合实时会议字幕
  • 依赖管理:需用户自行维护本地 whisper 安装版本

适合人群

  • 隐私敏感用户(医疗/法律/金融转录场景)
  • 播客/视频创作者需要批量生成字幕
  • 研究者处理采访录音或会议记录
  • 无稳定网络环境或 API 预算限制的用户

常规风险

  • 转录质量受音频清晰度、背景噪音、口音影响
  • 敏感内容转录后需人工复核,模型可能产生幻觉式错误
  • 大型模型运行时风扇噪音与电池消耗显著
场景分类:coding speech-to-textaudio-transcriptionopenailocal-aicli-toolprivacy-firstmultilingualsubtitle-generationoffline
02 使用方式

简单 3 步,立即在 AI 工具中使用

  1. 1

    获取 Skill 文件

    通过国内网盘直链下载解压包,或使用上方安装指令。

    去下载资源
  2. 2

    导入你的 AI 工具

    在 Cursor / QoderWork / TRAE / Claude 等工具的 Skills 入口导入。

    复制安装指令
  3. 3

    用普通话描述任务

    直接说出你的需求,AI 会自动按此 Skill 预设流程落地结果。

快捷方式

复制给 Agent 自动安装

选择你在用的工具,复制下方指令粘贴给 AI,AI 会先说明用途和权限,自动完成安装。

本地高精度语音转文字复制给 AI 自动安装
03 风险与前置

使用前注意事项与安全等级

安全等级 S+:尚未完成完整验证,安装和联网操作前请先看安全说明。 ## 核心用法 `openai-whisper` 是一款基于 OpenAI Whisper 模型的本地语音转文字 CLI 工具封装 Skill。用户通过简单的命令行指令即可完成音频转录: - **基础转录**:`whisper /path/audio.mp3 --model medium --output_format txt --output_dir .` - **翻译模式**:`whisper /path/audio.m4a --task translate --output_format srt` 首次运行会自动下载模型到 `~/.cache/whisper`,默认使用 `turbo` 模型以平衡速度与精度。支持多种输出格式(txt/srt/json等)和大小模型切换(tiny/base/small/medium/large/turbo)。 ## 显著优点 1. **完全本地运行**:无需联网、无需 API Key,保护隐私数据不外流 2. **多语言支持**:Whisper 原生支持 99 种语言的语音识别与翻译 3. **高精度转录**:large-v3 模型在多数基准测试中达到人类级准确率 4. **零成本**:开源免费,无按量计费或订阅费用 5. **格式灵活**:支持 mp3/wav/m4a/flac 等主流音频格式,输出字幕/纯文本/时间戳 ## 潜在局限 - **硬件要求**:大模型(large)需 10GB+ 显存或充足内存,低配设备仅能运行 tiny/base - **初次下载**:模型文件 1-3GB,首次使用需等待下载 - **实时性**:非流式架构,需等待完整音频处理,不适合实时会议字幕 - **依赖管理**:需用户自行维护本地 whisper 安装版本 ## 适合人群 - 隐私敏感用户(医疗/法律/金融转录场景) - 播客/视频创作者需要批量生成字幕 - 研究者处理采访录音或会议记录 - 无稳定网络环境或 API 预算限制的用户 ## 常规风险 - 转录质量受音频清晰度、背景噪音、口音影响 - 敏感内容转录后需人工复核,模型可能产生幻觉式错误 - 大型模型运行时风扇噪音与电池消耗显著


report_id: CLS-2026-0502-WHISPER
report_date: "2026-05-02T02:37:17Z"
scanner_version: CLS-Certify v2.1.0
scan_mode: Full Scan
skill_name: openai-whisper
skill_version: 1.0.0
skill_path: /tmp/bss_skill_z2hn9q51
maintainer: steipete
license: Unknown
trust_level: T1
trust_level_text: 知名公司/顶级开源基金会 (OpenAI)
scan_duration: 15s
code_stats: 2 files · 24 lines · 858 bytes
grade: S+
score: 98
evaluation: 顶级安全级别。纯文档型 Skill,无可执行代码,无敏感数据泄露风险。唯一外部链接指向 OpenAI 官方研究页面(可信域名)。由顶级开源基金会(OpenAI)维护,具备完整的供应链可追溯性。
stamp_color: green
total_风险发现: 0
radar:

  • name: 静态代码分析
    short: 静态
    score: 100
    status: pass
    detail: 无可执行代码,仅 Markdown 文档
  • name: 动态行为分析
    short: 动态
    score: 100
    status: pass
    detail: T-MD 分类,跳过动态分析(无可执行代码)
  • name: 依赖审计
    short: 依赖
    score: 100
    status: pass
    detail: 无第三方依赖
  • name: 网络流量分析
    short: 网络
    score: 95
    status: pass
    detail: 1 个外部链接指向 openai.com(可信域名)
  • name: 隐私合规检查
    short: 隐私
    score: 100
    status: pass
    detail: 无数据收集行为
  • name: 威胁情报
    short: 情报
    score: 100
    status: pass
    detail: 来源可信(OpenAI T1 级别)

compliance:

  • text: GDPR 数据最小化原则
    status: pass
  • text: 无敏感数据硬编码
    status: pass
  • text: 无动态代码加载
    status: pass
  • text: 权限申请合理性
    status: pass
  • text: 供应链可追溯性
    status: pass
  • text: 无已知恶意模式
    status: pass

sample_hash: sha256:d70fd1c2bdaac8fb9dbbe3c8663020a2a3ae4ecceb9ac9c17e903ae044aa0da5

disclaimer: 本认证结果仅反映检测时刻的安全状态,不代表对未来版本的保证。BSS 认证报告生成于 2026-05-02,有效期建议不超过 90 天。

风险模式

  • <span class="pattern-tag low">纯文档型 Skill (T-MD)</span>
  • <span class="pattern-tag low">无可执行代码</span>
  • <span class="pattern-tag low">T1 来源可信度</span>
  • <span class="pattern-tag low">开源基金会背书</span>
  • <span class="pattern-tag low">本地语音转文字工具</span>

分析摘要

  1. 纯文档型 Skill:该 Skill 仅包含 Markdown 文档和元数据文件,无任何可执行代码,风险极低。
  2. 知名来源:Skill 描述指向 OpenAI 官方 Whisper 项目,属于顶级开源基金会(T1 级别)维护的知名开源项目。
  3. 无可疑外部链接:唯一外部链接指向 openai.com/research/whisper,为 OpenAI 官方研究页面,域名信誉良好。
  4. 无数据收集:Skill 本身不收集任何用户数据,所有处理均在本地通过 whisper CLI 完成。
  5. 功能透明:Skill 明确声明为本地语音转文字工具,功能与描述完全一致,无隐藏行为。

外部接口

EndpointMethodReputationEncryptionData TypesProvider
https://openai.com/research/whisperN/A (Documentation)TrustedTLS 1.3NoneOpenAI

风险发现

未发现安全风险

改进建议

1. 保持当前安全级别

描述: 该 Skill 当前评级为 S+(顶级安全),无任何需要改进的安全问题。建议保持现有实现方式,不添加不必要的可执行代码或外部依赖。

2. 建议添加许可证声明

描述: 当前 Skill 元数据中未包含许可证信息。建议在 _meta.json 或 SKILL.md 中添加开源许可证声明(如 MIT、Apache 2.0 等),以进一步明确使用条款。

3. 持续监控依赖更新

描述: 虽然当前 Skill 本身无依赖,但 Skill 依赖用户本地安装的 whisper CLI 工具。建议用户保持 whisper 工具更新至最新版本,以获取安全补丁和模型改进。

04 会员优势

国内网盘直下载与运维维护

国内网盘直下载

百度/夸克直链转存,无需翻墙或挂代理。

国内镜像与版本固定

固定有效版本,经过实测排查,避免代码变动导致失效。

失效自动补链

专人维护网盘地址,发现链接失效 24h 内完成补链。

更新提醒与省心省时

随时获取最新修复说明,帮非技术用户节省大把调优时间。

源码与文件预览(1 个文件)
/SKILL.md
正在加载代码…