Adoption

Agent Skills are supported by leading AI development tools.

VS Code Gemini CLI GitHub Goose Amp Cursor Claude Code Letta OpenCode Claude OpenAI Codex Factory VS Code Gemini CLI GitHub Goose Amp Cursor Claude Code Letta OpenCode Claude OpenAI Codex Factory

nuva-lab/transcribe-audio

Name: transcribe-audio
Author: nuva-lab

skills/transcribe-audio/SKILL.md

npx skillsauth add nuva-lab/vibecut transcribe-audio

Clean

TrivyContainer and dependency vulnerability scanner

Clean

SemgrepStatic code analysis for vulnerabilities

Clean

mcp-scan (Snyk)Model Context Protocol security validation

Skipped

Snyk (dep)Open source security scanning

Skipped

Socket.devSupply chain security analysis

Skipped

VirusTotalMulti-engine malware detection

Skipped

CrowdStrikeAdvanced threat intelligence

Skipped

OSV-ScannerOpen Source Vulnerability database check

Skipped

OWASP Dep-Check

transcribe-audio

Transcribe audio/video files with precise timestamps using Qwen3-ASR and Qwen3-ForcedAligner. Runs on CPU for maximum quality.

Models

| Model | Purpose | Precision | |-------|---------|-----------| | Qwen3-ASR-1.7B | Speech recognition (52 languages) | SOTA accuracy | | Qwen3-ForcedAligner-0.6B | Timestamp alignment | ~30ms |

Usage

# Full transcription with timestamps (default)
python skills/transcribe-audio/transcribe.py audio.wav

# Save to file
python skills/transcribe-audio/transcribe.py audio.wav --output captions.json

# Specify language (auto-detects if not specified)
python skills/transcribe-audio/transcribe.py audio.wav --language Chinese

# Fast mode (no timestamps)
python skills/transcribe-audio/transcribe.py audio.wav --no-timestamps

# Align existing text to audio (ForcedAligner only)
python skills/transcribe-audio/transcribe.py audio.wav --align-text "Your transcript text here"

Output Format

Compatible with Remotion captions.json:

{
  "segments": [
    {"text": "当", "startMs": 0, "endMs": 150},
    {"text": "全", "startMs": 150, "endMs": 280},
    {"text": "世界", "startMs": 280, "endMs": 520},
    ...
  ],
  "full_text": "当全世界都在追AI的时候...",
  "language": "Chinese",
  "model": "Qwen3-ASR-1.7B",
  "aligner": "Qwen3-ForcedAligner-0.6B"
}

Two Modes

1. Transcription Mode (default)

Transcribes audio and aligns timestamps:

python transcribe.py audio.wav

2. Alignment Mode

Use when you already have the transcript:

python transcribe.py audio.wav --align-text "已知的文字内容"

This skips ASR and uses ForcedAligner directly for ~30ms precision.

Programmatic Usage

from transcribe import transcribe_audio, transcribe_and_align

# Full transcription with timestamps
result = transcribe_audio("audio.wav", language="Chinese")
print(result["segments"])  # Word-level timestamps

# Align existing text
result = transcribe_and_align("audio.wav", text="已知的文字", language="Chinese")
print(result["segments"])  # ~30ms precision timestamps

Notes

First run downloads model weights (~3GB for ASR, ~1GB for Aligner)
Runs on CPU by default (quality first)
Supports 52 languages including Chinese dialects
ForcedAligner achieves ~30ms average absolute shift (SOTA)
For best results, use WAV or high-quality audio

nuva-lab/transcribe-audio

skills/transcribe-audio/SKILL.md

ASR with ~30ms timestamp precision using Qwen3-ASR + ForcedAligner

5 stars

testing

Updated Apr 9, 2026

$ install --global

skillsauth

npx skillsauth add nuva-lab/vibecut transcribe-audio

Install this skill globally with one command. Works with Claude Code, Cursor, and Windsurf.

Security Scan Results

3 of 9 scanners reported clean

Some scanners were skipped, did not run, or reported a non-clean status. Review each row below.

Scanners Passed

Scanners in report

Clean

TrivyContainer and dependency vulnerability scanner

95%

Clean

SemgrepStatic code analysis for vulnerabilities

95%

Clean

mcp-scan (Snyk)Model Context Protocol security validation

95%

Skipped

Snyk (dep)Open source security scanning

50%

Skipped

Socket.devSupply chain security analysis

50%

Skipped

VirusTotalMulti-engine malware detection

50%

Skipped

CrowdStrikeAdvanced threat intelligence

50%

Skipped

OSV-ScannerOpen Source Vulnerability database check

50%

Skipped

OWASP Dep-Check

50%

Last scanned: Apr 9, 2026, 2:20 AM6.7s2 files scanned

SKILL.md

name:: transcribe-audio
description:: ASR with ~30ms timestamp precision using Qwen3-ASR + ForcedAligner

transcribe-audio

Transcribe audio/video files with precise timestamps using Qwen3-ASR and Qwen3-ForcedAligner. Runs on CPU for maximum quality.

Models

Usage

# Full transcription with timestamps (default)
python skills/transcribe-audio/transcribe.py audio.wav

# Save to file
python skills/transcribe-audio/transcribe.py audio.wav --output captions.json

# Specify language (auto-detects if not specified)
python skills/transcribe-audio/transcribe.py audio.wav --language Chinese

# Fast mode (no timestamps)
python skills/transcribe-audio/transcribe.py audio.wav --no-timestamps

# Align existing text to audio (ForcedAligner only)
python skills/transcribe-audio/transcribe.py audio.wav --align-text "Your transcript text here"

Output Format

Compatible with Remotion captions.json:

{
  "segments": [
    {"text": "当", "startMs": 0, "endMs": 150},
    {"text": "全", "startMs": 150, "endMs": 280},
    {"text": "世界", "startMs": 280, "endMs": 520},
    ...
  ],
  "full_text": "当全世界都在追AI的时候...",
  "language": "Chinese",
  "model": "Qwen3-ASR-1.7B",
  "aligner": "Qwen3-ForcedAligner-0.6B"
}

Two Modes

1. Transcription Mode (default)

Transcribes audio and aligns timestamps:

python transcribe.py audio.wav

2. Alignment Mode

Use when you already have the transcript:

python transcribe.py audio.wav --align-text "已知的文字内容"

This skips ASR and uses ForcedAligner directly for ~30ms precision.

Programmatic Usage

from transcribe import transcribe_audio, transcribe_and_align

# Full transcription with timestamps
result = transcribe_audio("audio.wav", language="Chinese")
print(result["segments"])  # Word-level timestamps

# Align existing text
result = transcribe_and_align("audio.wav", text="已知的文字", language="Chinese")
print(result["segments"])  # ~30ms precision timestamps

Notes

First run downloads model weights (~3GB for ASR, ~1GB for Aligner)
Runs on CPU by default (quality first)
Supports 52 languages including Chinese dialects
ForcedAligner achieves ~30ms average absolute shift (SOTA)
For best results, use WAV or high-quality audio

Related Skills

nuva-lab/write-script

tools

VerifiedTrustedCommunity

Generate voiceover scripts in Joyce's style for video clips

5SKILL.mdUpdated Apr 9, 2026

nuva-lab/write-script

nuva-lab/voice-clone

tools

VerifiedTrustedCommunity

Clone a voice using qwen3-tts and generate speech from text

5SKILL.mdUpdated Apr 9, 2026

nuva-lab/skills/validate-media

development

VerifiedTrustedCommunity

# Validate Media Skill Pre-flight media validation and diagnostics using ffprobe. ## Purpose Check video/audio files for common issues before rendering: - Duration mismatches between video and audio tracks - Missing audio tracks - Codec compatibility - Volume levels - Potential freeze points ## Usage ```bash python skills/validate-media/validate.py <video_file> [--verbose] ``` ## Output JSON report with issues and recommendations: ```json { "file": "video.mp4", "video_duration": 35.1

5SKILL.mdUpdated Apr 9, 2026

nuva-lab/skills/validate-media

nuva-lab/transcribe-clip

tools

VerifiedTrustedCommunity

Transcribe a video clip using Gemini to get timestamped segments for captions

5SKILL.mdUpdated Apr 9, 2026

nuva-lab/transcribe-clip

Download

For Claude Desktop. Download once, then upload the file in the app — no terminal needed.

Need help? View full Cowork setup guide →

Install manually

Choose your platform

# Clone the repo
git clone https://github.com/nuva-lab/vibecut.git

# Copy into Claude Code skills folder (global)
cp -r vibecut/skills/transcribe-audio ~/.claude/skills/

Claude Code Skills — official skills path docs.

Repository

nuva-lab/vibecut

5 stars

Compatible with

Claude Code

OpenAI Codex CLI

ChatGPT