Install any skill in seconds. Free to start, no credit card required.
Get Started Free →통합 오디오 생성 스킬. ElevenLabs MCP 기반 TTS(32개국어), 보이스 클로닝(1분 샘플), 다국어 더빙(립싱크), 효과음 생성을 지원. "목소리 생성", "TTS", "음성 합성", "보이스 클로닝", "더빙", "나레이션", "효과음", "AI 음성" 요청 시 사용.
.claude/skills/modu-ai-audio-gen/SKILL.md| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-01 | ✗→✓ | ▲ Improved | 113% | 0% |
| case-03 | ✗→✓ | ▲ Improved | 18% | 0% |
| case-05 | ✗→✓ | ▲ Improved | -4% | 0% |
| case-07 | ✗→✓ | ▲ Improved | 49% | 0% |
| case-08 | ✗→✓ | ▲ Improved | 22% | 0% |
AI 기반 오디오 생성을 위한 통합 스킬입니다. ElevenLabs의 고성능 TTS 엔진을 활용하여 32개국어(한국 포함)의 자연스러운 음성을 생성하고, 단 1분의 샘플로 개인/브랜드 보이스를 클로닝합니다. 또한 비디오 다국어 더빙(립싱크 자동), 효과음 생성, 실시간 대화형 AI 보이스 에이전트 구축을 지원합니다.
다음 요청 시 이 스킬을 사용하세요:
1. 텍스트 입력 (한국/영어/32개국어)
2. 보이스 프리셋 선택 또는 커스텀 보이스 ID 지정
3. 모델 선택 (eleven_multilingual_v2 기본)
4. 오디오 생성 (MP3/WAV)1. 참조 오디오 업로드 (1분 이상, 무음 최소화)
2. 보이스 이름/설명 입력
3. 클로닝 실행 → 보이스 ID 발급
4. TTS에서 클로닝된 보이스 사용1. 원본 비디오 업로드
2. 원본 언어 감지 (예: 한국어)
3. 타겟 언어 선택 (예: 영어, 일본어, 스페인어)
4. 자동 번역 + 보이스 생성 + 립싱크 매칭
5. 더빙된 비디오 다운로드1. 효과음 설명 프롬프트 작성 (예: "천둥소리, 폭풍우")
2. 지속시간 설정 (1~30초)
3. 생성 및 다운로드"이 블로그 글을 한국어 나레이션으로 읽어줘.
여성 차분한 톤으로, 3분 분량."
→ 보이스: Rachel (여성 차분)
→ 모델: eleven_multilingual_v2
→ 출력: MP3 파일"우리 CEO의 1분 연설 음원이 있어.
이 목소리를 클로닝해서 신제품 발표 나레이션을 만들어줘."
→ 참조: ceo_sample.wav
→ 출력: 클로닝된 보이스 ID + 나레이션 MP3"이 한국어 교육 영상을 영어와 일본어로 더빙해줘.
원본 자막은 유지하고, 립싱크도 맞춰줘."
→ 입력: korean_tutorial.mp4
→ 출력: english_dub.mp4, japanese_dub.mp4"판타지 게임용 마법 시전 효과음 3개 만들어줘.
1. 화염구 (2초)
2. 얼음 폭발 (3초)
3. 치유 빛 (2.5초)"
→ 출력: fireball.wav, ice_explosion.wav, heal_light.wavvoices/xxxxx 형식ELEVENLABS_API_KEY 환경변수가 필요합니다.
.env 또는 시스템 환경변수에 등록:bash export ELEVENLABS_API_KEY="your_api_key_here"
| 플랜 | 가격 | 문자 수 | 사용처 | |------|------|---------|--------| | Free | $0 | 10,000자/월 | 테스트, 개인 프로젝트 | | Starter | $5/월 | 30,000자/월 | 소규모 콘텐츠 | | Creator | $22/월 | 100,000자/월 | 유튜버, 프리랜서 | | Pro | $99/월 | 500,000자/월 | 앱 통합, 상업적 사용 |
| 모델 | 성격 | 용도 | 비고 | |------|------|------|------| | eleven_multilingual_v2 | 최고 품질 | 브랜딩, 광고, 나레이션 | 한국어 최적화, 권장 | | eleven_flash_v2_5 | 초저지연 | 실시간 대화, 게임 | 200ms 미만 | | eleven_turbo_v2_5 | 비용 효율 | 장문 나레이션, 대량 생성 | 50% 저렴 |
| 코드 | 성격 | 톤 | 사용처 | |------|------|-----|--------| | Rachel | 여성 차분 | 내레이터 | 다큐, 뉴스, 교육 | | Antoni | 남성 친근 | 대화형 | 인터뷰, 팟캐스트 | | Bella | 여성 발랄 | 에너지틱 | 광고, 홍보영상 | | Callum | 남성 중립 | 전문·내레이터 | 보고서, 프레젠테이션 |
이 스킬은 ElevenLabs MCP (stdio)를 사용합니다.
json{ "elevenlabs": { "command": "/bin/bash", "args": ["-l", "-c", "exec uvx elevenlabs-mcp"], "env": { "ELEVENLABS_API_KEY": "${ELEVENLABS_API_KEY}" } } }
MCP 서버 등록 절차: moai-media/CONNECTORS.md 참조.
| Case | Status | Duration (ms) | Turns | Tokens | Tool calls | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Without | With | Δ | Without | With | Δ | Without | With | Δ | Without | With | Δ | ||
case-04 | pass→pass | 17,193 | 4,882 | -72% | 1 | 1 | 0% | 2,918 | 2,870 | -2% | 0 | 0 | — |
case-01 | fail→pass | 7,980 | 3,912 | -51% | 1 | 1 | 0% | 1,227 | 2,615 | +113% | 0 | 0 | — |
case-02 | pass→pass | 11,208 | 8,420 | -25% | 1 | 1 | 0% | 1,975 | 3,758 | +90% | 0 | 0 | — |
case-03 | fail→pass | 17,837 | 7,040 | -61% | 1 | 1 | 0% | 2,645 | 3,118 | +18% | 0 | 0 | — |
case-05 | fail→pass | 14,951 | 2,543 | -83% | 1 | 1 | 0% | 2,546 | 2,450 | -4% | 0 | 0 | — |
case-06 | pass→pass | 15,173 | 1,739 | -89% | 1 | 1 | 0% | 2,677 | 2,279 | -15% | 0 | 0 | — |
case-07 | fail→pass | 9,976 | 2,268 | -77% | 1 | 1 | 0% | 1,601 | 2,389 | +49% | 0 | 0 | — |
case-08 | fail→pass | 12,536 | 2,613 | -79% | 1 | 1 | 0% | 2,010 | 2,458 | +22% | 0 | 0 | — |
case-09 | fail→pass | 11,282 | 3,367 | -70% | 1 | 1 | 0% | 1,759 | 2,591 | +47% | 0 | 0 | — |
case-10 | fail→pass | 17,809 | 9,965 | -44% | 1 | 1 | 0% | 2,953 | 3,615 | +22% | 0 | 0 | — |
case-11 | pass→pass | 8,368 | 1,621 | -81% | 1 | 1 | 0% | 1,436 | 2,260 | +57% | 0 | 0 | — |
case-12 | fail→pass | 12,351 | 1,971 | -84% | 1 | 1 | 0% | 1,872 | 2,334 | +25% | 0 | 0 | — |
case-13 | fail→pass | 8,339 | 2,187 | -74% | 1 | 1 | 0% | 1,357 | 2,393 | +76% | 0 | 0 | — |
case-14 | fail→pass | 10,775 | 3,564 | -67% | 1 | 1 | 0% | 1,731 | 2,698 | +56% | 0 | 0 | — |
case-15 | pass→pass | 14,883 | 2,423 | -84% | 1 | 1 | 0% | 2,409 | 2,440 | +1% | 0 | 0 | — |
case-16 | fail→pass | 20,389 | 7,811 | -62% | 1 | 1 | 0% | 3,153 | 3,339 | +6% | 0 | 0 | — |
case-17 | fail→pass | 14,464 | 7,603 | -47% | 1 | 1 | 0% | 2,263 | 3,149 | +39% | 0 | 0 | — |
case-18 | fail→pass | 11,041 | 2,669 | -76% | 1 | 1 | 0% | 1,923 | 2,521 | +31% | 0 | 0 | — |
case-19 | pass→pass | 7,581 | 1,536 | -80% | 1 | 1 | 0% | 1,181 | 2,223 | +88% | 0 | 0 | — |
case-20 | fail→fail | 19,440 | 15,937 | -18% | 1 | 1 | 0% | 2,880 | 4,499 | +56% | 0 | 0 | — |
case-21 | fail→fail | 11,477 | 7,004 | -39% | 1 | 1 | 0% | 1,844 | 3,125 | +69% | 0 | 0 | — |
case-22 | fail→fail | 3,809 | 3,389 | -11% | 1 | 1 | 0% | 610 | 2,534 | +315% | 0 | 0 | — |
DecimalAI ran this skill against gemini-3.6-flash twice over the same eval suite — once with the skill loaded and once without — and compared the two runs case by case. 22 cases were attempted. The headline lift of +59 percentage points is the difference between those two pass rates over the 22 comparable cases.
Without the skill loaded, the model failed this case. With it loaded, the same prompt on the same model passed. This is one improved case from the latest verified run; every case, including any that regressed, is in the table above.
Other measured skills in the registry, with their headline benchmark lift.