Install any skill in seconds. Free to start, no credit card required.
Get Started Free →Higgsfield MCP로 내레이션이 깔린 비실사 설명 영상을 만듭니다. 10초 블록 단위로 내레이션 한 줄과 영상 한 컷을 짝지어 만든 뒤, 서버에서 순서대로 조립해 완성 MP4를 반환합니다. 다음과 같은 요청 시 사용하세요: - "이 주제로 설명 영상 만들어줘" - "이 문서를 나레이션 영상으로" - "얼굴 안 나오는 내레이션 영상" - "마스코트가 설명하는 영상" - "이 이야기를 애니메이션으로 풀어줘" 1~10분(블록 = 분×6)을 지원하고, 스타일 프리셋 라이브 카탈로그·마스코트/무인물 모드·16:9와 9:16· 선택적 자막을 다룹니다. 실사 영상, 광고·UGC, 토킹헤드, 팟캐스트, 단발 클립은 범위 밖이며 media-higgsfield-video를 사용하세요.
.claude/skills/modu-ai-media-higgsfield-explainer/SKILL.md| Test case | Without → With | Effect | Δ tokens | Δ turns |
|---|---|---|---|---|
| case-07 | ✗→✓ | ▲ Improved | 78% | 0% |
| case-09 | ✗→✓ | ▲ Improved | 75% | 0% |
| case-16 | ✗→✓ | ▲ Improved | 78% | 0% |
| case-17 | ✗→✓ | ▲ Improved | 190% | 0% |
| case-10 | ✗→✓ | ▲ Improved | 181% | 0% |
> moai-media | 블록 조립형 내레이션 영상 (코어: media-higgsfield-core)
설명 영상은 단발 클립 생성과 다르다. 하나의 스타일 키를 전 블록에 고정하고, 블록마다 내레이션 1줄과 10초 클립 1개를 1:1로 짝지은 뒤, 서버 조립기로 순서대로 이어 붙인다. 이 순서를 어기면 스타일이 흔들리고 음성과 화면이 어긋난다.
호출 계약·비용 프리플라이트·namespace 해석은 코어를 따른다:
../media-higgsfield-core/references/call-schema.md../media-higgsfield-core/references/job-lifecycle.md프롬프트 템플릿은 references/prompts.md. 1~3단계 진입 전에 반드시 읽는다.
설명 영상, 익스플레이너, explainer, 내레이션 영상, 나레이션, 해설 영상, 애니메이션 설명, 마스코트 영상, 얼굴 없는 영상, 스토리 영상, 다큐 스타일 영상
| 단계 | 도구 | |---|---| | 스타일 프리셋 목록 | 설명영상 프리셋 조회 | | 프리셋 → 스타일 키 미디어 | 프리셋 해석 | | 커스텀 스타일 키 생성 | generate_image (Nano Banana 계열) | | 보이스 목록 | 보이스 조회 | | 내레이션 생성 | generate_audio (seed_audio) | | 클립 생성 | generate_video (Gemini Omni 계열) | | 진행 확인 | job_status | | 최종 조립 | 설명영상 조립 도구 |
모델 id는 라이브 조회로 확인한다. 조립은 서버가 한다 — 로컬 ffmpeg나 수동 이어붙이기를 쓰지 않는다.
이 규칙들은 결과 품질이 아니라 성립 여부를 가른다.
이 스킬은 사용자에게 직접 묻지 않는다. 아래 슬롯을 두 라운드로 나눠 수집하도록 오케스트레이터에 blocker로 요청한다. 한 번에 몰아 묻지 않는 이유는 스타일 선택이 나머지 결정의 전제이기 때문이다.
라운드 1 — 스타일만. 프리셋 목록을 라이브 조회해 이름과 미리보기를 제시하고, 프리셋 선택 / 직접 서술 / 참조 이미지 첨부 중 하나를 받는다. 스타일 선택은 필수이며, 사용자가 명시적으로 위임하지 않는 한 임의로 고르지 않는다.
라운드 2 — 제작 설정. 스타일이 정해진 뒤에만 묻는다.
| 슬롯 | 기본 | 값 | |---|---|---| | 길이 | — | 1~10분 정수. 블록 수 N = 분 × 6 | | 내레이션 언어 | 영어 | 선택지를 준다 | | 캐릭터 | — | 마스코트 / 무인물. 항상 묻는다 | | 화면비 | 프리셋을 고르면 9:16 | 16:9 / 9:16 — 아래 주의 | | 자막 | 끔 | 켜면 폰트를 고르게 한다(임의 선택 금지). 음성 블록당 추가 비용 발생을 알린다 |
> 화면비 주의 (라이브 관측). CMS 프리셋은 저술 시점 기준 전부 9:16 세로다. 따라서 프리셋을 고른 뒤 16:9를 요구하면 프리셋 참조와 충돌한다. 가로형이 꼭 필요하면 프리셋 대신 커스텀 스타일 키로 가는 것이 정상 경로다. 프리셋 목록의 aspect 값은 고정이 아니므로 매번 조회 결과를 확인하고, 프리셋을 고른 경우 그 aspect를 기본값으로 삼는다.
실제 주제면 웹 조사로 블록마다 쓸 사실을 확보하고 출처 목록을 남긴다. 기억만으로 사실형 대본을 쓰지 않는다. 개인 이야기면 조사를 건너뛰고 사용자가 준 내용만 쓴다.
프리셋을 골랐다면 프리셋을 해석해 스타일 키 미디어 id를 얻는다. 이미지를 새로 만들지 않는다. 프리셋 참조가 0단계에서 정한 화면비와 충돌하면 조용히 밀어붙이지 말고 사용자에게 선택을 되돌린다 — 프리셋이 전부 세로인 현 상태에서 가로형 요구는 커스텀 스타일 키 경로로 안내한다.
커스텀이라면 키 이미지를 정확히 1장 생성한다. 템플릿은 references/prompts.md의 추상 스와치(또는 마스코트 변형). 완료된 잡 UUID를 스타일 키로 보관한다.
선택한 언어로 정확히 N개 블록을 쓴다. 한 줄당 20~24단어, 약 8~9초, 9.5초를 넘기지 않는다. 타임코드·감정 지시·괄호 지문을 넣지 않고, 숫자는 풀어 쓰며, "이 영상에서는" 같은 표현을 쓰지 않는다.
references/prompts.md의 블록 템플릿(STYLE REFERENCE / SCENE / MOTION / AUDIO / NEGATIVE)으로 영어 프롬프트 N개를 쓴다. STYLE 토큰은 전 블록 동일하게 복사한다. 블록당 동작은 하나만.
보이스 목록을 조회해 사용자가 하나를 고르게 한다(임의 선택 금지). 고른 보이스의 id와 타입을 고정하고, 같은 보이스로 블록별 오디오를 생성한다. 블록 순서대로 잡 UUID를 기록한다.
실패했거나 지나치게 긴 테이크만 다시 만든다. 길면 문장을 줄이거나 말속도를 조금 조정한다.
N개 오디오가 전부 완료되기 전에는 5단계로 넘어가지 않는다. 이 장벽은 엄격하다.
블록마다 10초 클립을 만든다. 모든 호출에 같은 스타일 키를 첨부한다. 이 단계 안에서는 독립 잡을 동시에 돌려도 된다. 실패한 블록만 재제출하고, 모델을 조용히 다른 것으로 바꾸지 않는다.
블록 쌍을 순서대로 구성해(영상 잡 ↔ 오디오 잡, 최소 2쌍) 조립 도구에 넘긴다. 가로는 1280×720, 세로는 720×1280. 자막을 켰다면 고른 폰트를 함께 넘긴다.
조립기는 각 블록을 정확히 10초로 맞춘다 — 짧은 테이크는 가운데 정렬하고, 약간 넘치면 피치를 보존한 채 속도를 올리며, 영상은 늘이지 않는다. 총 길이는 정확히 N × 10초다.
| 시점 | 충족 조건 | |---|---| | 5단계 전 | 스타일 키 1개, 내레이션 N줄, 프롬프트 N개, 보이스 1개 확정, 오디오 잡 N개 완료 | | 6단계 전 | 영상 잡 N개 완료, 블록 쌍이 1:1이며 누락·중복 없음 |
| 증상 | 조치 | |---|---| | 프리셋이 없음 | 목록을 다시 조회한다. id를 재사용하거나 지어내지 않는다 | | 프리셋 해석 실패 | 워크스페이스 선택을 확인하고 한 번 재시도 | | 스타일 흔들림·실사화 | 공유 STYLE과 NEGATIVE를 강화하고 그 클립만 재생성 | | 타임아웃 | 진행 중인 잡에 다시 붙는다. 돌고 있는 잡을 중복 제출하지 않는다 | | 같은 실패 2회 | 프롬프트나 파라미터를 바꾼다. 같은 호출을 3번째 반복하지 않는다 |
## Higgsfield 설명 영상 결과
- 최종 영상 URL: [조립 완료 결과]
- 길이: [정확히 N × 10초] · 화면비: [16:9 | 9:16]
- 내레이션 언어: [선택 언어] · 내레이터: [보이스 이름]
- 스타일: [프리셋 이름 | 커스텀 서술]
- 자막: [끔 | 폰트명]
- 비용: [get_cost 합계]
- 출처: [실제 주제인 경우 조사 출처 목록]중간 잡 id와 개별 클립 URL은 요청받기 전에는 내부에 둔다.
| 스킬 | 시점 | |---|---| | moai-media:media-higgsfield-core | 코어: 호출 계약·비용·namespace | | moai-media:media-higgsfield-assets | 구성: 오디오 파라미터 상세 | | moai-media:media-higgsfield-video | 대안: 단발 클립·실사·광고 영상 | | moai-officer:doc-html-slide | 대안: 같은 내용을 슬라이드로 | | moai-story:story-screenplay | 선행: 서사 구조 설계 | | moai-marketer:marketing-youtube-podcast-planner | 선행: 채널 기획 |
higgsfield-video-explainer v0.12.0 (MIT). 6단계 파이프라인·하드 규칙·프롬프트 템플릿·체크포인트의 근거.| Case | Status | Duration (ms) | Turns | Tokens | Tool calls | ||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| Without | With | Δ | Without | With | Δ | Without | With | Δ | Without | With | Δ | ||
case-05 | pass→pass | 35,784 | 38,737 | +8% | 1 | 1 | 0% | 8,213 | 11,011 | +34% | 0 | 0 | — |
case-06 | pass→pass | 16,421 | 23,533 | +43% | 1 | 1 | 0% | 2,759 | 6,883 | +149% | 0 | 0 | — |
case-07 | fail→pass | 18,567 | 8,640 | -53% | 1 | 1 | 0% | 2,424 | 4,326 | +78% | 0 | 0 | — |
case-08 | pass→pass | 12,302 | 14,261 | +16% | 1 | 1 | 0% | 1,282 | 5,318 | +315% | 0 | 0 | — |
case-09 | fail→pass | 17,184 | 10,513 | -39% | 1 | 1 | 0% | 2,164 | 3,783 | +75% | 0 | 0 | — |
case-16 | fail→pass | 32,483 | 11,183 | -66% | 1 | 1 | 0% | 2,217 | 3,954 | +78% | 0 | 0 | — |
case-17 | fail→pass | 14,196 | 14,549 | +2% | 1 | 1 | 0% | 1,509 | 4,376 | +190% | 0 | 0 | — |
case-18 | fail→fail | 12,927 | 11,714 | -9% | 1 | 1 | 0% | 2,324 | 4,933 | +112% | 0 | 0 | — |
case-19 | fail→fail | 16,321 | 10,058 | -38% | 1 | 1 | 0% | 1,665 | 4,490 | +170% | 0 | 0 | — |
case-01 | fail→fail | 24,848 | 18,545 | -25% | 1 | 1 | 0% | 3,416 | 5,306 | +55% | 0 | 0 | — |
case-02 | fail→fail | 29,825 | 48,704 | +63% | 1 | 1 | 0% | 4,133 | 11,123 | +169% | 0 | 0 | — |
case-03 | fail→fail | 23,115 | 16,304 | -29% | 1 | 1 | 0% | 3,840 | 4,908 | +28% | 0 | 0 | — |
case-04 | pass→pass | 10,066 | 16,279 | +62% | 1 | 1 | 0% | 780 | 4,641 | +495% | 0 | 0 | — |
case-10 | fail→pass | 9,288 | 15,531 | +67% | 1 | 1 | 0% | 1,649 | 4,639 | +181% | 0 | 0 | — |
case-11 | pass→pass | 14,922 | 10,204 | -32% | 1 | 1 | 0% | 1,647 | 3,696 | +124% | 0 | 0 | — |
case-12 | fail→pass | 10,789 | 8,048 | -25% | 1 | 1 | 0% | 1,817 | 4,187 | +130% | 0 | 0 | — |
case-13 | fail→pass | 10,642 | 10,354 | -3% | 1 | 1 | 0% | 1,798 | 3,602 | +100% | 0 | 0 | — |
case-14 | fail→pass | 12,724 | 9,121 | -28% | 1 | 1 | 0% | 1,915 | 4,371 | +128% | 0 | 0 | — |
case-15 | fail→fail | 27,230 | 15,220 | -44% | 1 | 1 | 0% | 2,407 | 5,378 | +123% | 0 | 0 | — |
case-20 | fail→pass | 8,966 | 5,124 | -43% | 1 | 1 | 0% | 1,352 | 3,680 | +172% | 0 | 0 | — |
case-21 | fail→pass | 13,707 | 6,080 | -56% | 1 | 1 | 0% | 2,146 | 3,837 | +79% | 0 | 0 | — |
case-22 | fail→pass | 10,870 | 7,791 | -28% | 1 | 1 | 0% | 1,783 | 4,145 | +132% | 0 | 0 | — |
case-23 | fail→pass | 12,783 | 4,148 | -68% | 1 | 1 | 0% | 2,027 | 3,460 | +71% | 0 | 0 | — |
DecimalAI ran this skill against gemini-3.6-flash twice over the same eval suite — once with the skill loaded and once without — and compared the two runs case by case. 23 cases were attempted. The headline lift of +52 percentage points is the difference between those two pass rates over the 23 comparable cases.
Without the skill loaded, the model failed this case. With it loaded, the same prompt on the same model passed. This is one improved case from the latest verified run; every case, including any that regressed, is in the table above.
Other measured skills in the registry, with their headline benchmark lift.