FlyAIgh
Home/Blog/Guide

AI 영상 생성은 실제로 얼마나 자주 실패할까요 — 498회의 실행에서 본 벤더 장애와 심사 거부

Published August 23, 20268 min read

AI 영상을 몇 번 다시 돌려야 하는지에 대한 추정치는 널리 퍼져 있지만 실측된 것은 없습니다. 이것은 실측입니다. 영상 6개 모델, 운영 498회, 벤더 장애와 심사 거부를 따로 세고, 모든 비율에 신뢰구간을 붙였으며 분류에 쓴 정규식도 공개합니다.

생성된 전장 장면. 이 데이터 뒤에 있는 수백 회의 운영 실행 가운데 하나입니다

데이터 기간: 2026-05-06부터 2026-08-22까지 · 최종 갱신: 2026-08-23

결론부터

2026년 5월 6일부터 8월 22일 사이, 멀티모델 플랫폼에서 실행된 498회의 영상 생성에서 6개 모델 중 4개는 벤더 측 실패가 드물어 0%에서 1.4% 사이에 들어갔습니다. 훨씬 나빴던 공급 경로가 둘 있는데, 하나는 36.2%이고 다른 하나는 이 표 바깥의 이미지 모델 경로로 17.0%(53건 중 9건)입니다. 콘텐츠 심사에 의한 거부는 모델에 따라 0%에서 26.0%까지였고, 47건의 거부 중 31건이 참조 이미지에 실존 인물의 얼굴이 있다고 지목했습니다. 아래의 모든 비율에는 95% 신뢰구간이 붙어 있으며, 각 실패를 분류하는 데 쓴 규칙도 전문 공개합니다.

두 종류의 실패

컷을 다시 만들게 하는 사건은 세 가지이지만, 로그가 셀 수 있는 흔적을 남기는 것은 그중 둘뿐입니다.

  1. 생성이 망가졌습니다. 타임아웃, 벤더 오류, 대기열 실패입니다. 아무것도 돌아오지 않습니다.
  2. 콘텐츠 심사가 거부했습니다.모델은 정상 작동했고 그 콘텐츠 정책이 요청을 거절했습니다.
  3. 완주했지만 원하던 것이 아니었습니다.기술적으로는 성공이며, 채택된 컷과 기록상 전혀 구분되지 않습니다.

이 글이 재는 것은 앞의 둘입니다. 세 번째는범위 밖이며 로그로는 잴 수 없습니다. 버려진 생성과 채택된 생성을 가르는 것이 아무것도 없기 때문입니다. 쓸 만한 컷 하나에 몇 번이 드는지에 대한 공개된 추정치는 있지만, 그것들은 예시를 위한 가정이거나 단일 작품의 사례이지 통제된 측정이 아니므로, 여기서는 세 번째 분류의 비중을 전혀 추정하지 않습니다.

둘은 원인이 다릅니다. 망가지는 것은 공급 경로에서 오고, 거부는 콘텐츠 정책이 제출물과 만난 결과입니다.

데이터

이 기간에 유효 실행이 30회를 넘긴 영상 모델은 6개였습니다. 이미지 모델은 완전히 제외했습니다. 섞으면 영상에 대한 물음에 다른 것에 대한 데이터로 답하는 셈이 되기 때문입니다. 앞선 글이 이미지 모델을 다룹니다. 같은 로그의, 더 넓지만 경계를 덜 조인 단면입니다.

모델유효 실행제외망가짐거부됨
Seedance 2.014801 · 0.7% (0.1–3.7)22 · 14.9% (10.0–21.5)
Grok Imagine141451 · 36.2% (28.7–44.4)0 · 0.0% (0.0–2.7)
Veo 3.1 Lite7401 · 1.4% (0.2–7.3)0 · 0.0% (0.0–4.9)
Seedance 2.0 Mini50320 · 0.0% (0.0–7.1)7 · 14.0% (7.0–26.2)
Seedance 2.0 Fast5000 · 0.0% (0.0–7.1)13 · 26.0% (15.9–39.6)
Kling V3 Omni3500 · 0.0% (0.0–9.9)0 · 0.0% (0.0–9.9)

ByteDance는 "Pro" 등급을 공표한 적이 없습니다. 재판매 사업자가 표준 Seedance 2.0 엔드포인트에 그 이름을 붙여 쓸 뿐이며, 위 행이 재는 것이 바로 그 엔드포인트입니다.

괄호 안은 95% Wilson 신뢰구간입니다. 여기서 점추정만으로는 지탱할 수 없는 독법이 둘 나옵니다.

Kling V3 Omni는 두 열 모두 0건이었지만, 35회의 실행에서는 상한이 9.9%입니다. 참값은 대략 10분의 1보다 아래 어딘가에 있습니다.

Seedance 2.0 Fast가 Seedance 2.0보다 나쁘다고 말할 수는 없습니다.Fast는 26.0%(CI 15.9–39.6%), Seedance 2.0은 14.9%(CI 10.0–21.5%)를 거부했습니다. 두 구간은 겹치므로 이 표본 수에서는 그 격차를 표집 잡음과 구분할 수 없습니다.

각 실패를 어떻게 분류했는가

출처는 플랫폼의 생성 로그이며, 2026-05-06부터 2026-08-22까지(양끝 포함) 생성된 영상 유형의 행으로 걸렀습니다. 각 행은 정확히 하나의 분류에 배정했고, 대조 순서는 다음과 같습니다.

ok       : status = 'completed'

refused  : error_message ~* '(may contain real person|inappropriate
           content|celebrity|involving minors|copyright restrict|
           watermark|AUDIO_FILTERED|content security audit)'

ourside  : error_message ~* '(Insufficient corporate funds|balance is
           insufficient|validation failed|only supports|Invalid
           parameters|Parameter validation|input.prompt: size|Error
           validating image|style reference must be|iw )'

broke    : every other failed row

ourside 분류는 분모에서 뺐습니다. 이 실패들이 재는 것은 모델이 아니라 저희의 연동이기 때문입니다. 상류의 계정 계층 문제와, 저희 코드가 망가뜨린 요청입니다. 제외한 건수는 모델별로 위 표에 실어 두어 이 보정이 합계 안에서 계속 보이도록 했습니다. 왜 이것이 중요한지는 Seedance 2.0 Mini가 보여줍니다. 82건의 원 실패 중 32건을 제외했으며, 보정하지 않으면 실패율 39%로 읽히지만 보정 후에는 유효한 50회에 대해 0%입니다.

출력 측 오디오 필터(AUDIO_FILTERED, content security audit)는 refused에 넣었습니다. 사용자가 겪는 바가 다른 정책 차단과 다르지 않기 때문입니다. 47건의 거부 중 15건이 여기 해당합니다.

머리기사 숫자 하나를 움직이는 경계 판단이 있습니다.Operation failed. Please retry.An error occurred. 같은 일반적인 상류 메시지에는 귀속 정보가 없습니다. 이들은 제외하지 않고 broke로 셉니다. 그 규칙에서 Grok Imagine은 36.2%로, 이 메시지들을 따로 떼어놓으면 16.1%로 읽힙니다. 높은 쪽을 보고하는 이유는, 측정 대상이 벤더인 이상 설명되지 않는 실패를 자신이 아니라 벤더에게 귀속시키는 편이 보수적인 선택이기 때문입니다.

거부를 일으키는 것

이 기간 전체 영상 모델을 합쳐 47건의 생성이 거부되었습니다. 42건은 표의 6개 모델에서, 나머지 5건은 30회 기준에 미치지 못한 모델에서 일어났습니다. 벤더가 돌려준 메시지별로 묶으면 다음과 같습니다.

  • 31건 · 참조 이미지에 실존 인물. 반환값은 "The request failed because the input image may contain real person."입니다.
  • 11건 · 저작권 또는 오디오 권리.생성되었거나 참조된 오디오에 대한 콘텐츠 안전 심사입니다.
  • 4건 · 오디오 필터링. 네이티브로 소리를 생성하는 모델에서 일어났습니다.
  • 1건 · 노골적이거나 성적 암시가 있는 소재.

전체 거부의 3분의 2가 하나의 원인에서 나옵니다. 필터가 읽는 것은 참조 이미지이지 프롬프트가 아닙니다. 그래서 표현을 바꾸는 것은 좀처럼 통하지 않고, 실존 인물의 사진을 생성된 캐릭터로 바꾸는 것은 대개 통합니다.

로그에는 그 실행이 참조 이미지를 동반했는지에 대한 기록이 없습니다. 그래서 표에는 각 비율 뒤의 작업 구성을 보여주는 열이 없습니다. 대신할 측정이 하나 있습니다. 이 기간의 Grok Imagine 실행 145회는 이미지 매개변수도 캐릭터 연결도 한 건 동반하지 않았습니다. 즉 그 거부율 0%는 필터가 느슨하다는 것이 아니라 텍스트 전용 사용 방식을 반영합니다. 실존 인물과 관련된 거부 31건은 모두 Seedance 계열에 떨어졌고, 20건이 Seedance 2.0, 11건이 Seedance 2.0 Fast입니다.

두 개의 이상치는 저희 라우팅입니다

Grok Imagine의 36.2%가 재는 것은 공급 경로이지 모델이 아닙니다. 이 플랫폼의 모든 생성은 그런 경로를 거쳐 모델에 도달하고, 벤더 측 실패가 재는 것이 바로 그 경로입니다. 타임아웃, 상류 오류, 중간 사업자 쪽의 용량 문제 같은 것이지요. 같은 모델을 다르게 라우팅하는 플랫폼이라면 다른 숫자가 나옵니다.

이 데이터에서 두 번째로 실패가 많은 경로(표 바깥의 이미지 모델)도 마찬가지입니다. 이 두 숫자야말로 해당 경로들을 재검토하게 만든 계기였습니다. 이들은 인프라 절에 속하는 것이며, 모델 품질에 대한 증거로 읽어서는 안 됩니다.

거부율은 더 멀리 통용되지만 한 가지 단서가 붙습니다. 이 31건처럼 모델 제공사 자신의 오류 문자열을 동반한 거부는 그 제공사의 정책을 반영하며, 같은 엔드포인트로 가는 다른 경로에서도 재현될 것입니다. 중간 사업자는 더 엄격한 자체 필터를 얹을 수 있습니다. 예컨대 RunningHub는 모델을 가리지 않고 플랫폼 계층에서 실존 인물 차단을 강제합니다. 이 비율들은 하한으로 다루십시오.

이 데이터가 말하지 않는 것

  • 재는 것은 거부와 파손이지 품질이 아닙니다.완주했지만 보기에 이상한 생성도 여기서는 성공으로 세며, 실무에서는 그 분류야말로 재생성의 가장 큰 원천일 가능성이 높습니다.
  • 표본 수가 작고 고르지도 않습니다.기준을 넘긴 것은 6개 모델이고, 148회의 실행과 35회는 같은 증거의 무게가 아닙니다. 모든 칸에 구간을 붙인 이유가 이것입니다.
  • 거부율은 저희 사용자가 무엇을 제출했는지를 반영합니다.다른 소재로 작업하는 사용자층이라면 같은 모델에서도 다른 비율이 나옵니다.
  • 거부율은 작업 구성에 교란되어 있습니다.각 모델에서 실존 인물의 참조 이미지를 동반한 실행이 몇 건인지는 표에 나오지 않습니다. 어떤 모델이 다른 모델보다 사진 업로드를 많이 받으면, 정책의 엄격함과 무관하게 더 많은 거부를 물려받습니다.
  • 기간 중에 공급 경로가 바뀌었습니다.벤더 측 실패율은 한 시점의 측정값이며, 위에 나온 높은 두 숫자야말로 변경을 촉발한 바로 그것들입니다.
  • 콘텐츠 필터는 예고 없이 움직입니다.모델 제공사는 임계값을 지속적으로 조정하고 좀처럼 공지하지 않으므로 거부율은 흘러갑니다.

FAQ

어떤 AI 영상 모델이 콘텐츠를 가장 많이 거부하나요?

측정에 충분한 표본이 있던 6개 모델 가운데, 기록된 거부는 모두 Seedance 2.0 계열의 것입니다. Seedance 2.0 Fast는 50회 중 13회(26.0%, 95% CI 15.9–39.6%), Seedance 2.0은 148회 중 22회(14.9%, CI 10.0–21.5%), Seedance 2.0 Mini는 50회 중 7회(14.0%, CI 7.0–26.2%)였습니다. 이 세 구간은 서로 겹치므로, 이 계열이 다른 모델보다 뚜렷이 높은 비율로 거부한다고는 말할 수 있어도 계열 내부의 순위는 확립되지 않았습니다. Grok Imagine, Veo 3.1 Lite, Kling V3 Omni는 거부가 한 건도 없었고 상한은 각각 2.7%, 4.9%, 9.9%입니다.

실패율 0%는 "결코 실패하지 않는다"와 같은 뜻인가요?

같지 않으며, 그 숫자에 얼마나 무게를 둘 수 있는지는 표본 수가 정합니다. Kling V3 Omni는 장애도 거부도 0건이었지만 실행은 35회뿐이어서 95% 상한이 9.9%가 됩니다. 참값이 0에서 대략 10분의 1 사이 어딘가라는 뜻입니다. Seedance 2.0 Fast와 Mini도 벤더 측 장애가 0건이었지만 각각 50회의 실행에 기반하므로 상한은 7.1%입니다.

AI 영상의 콘텐츠 심사 거부는 실제로 무엇이 방아쇠인가요?

이 기간 영상 쪽 거부 47건 가운데 31건이 참조 이미지에 실존 인물의 얼굴이 있다고 지목했고, 상류에서의 표현은 "The request failed because the input image may contain real person."입니다. 11건이 저작권 또는 오디오 권리, 4건이 소리를 생성하는 모델에서의 오디오 필터에 의한 거부(이 둘을 합친 것이 방법 절에서 말하는 출력 측 오디오 필터 15건입니다), 1건이 노골적 소재에 대한 지적이었습니다. 프롬프트의 표현이 방아쇠가 되는 일은 드뭅니다. 실존 인물의 사진을 생성된 캐릭터로 바꾸면 이 분류의 대부분이 사라집니다.

왜 일부 실패를 비율에서 제외하나요?

그것들이 재고 있는 것은 저희의 연동 부분이기 때문입니다. 어떤 비율을 계산하기 전에도 두 종류를 걷어냈습니다. 상류에서의 자사 계정 문제와, 저희 연동이 망가뜨린 요청, 예컨대 이미지에서 영상만 받는 모델에 텍스트에서 영상 호출을 보낸 경우입니다. Seedance 2.0 Mini가 가장 분명한 예로, 82건의 원 실패 중 32건을 이 사유로 제외했습니다. 보정하지 않은 실패율은 39%로 읽히지만, 보정 후에는 유효한 50회에 대해 벤더 측 실패율 0%입니다.

이 비율을 다른 플랫폼에도 적용할 수 있나요?

거부율이 실패율보다 멀리까지 통용되지만 고정값으로는 아닙니다. 이 31건처럼 모델 제공사가 돌려준 오류 문자열을 동반한 거부는 그 제공사의 정책을 반영하며, 같은 엔드포인트에 도달하는 다른 경로에서도 재현될 것입니다. 중간 사업자는 더 엄격한 자체 필터를 얹을 수 있습니다. 예컨대 RunningHub는 모델을 가리지 않고 플랫폼 계층에서 실존 인물 차단을 강제하므로, 이 비율들은 하한으로 읽어야 합니다. 벤더 측 실패율은 전혀 통용되지 않습니다. 당시 쓰던 공급 경로를 잴 뿐이며, 여기 나온 높은 두 숫자에 해당하는 경로는 그 이후 재검토했습니다.

Every model in this article, on one account

Prices and capabilities for each model are on their own pages, and the price of a run is shown before you start it.