
几乎每一篇讲 AI 生成失败的文章,都是把失败类型列一遍就停下——角色跑形、物理穿帮、 提示词读错。有用,但最实际的那个问题没人回答:这些事到底多久发生一次,在哪个模型上?
数据本来就躺在我们的表里,那就拉出来看。2026-05-06 到 2026-08-21 之间在 FlyAIgh 上 跑过的每一次生成——1,480 次运行、341 个账号、40 个模型—— 按每一次失败的真实成因分类。
结论先说
内容审核拒掉的生成,远多于模型自己坏掉的。而且模型之间的差距大得离谱:同一个平台、 同一个时间窗口内,一个模型拒掉了发给它的 26%,另外四个一次都没拒。
触发它的几乎从来不是提示词,而是参考图——更准确地说,是参考图里的真人脸。
这些数字从哪来
这是真实用户的生产流量,不是实验室测试。没有人专门写提示词去探过滤器的边界; 这些都是有人想做点东西,然后被告知不行。
在算任何一个比率之前,我们先剔除了 59 次责任在我们、不在模型的失败——我们这边的接入错误(把文生视频请求发给只收图生视频的模型、参数格式不对), 以及提交阶段的平台层失败。不该拿我们自己的 bug 去给模型打分。
下面只列有效样本至少 30 次的模型。40 个里够格的有 11 个。
逐模型拒绝率
分成两列,因为这是两件事。审核拒绝指模型正常工作、是它的内容策略拒了;供应商失败指这次生成本身坏了——超时、502、队列拥堵。
| 模型 | 类型 | 样本数 | 审核拒绝率 | 供应商失败率 |
|---|---|---|---|---|
| Seedance 2.0 Fast | 视频 | 50 | 26.0% | 0.0% |
| Seedance 2.0 | 视频 | 148 | 14.9% | 0.0% |
| Seedance 2.0 Mini | 视频 | 50 | 14.0% | 0.0% |
| Nano Banana Pro | 图像 | 96 | 12.5% | 1.0% |
| GPT Image | 图像 | 403 | 4.0% | 0.0% |
| Nano Banana | 图像 | 81 | 1.2% | 2.5% |
| VEO 3.1 Lite | 视频 | 74 | 0.0% | 0.0% |
| Kling V3 Omni | 视频 | 35 | 0.0% | 0.0% |
| Z-Image Turbo | 图像 | 92 | 0.0% | 0.0% |
| Seedream 5.0 Pro | 图像 | 53 | 0.0% | 17.0% |
| Grok Imagine | 视频 | 137 | 0.0% | 16.1% |
两列几乎不重叠。拒得最多的模型坏得最少,而坏得最多的两个——Seedream 5.0 Pro 和 Grok Imagine——一次都没拒。不管这些系统内部是怎么回事,内容策略和基础设施可靠性 是两条互不相干的线。
引用任何单个数字之前,先看样本量。GPT Image 的 4.0% 站在 403 次 生成上,是表里最稳的一个数。Kling V3 Omni 的 0% 站在 35 次上——它的意思是 「35 次里没观察到拒绝」,不是「这个模型从不拒绝」。
到底什么会触发拒绝
下面是供应商返回的提示原文,以及各自在这 77 次审核拒绝里出现了多少次:
- 参考图里有真人(15)—— "The request failed because the input image may contain real person."另有 12 次点名了具体的槽位(content[1]、content[2]、content[3]), 这说明它会检查你挂上去的每一张参考图,不只是第一张。
- 露骨或性暗示内容(15)—— "Contains inappropriate content. Please remove suggestive or explicit material."
- 名人肖像(6)—— "Celebrity or public figure imagery is not supported."
- 版权与音频权利(5)—— "Content security audit did not pass. The output audio may be related to copyright restriction." 另外还有会出声的模型上单独的音频过滤拒绝。
- 涉及未成年人的内容(4)——直接拒绝,没有申诉通道。
- 去水印(3)——当输入看起来像是要抹掉水印或复制受保护素材时被拒。
值得记住的规律是:让你被拒的是参考图,不是提示词。光「真人脸」一项就占了我们记录到的全部拒绝的三分之一以上。
Seedance 家族为什么拒得最多
三个 Seedance 2.0 变体全部落在 14% 到 26% 之间,明显高于其他所有模型。有两个原因, 而只有其中一个跟过滤器本身有关。
第一,Seedance 单次生成最多收九张参考图。参考图越多,过滤器要查的面就越多—— 那些点名 content[1] content[2] content[3] 的拒绝提示也印证了它逐张在查。 只收一张参考图的模型,踩雷的机会本来就少。
第二,人们选 Seedance 恰恰就是因为它能收很多参考图,而这正是你想让某个 具体的人在多个镜头里保持一致时会用的做法。使用场景本身,就把过滤器管得最严的那类 输入送了进来。
怎么少被拒
- 先改参考图,别先改提示词。多数拒绝是图触发的,改措辞很少管用。
- 把真人照片换成生成的角色。一个稳定的 AI 生成角色能过的过滤器, 真人照片过不去。角色工具就是干这个的,而且它直接绕开了最常见的那类拒绝。
- 用不上的参考图就别放。在一个能收九张的模型上,每多一张就是多一次 可能失败的检查。宁可发三张好的,不发九张凑数的。
- 永远别发公众人物。名人肖像在我们接的每一家供应商那里都会被拒, 表里没有任何一个模型能过。
- 检查源图上有没有水印。图库预览图和截图上都带水印,过滤器会把它 读成你想抹掉保护标识。
- 换模型,别跟过滤器较劲。如果真人参考图是你工作的核心, VEO 3.1 Lite、Kling V3 Omni 和 Z-Image Turbo 在这个窗口内一次都没拒过。 把活儿挪过去,比改第五版措辞快。
还有一点是结构性的:在 FlyAIgh 上,失败和被拒的生成会自动退还积分。 在 26% 的拒绝率下这就不只是个体贴功能了——它决定了你是为一条可用的片子付钱, 还是为一条加三分之一条付钱。各平台退款政策不一样,在高拒绝率的模型上批量跑之前 值得先确认。
这份数据说明不了什么
四条边界,明说出来,因为一个不带边界的数字一定会被用错:
- 它量的是拒绝,不是质量。一次跑完了但成品很难看的生成,在这里 算成功。产出到底能不能用,数据库并不记录,所以这篇文章回答不了。
- 拒绝率反映的是我们的用户发了什么。换一批用户、换一批素材, 同样这些模型会跑出不一样的数字。
- 过滤器随时会变,且不打招呼。这是 2026 年 5 至 8 月的窗口。 供应商持续调整内容策略,而且很少公告。
- 样本量并不齐。403 次生成和 35 次不是同一个证据强度, 表里两个都列了出来,你可以自己去权衡。
以上全部来自对生产数据的一次查询。样本长起来之后我们会重跑,尤其是那些目前还没 够到 30 次门槛的模型。
FAQ
哪些 AI 模型拒绝内容最多?
按 2026-05-06 到 2026-08-21 之间 FlyAIgh 上 1,480 次真实生成统计,拒得最多的是 Seedance 2.0 家族:Seedance 2.0 Fast 拒掉 26.0%(50 个样本)、Seedance 2.0 拒掉 14.9%(148 个样本)、Seedance 2.0 Mini 拒掉 14.0%(50 个样本)。Nano Banana Pro 拒掉 12.5%(96 个样本)。另一头,VEO 3.1 Lite(74 个样本)、Kling V3 Omni(35)、Z-Image Turbo(92)、Seedream 5.0 Pro(53)和 Grok Imagine(137)在这个取样窗口内一次都没拒过。
为什么 AI 模型会拒掉我上传的图?
我们的数据里,最常见的单一触发因素是参考图里有真人脸。提示原文是 "The request failed because the input image may contain real person."。其次是露骨或性暗示内容、名人肖像("Celebrity or public figure imagery is not supported.")、涉及未成年人的内容,以及水印和版权问题。这些几乎全部是被参考图触发的,不是文字提示词。
被拒和模型失败是一回事吗?
不是,而把两者混在一起,正是多数可靠性对比毫无用处的原因。审核拒绝意味着模型正常工作、是它的内容策略拒了这次请求;供应商失败意味着这次生成本身坏掉了——超时、502、队列拥堵。成因不同,解法也不同。我们的数据里两者几乎不重叠:拒得最多的(Seedance 2.0 家族)供应商失败率是 0%,而失败最多的(Grok Imagine 16.1%、Seedream 5.0 Pro 17.0%)一次都没拒过。
被拒的生成会扣我的钱吗?
在 FlyAIgh 上不会——失败和被拒的生成会自动退还积分。在 26% 的拒绝率下,这件事比听起来重要得多:它决定了你是为一条可用的片子付钱,还是为一条可用的片子外加三分之一条付钱。各平台政策不同,在拒绝率高的模型上批量跑之前先确认一下。
改写提示词能避开拒绝吗?
通常不能,因为我们数据里绝大多数拒绝是被参考图触发的,不是文字。把真人照片换成生成的角色、把可辨认的脸裁掉、或者去掉源图上的水印,都比改措辞有效得多。只有那一小部分因露骨或性暗示措辞被拒的情况,改写提示词才管用。
如果我的参考图里就是有真人,该用哪个模型?
按这个取样窗口,VEO 3.1 Lite、Kling V3 Omni 和 Z-Image Turbo 一次都没拒过,GPT Image 在 403 次生成里拒了 4.0%——那是这组数据里最大的样本量,因此也是最可信的一个数字。要避开的是 Seedance 2.0 家族。注意这反映的是 2026 年 5 至 8 月的策略行为;模型供应商调整过滤器是不打招呼的。
这份数据基于多少次生成?
1,480 次生成,来自 341 个账号、跨 40 个模型,运行于 2026-05-06 至 2026-08-21 之间。其中只有 11 个模型的有效样本超过 30 次,进入了表格。计算拒绝率前剔除了 59 次失败:它们的责任在我们这边而不在模型——接入错误,以及提交阶段的平台层失败。留着它们会让某个模型看上去有 47.6% 不可靠,而它真实的供应商侧失败率是 0%。
Build a consistent character on FlyAIgh
Identity refs + AI-derived persona + outfit variants, bound to a character ID that auto-injects into every model. 25 free credits, no card required.