FlyAIgh
Home/Blog/Guide

AI 生成为什么被拒:11 个模型的真实内容审核拒绝率

Published August 21, 20269 min read

讲 AI 生成失败的文章大多把失败类型列一遍就结束了。这篇有数字:1,480 次真实运行得出的逐模型拒绝率、拒绝提示的原文,以及到底是什么输入触发了它们。

驾驶舱内飞行员的特写画面,由 FlyAIgh 生成
一次顺利通过的生成。大部分都能过,但你选哪个模型,会让这个概率差出 26 个百分点。
2026-08-23 更新:本文中视频模型的数字已被 一份只统计视频模型、并带置信区间的测量取代。下面的图像模型数字不变。

几乎每一篇讲 AI 生成失败的文章,都是把失败类型列一遍就停下——角色跑形、物理穿帮、 提示词读错。有用,但最实际的那个问题没人回答:这些事到底多久发生一次,在哪个模型上?

数据本来就躺在我们的表里,那就拉出来看。2026-05-06 到 2026-08-21 之间在 FlyAIgh 上 跑过的每一次生成——1,480 次运行、341 个账号、40 个模型—— 按每一次失败的真实成因分类。

结论先说

内容审核拒掉的生成,远多于模型自己坏掉的。而且模型之间的差距大得离谱:同一个平台、 同一个时间窗口内,一个模型拒掉了发给它的 26%,另外四个一次都没拒。

触发它的几乎从来不是提示词,而是参考图——更准确地说,是参考图里的真人脸。

这些数字从哪来

这是真实用户的生产流量,不是实验室测试。没有人专门写提示词去探过滤器的边界; 这些都是有人想做点东西,然后被告知不行。

在算任何一个比率之前,我们先剔除了 59 次责任在我们、不在模型的失败——我们这边的接入错误(把文生视频请求发给只收图生视频的模型、参数格式不对), 以及提交阶段的平台层失败。不该拿我们自己的 bug 去给模型打分。

这一步清洗决定了全局。剔除之前,Seedance 2.0 Mini 看上去有 47.6% 的 时间在失败——它那 82 次失败里有 32 次是我们这边的问题,不是模型的。它真实的 供应商侧失败率是 0%。任何一份不区分「模型拒绝」和「平台坏了」的 可靠性对比,量的都是平台,不是模型。

下面只列有效样本至少 30 次的模型。40 个里够格的有 11 个。

逐模型拒绝率

分成两列,因为这是两件事。审核拒绝指模型正常工作、是它的内容策略拒了;供应商失败指这次生成本身坏了——超时、502、队列拥堵。

模型类型样本数审核拒绝率供应商失败率
Seedance 2.0 Fast视频5026.0%0.0%
Seedance 2.0视频14814.9%0.0%
Seedance 2.0 Mini视频5014.0%0.0%
Nano Banana Pro图像9612.5%1.0%
GPT Image图像4034.0%0.0%
Nano Banana图像811.2%2.5%
VEO 3.1 Lite视频740.0%0.0%
Kling V3 Omni视频350.0%0.0%
Z-Image Turbo图像920.0%0.0%
Seedream 5.0 Pro图像530.0%17.0%
Grok Imagine视频1370.0%16.1%

两列几乎不重叠。拒得最多的模型坏得最少,而坏得最多的两个——Seedream 5.0 Pro 和 Grok Imagine——一次都没拒。不管这些系统内部是怎么回事,内容策略和基础设施可靠性 是两条互不相干的线。

引用任何单个数字之前,先看样本量。GPT Image 的 4.0% 站在 403 次 生成上,是表里最稳的一个数。Kling V3 Omni 的 0% 站在 35 次上——它的意思是 「35 次里没观察到拒绝」,不是「这个模型从不拒绝」。

到底什么会触发拒绝

下面是供应商返回的提示原文,以及各自在这 77 次审核拒绝里出现了多少次:

  • 参考图里有真人(15)—— "The request failed because the input image may contain real person."另有 12 次点名了具体的槽位(content[1]content[2]content[3]), 这说明它会检查你挂上去的每一张参考图,不只是第一张。
  • 露骨或性暗示内容(15)—— "Contains inappropriate content. Please remove suggestive or explicit material."
  • 名人肖像(6)—— "Celebrity or public figure imagery is not supported."
  • 版权与音频权利(5)—— "Content security audit did not pass. The output audio may be related to copyright restriction." 另外还有会出声的模型上单独的音频过滤拒绝。
  • 涉及未成年人的内容(4)——直接拒绝,没有申诉通道。
  • 去水印(3)——当输入看起来像是要抹掉水印或复制受保护素材时被拒。

值得记住的规律是:让你被拒的是参考图,不是提示词。光「真人脸」一项就占了我们记录到的全部拒绝的三分之一以上。

Seedance 家族为什么拒得最多

三个 Seedance 2.0 变体全部落在 14% 到 26% 之间,明显高于其他所有模型。有两个原因, 而只有其中一个跟过滤器本身有关。

第一,Seedance 单次生成最多收九张参考图。参考图越多,过滤器要查的面就越多—— 那些点名 content[1] content[2] content[3] 的拒绝提示也印证了它逐张在查。 只收一张参考图的模型,踩雷的机会本来就少。

第二,人们选 Seedance 恰恰就是因为它能收很多参考图,而这正是你想让某个 具体的人在多个镜头里保持一致时会用的做法。使用场景本身,就把过滤器管得最严的那类 输入送了进来。

所以那个 26% 并不纯粹是「Seedance 更严」的意思,它也反映了人们拿什么去喂它。 比较公允的读法是:如果你的活儿要用到多张真人参考图,在这个家族上大约每四次会被 拒一次,按这个数去做积分预算。
5 秒,原生 1080p,139 积分——由 Seedance 2.0 生成,也就是上表里 拒绝率 14.9% 的那个模型。这条提示词引用了两个素材,一个角色和一个场景, 正是过滤器盯得最紧的多参考图配置。这一次过了。

怎么少被拒

  1. 先改参考图,别先改提示词。多数拒绝是图触发的,改措辞很少管用。
  2. 把真人照片换成生成的角色。一个稳定的 AI 生成角色能过的过滤器, 真人照片过不去。角色工具就是干这个的,而且它直接绕开了最常见的那类拒绝。
  3. 用不上的参考图就别放。在一个能收九张的模型上,每多一张就是多一次 可能失败的检查。宁可发三张好的,不发九张凑数的。
  4. 永远别发公众人物。名人肖像在我们接的每一家供应商那里都会被拒, 表里没有任何一个模型能过。
  5. 检查源图上有没有水印。图库预览图和截图上都带水印,过滤器会把它 读成你想抹掉保护标识。
  6. 换模型,别跟过滤器较劲。如果真人参考图是你工作的核心, VEO 3.1 Lite、Kling V3 Omni 和 Z-Image Turbo 在这个窗口内一次都没拒过。 把活儿挪过去,比改第五版措辞快。

还有一点是结构性的:在 FlyAIgh 上,失败和被拒的生成会自动退还积分。 在 26% 的拒绝率下这就不只是个体贴功能了——它决定了你是为一条可用的片子付钱, 还是为一条加三分之一条付钱。各平台退款政策不一样,在高拒绝率的模型上批量跑之前 值得先确认。

这份数据说明不了什么

四条边界,明说出来,因为一个不带边界的数字一定会被用错:

  • 它量的是拒绝,不是质量。一次跑完了但成品很难看的生成,在这里 算成功。产出到底能不能用,数据库并不记录,所以这篇文章回答不了。
  • 拒绝率反映的是我们的用户发了什么。换一批用户、换一批素材, 同样这些模型会跑出不一样的数字。
  • 过滤器随时会变,且不打招呼。这是 2026 年 5 至 8 月的窗口。 供应商持续调整内容策略,而且很少公告。
  • 样本量并不齐。403 次生成和 35 次不是同一个证据强度, 表里两个都列了出来,你可以自己去权衡。

以上全部来自对生产数据的一次查询。样本长起来之后我们会重跑,尤其是那些目前还没 够到 30 次门槛的模型。

FAQ

哪些 AI 模型拒绝内容最多?

按 2026-05-06 到 2026-08-21 之间 FlyAIgh 上 1,480 次真实生成统计,拒得最多的是 Seedance 2.0 家族:Seedance 2.0 Fast 拒掉 26.0%(50 个样本)、Seedance 2.0 拒掉 14.9%(148 个样本)、Seedance 2.0 Mini 拒掉 14.0%(50 个样本)。Nano Banana Pro 拒掉 12.5%(96 个样本)。另一头,VEO 3.1 Lite(74 个样本)、Kling V3 Omni(35)、Z-Image Turbo(92)、Seedream 5.0 Pro(53)和 Grok Imagine(137)在这个取样窗口内一次都没拒过。

为什么 AI 模型会拒掉我上传的图?

我们的数据里,最常见的单一触发因素是参考图里有真人脸。提示原文是 "The request failed because the input image may contain real person."。其次是露骨或性暗示内容、名人肖像("Celebrity or public figure imagery is not supported.")、涉及未成年人的内容,以及水印和版权问题。这些几乎全部是被参考图触发的,不是文字提示词。

被拒和模型失败是一回事吗?

不是,而把两者混在一起,正是多数可靠性对比毫无用处的原因。审核拒绝意味着模型正常工作、是它的内容策略拒了这次请求;供应商失败意味着这次生成本身坏掉了——超时、502、队列拥堵。成因不同,解法也不同。我们的数据里两者几乎不重叠:拒得最多的(Seedance 2.0 家族)供应商失败率是 0%,而失败最多的(Grok Imagine 16.1%、Seedream 5.0 Pro 17.0%)一次都没拒过。

被拒的生成会扣我的钱吗?

在 FlyAIgh 上不会——失败和被拒的生成会自动退还积分。在 26% 的拒绝率下,这件事比听起来重要得多:它决定了你是为一条可用的片子付钱,还是为一条可用的片子外加三分之一条付钱。各平台政策不同,在拒绝率高的模型上批量跑之前先确认一下。

改写提示词能避开拒绝吗?

通常不能,因为我们数据里绝大多数拒绝是被参考图触发的,不是文字。把真人照片换成生成的角色、把可辨认的脸裁掉、或者去掉源图上的水印,都比改措辞有效得多。只有那一小部分因露骨或性暗示措辞被拒的情况,改写提示词才管用。

如果我的参考图里就是有真人,该用哪个模型?

按这个取样窗口,VEO 3.1 Lite、Kling V3 Omni 和 Z-Image Turbo 一次都没拒过,GPT Image 在 403 次生成里拒了 4.0%——那是这组数据里最大的样本量,因此也是最可信的一个数字。要避开的是 Seedance 2.0 家族。注意这反映的是 2026 年 5 至 8 月的策略行为;模型供应商调整过滤器是不打招呼的。

这份数据基于多少次生成?

1,480 次生成,来自 341 个账号、跨 40 个模型,运行于 2026-05-06 至 2026-08-21 之间。其中只有 11 个模型的有效样本超过 30 次,进入了表格。计算拒绝率前剔除了 59 次失败:它们的责任在我们这边而不在模型——接入错误,以及提交阶段的平台层失败。留着它们会让某个模型看上去有 47.6% 不可靠,而它真实的供应商侧失败率是 0%。

Build a consistent character on FlyAIgh

Identity refs + AI-derived persona + outfit variants, bound to a character ID that auto-injects into every model. 25 free credits, no card required.