COMIC:基于智能体的素描喜剧生成
COMIC: Agentic Sketch Comedy Generation
论文信息
标题: COMIC: Agentic Sketch Comedy Generation
作者: Susung Hong, Brian Curless, Ira Kemelmacher-Shlizerman, et al.
发布日期: 2026-03-11
arXiv ID: 2603.11048v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文要解决全自动生成类似《周六夜现场》风格的喜剧短剧视频的难题,包括构思幽默场景、写出搞笑剧本、生成高质量且连贯的视频。
- 核心方法:提出一个名为 COMIC 的多智能体系统,模拟人类制作团队的编剧、评论家和导演等角色。系统通过 “孤岛式” 竞争、多轮迭代淘汰和改进,并利用对齐真实观众偏好的 AI 评论家来评价和筛选内容。
- 关键结果:在人类评估中,COMIC 生成的视频在 “趣味性” 和 “观看更多” 意愿等维度上,大幅超越其他自动化视频生成基线,其趣味性评分介于 “略低于人类作品” 和 “与人类作品相当” 之间(表 3)。
- 主要局限:作者承认,迭代优化过程计算成本较高,且使用归一化的 YouTube 观看次数作为幽默质量的代理指标,可能引入标题党、算法推荐等噪音。
- 适合读者:对 AI 创意内容生成、多智能体协作、进化算法在开放场景应用、以及 AI 如何理解和生成幽默感兴趣的 AI 研究者、工程师和产品经理。
论文背景和研究动机
当前大型语言模型(LLM)虽在写作、编程等领域表现优异,但生成真正幽默的内容仍极具挑战。论文指出,直接让 AI 模型讲笑话,得到的往往是尴尬的谐音梗或冷笑话。幽默涉及主观性强、上下文依赖的多维空间,缺乏固定评判标准。因此,可靠地生产能让观众发笑的喜剧内容是一项尚未解决的难题。
论文观察到,与数学或编程等有标准答案的任务不同,像喜剧创作这类开放性创意任务的最高境界,需要一种全新的自动化范式。现有基于 LLM 的智能体视频制作系统通常采用单次、固定目标的流水线模式,缺乏探索不同视角的机制和反复迭代打磨的能力,无法适应喜剧创作中 “妙手偶得之” 的特性。
研究的动机在于,通过模拟真实喜剧节目的制作流程——编剧团队集体头脑风暴、反复修改、筛选打磨,来构建一个全自动系统。同时,一个核心挑战在于如何自动化评估幽默。作者通过分析大量 YouTube 喜剧短片及其观众互动数据,建立了与人类偏好对齐的 AI 评论家,解决了自动评估这一关键难题。
核心方法和技术细节
COMIC 系统的核心思想是建立一个松散模仿人类制片厂的多智能体迭代竞争框架。其工作流可以分解为两个核心循环。
幽默评论家的对齐与生成是整个系统的基石。由于幽默主观且缺乏固定标准,作者从 YouTube 收集了 4,940 个喜剧短片数据,使用逻辑增长模型拟合观看次数随时间的变化曲线,为每个视频计算一个反映其长期吸引力的 “参与度分数”。随后,系统通过元评论家智能体,生成一个拥有多样喜剧品味(如滑稽、冷面、荒诞等)的评论家池,并根据其辨别高、中、低参与度视频的能力进行筛选,最终得到一个与真实观众偏好对齐的评论家小组。实验表明,针对不同喜剧风格频道(如 SNL、Key & Peele)分别挑选的最佳评论家,其评判准确性优于使用单一评论家(表 1)。
剧本创作循环引入了一个 “孤岛” 进化模型。系统将剧本置于多个隔离的 “孤岛” 上,每个孤岛由一个风格不同的评论家委员会统治,代表不同的喜剧偏好。在孤岛内部,剧本进行循环赛式的两两对决。评论家对两个剧本进行比较,并针对失败剧本的弱点给出具体书面反馈。失败剧本根据这些反馈进行重写,这种 “更新” 操作既吸收了优胜者的优点(语义交叉),又引入了新的变化(语义突变),模拟了优胜劣汰和基因变异。随着迭代进行,孤岛上的剧本质量不断提高,同时由于不同孤岛的评论家偏好不同,整个系统得以探索多样的喜剧风格,形成风格各异的高质量剧本集合(图 4)。
视频渲染循环则负责将剧本转化为视觉内容。首先,一个场景导演智能体为剧本生成多个版本的导演阐述,将脚本分解为一系列镜头,并详细说明构图、角色表情和运镜。然后,每组镜头进入迭代精炼过程:渲染初始镜头视频后,由另一个专为视频生成训练的、且与剧本条件匹配的评论家团队进行评估,提出修改意见并重新生成。通过记录每次迭代的历史版本,并在所有历史版本之间进行淘汰赛,选择出最佳镜头,以防止过度修改变形。最后,不同导演阐述生成的完整视频之间再进行一次淘汰赛,选出最终呈现的最佳作品。这个 “深度(迭代历史)” 和 “广度(不同阐述)” 结合的竞争机制,实现了推理阶段的质量扩展(图 5)。
创新点和贡献
- 首个全自动喜剧短片生成系统:COMIC 是首个针对喜剧视频生成这一开放性任务的端到端智能体系统,填补了自动化创意内容生产在该领域的空白。
- 基于观众数据对齐的自动评论家:论文创新性地提出不依赖人工标注,而是通过分析 YouTube 观众参与度数据来自动训练和筛选与人类偏好对齐的 AI 评论家,为无法定义明确奖励函数的创造性任务提供了可扩展的评估范式。
- 孤岛多智能体进化框架:通过将剧本放在由不同风格评论家支配的 “孤岛” 上并行进化,并采用循环赛式竞争淘汰,系统成功地在保证内容质量(赢率随迭代次数显著提升,图 6)的同时,维持了喜剧风格的多样性。同时,孤岛分区也降低了全联盟配对赛的计算复杂度。
- 深度与广度结合的视觉迭代:在视频渲染阶段,COMIC 不仅对单个镜头进行 “深度” 上的迭代精炼和历史择优,还在不同导演阐述版本之间进行 “广度” 上的探索和淘汰,形成了一种新型的、可在测试时通过增加计算量来提升画质和叙事效果的推理时扩展机制。
实验结果分析
论文进行了全面的人类评估和自动化评估。
人类评估:在趣味性、观看意愿、剧本、叙事、视觉真实性和一致性等多个维度上,COMIC 均大幅超越了基于故事板的自动化视频生成基线 VGoT 和 MovieAgent。一个关键发现是,COMIC 在与人类作品的比较中,其趣味性得分(平均 3.05 分,表 3)介于 “略逊于人类作品” 和 “与人类相当” 之间,而基线方法得分均接近 “远逊于人类作品”。尽管前沿视频生成模型 Sora 2 和 Veo 3.1 在视觉真实性和一致性上得分更高(可能得益于它们生成的视频更短),但 COMIC 在 “观看更多意愿” 上超过它们,表明强大的叙事趣味性可以有效弥补视觉生成的不足(表 3)。
自动化评估:使用对齐 YouTube 数据的视频评论家进行评测,结果显示 COMIC 的胜率(0.44,使用最佳单一评论家评估,表 4)远超其他方法。自动化评估给出的方法排名(COMIC > Sora > Veo > 其他代理基线)与人类评估结果基本一致,验证了该自动化评估方法的有效性。
消融实验证实了核心设计的有效性:
- 多岛 vs. 单岛:多孤岛配置相比单个大池子的配置,不仅整体赢率更高,而且剧本的细分领域特异性(特定胜率)也更高,证明多岛结构成功催生了多样化、高质量的流派(图 8)。
- 规模扩展性:从小型、基础到大型配置,随着孤岛数、剧本数、评论家数的增加,模型性能继续提升,显示出强大的测试时计算扩展性(图 9)。
- 评论家作用:在 A/B 测试中,包含评论家指导迭代的完整 COMIC 系统相比无评论家的消融版本,在脚本、叙事、真实感、一致性和趣味性等所有方面都获得了人类评审的压倒性偏好(图 10)。
实践建议
若计划将类似 COMIC 的智能体系统应用于自动化视频创作或其他开放性创意任务,可以从以下几个方面入手:
构建基于用户信号的评估体系:不要试图定义一个 “万能” 的质量公式。可以参考 COMIC 的方法,从真实的平台互动数据(如完播率、点赞、评论等)中提炼出能反映内容长期吸引力的代理指标,并利用它们来训练或筛选用于内容评估的 AI 模型。这种数据驱动的方法远比人工定义的规则更能捕捉真实用户的复杂偏好。
采用进化迭代而非单次推理的架构:对于创意性任务,单次生成高质量结果的概率很低,尤其是使用当前 LLM 时。设计一个反馈循环至关重要。在这个循环中,一个内容版本被 “评论家” 评估,其具体弱点被指出,然后交由 “编辑” 进行针对性修改。类似于沙里淘金,这种 “生成 -> 评估 -> 反馈 -> 重写” 的循环是提升内容质量的有效机制。
通过 “孤岛” 隔离来同时保证质量与多样性:当需要一个能产出多种风格高品质内容的系统时,单一的评价标准会抑制多样性。可以采取 “孤岛” 策略,即并行运行多个独立的创作团队,每个团队遵循不同的 “审美哲学” 或风格准则(通过赋予 AI 评论家不同的系统提示实现)。让每个团队在自己所属的风格赛道上竞争优化,最后从各赛道中选拔顶尖成果。这样既实现了个体的高质量,也确保了生态的多样性。
利用多版本生成与竞争作为推理时的扩展策略:在计算资源允许的情况下,对于关键生产环节(如视频生成中的导演阐述或单个镜头的渲染),可以成倍地增加生成版本的数量。然后,通过一场快速的自动淘汰赛,从多个候选版本中选出最优解。这种 “广度竞赛” 提供了一种可并行的、不依赖模型重新训练的推理时性能扩展路径,可以直接提升最终产出的质量。