Diffusion TV:通过有形与具身交互体验扩散模型
Diffusion TV: Experiencing Diffusion Models through Tangible, Embodied Interaction
论文信息
标题: Diffusion TV: Experiencing Diffusion Models through Tangible, Embodied Interaction
作者: Sihwa Park
发布日期: 2026-09-04
arXiv ID: 2609.05404v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:如何让非技术观众以可触摸、身体化的互动方式体验扩散模型 “从噪声到结构” 的生成过程,而不是依赖传统二维 GUI 的显式技术解释。
- 核心方法:改装一台 1987 年 GoldStar CRT 电视,将天线旋转映射到预生成图像/声音的去噪中间步骤,旋钮切换 Past、Present、Future 三个频道,构成一个互动装置。
- 关键结果:该装置于 ISEA 2025 公开展出;作者观察称天线去噪交互 “普遍被认为直观且引人投入”,但部分观众未完整探索顺序内容或预期额外行为(见论文第 5 节)。
- 主要局限:没有结构化用户研究或系统评估;结论来自作者展览观察和视频记录。作者也承认这种互动不保证观众精确理解扩散模型。
- 适合读者:关注可解释 AI、AI 艺术、具身交互、媒体考古、交互装置设计,以及生成模型公共传播的研究者和艺术家。
论文背景和研究动机
论文指出,自 Denoising Diffusion Probabilistic Models 提出后,扩散模型已成为图像、音频、视频生成的主流范式之一。其生成过程可被视为从噪声到结构化数据的迭代变换,因此具有时间上的可观察性。在可解释 AI(XAI)研究语境中,中间去噪输出常被用来分析模型行为,观察结构如何在时间中逐渐出现。然而,这些中间状态很少向研究圈之外的公众展示;即使展示,也多半是预渲染或静态可视化,观众缺少交互和身体性探索的机会。
作者进一步指出,XAI 大量研究集中在功能性、任务导向领域,创意场景中的应用相对不足。随着生成式 AI 越来越多地参与文化生产,如何让非专家理解其过程成为一个问题。传统方法通常依赖二维屏幕上的图形界面,作者认为这种方式偏重智识解释,而忽略感知与情感维度。相关工作如 Tangible Explainable AI、Graspable AI 和 Experiential AI 显示出物理交互、材料隐喻和审美品质可以支持对 AI 系统的体验式理解。论文正是在这一脉络中提出 Diffusion TV:它不试图精确讲解扩散模型,而是通过一台改装的 CRT 电视,让观众以身体操作去感受去噪过程。
核心方法和技术细节
Diffusion TV 的界面是一台 1987 年 GoldStar CMX-4200 13 英寸 CRT 电视。观众通过旋转电视天线控制视听清晰度,图像和声音会从接近噪声的状态逐渐过渡到清晰的动物形象与声音。论文将这一操作映射为扩散模型中从噪声到结构化输出的去噪过程。调节到最清晰后,系统短暂停顿便进入下一只动物,形成持续不断的生成循环(见论文第 1 节图 1)。
内容组织上,电视的 VHF 旋钮可切换三个频道:Past 频道展示灭绝物种;Present 频道展示濒危物种;Future 频道展示由 AI 想象的未来生物。每个频道在清晰画面出现时会以类似电视下三分之一字幕的形式显示极简背景信息。内容可配置定期更新,例如每日更新,使重复参观能获得不同的视听体验。
在数据层面,作者从 IUCN 红色名录和 WWF 等来源确定了 16 个灭绝物种和 14 个濒危物种;Future 频道的 12 个想象物种则由 ChatGPT o3 生成,包括物种名称、出现年份、环境诱因和简短介绍。图像与声音由 Stable Diffusion XL 和 Stable Audio Open 预生成,推理在 Google Colab 中执行,并使用 Diffusers 库的自定义回调函数提取每一步去噪输出。这些中间状态被保存到 Google Drive,供客户端调用。
系统架构如论文第 4 节图 2 所示:一台 Raspberry Pi 5 运行 Processing 客户端和 Python 传感器模块,通过改装后的 HDMI-RF 调制器将内容输出到 CRT 电视。天线通过 3D 打印连接件与旋转编码器机械相连,水平旋转产生连续控制信号,再映射到不同去噪阶段的图像/声音索引。VHF 旋钮处安装磁编码器,用于检测频道切换。Processing 客户端负责播放、互动映射、内容异步更新,可以在不打断交互的情况下检查并加载新生成内容。
创新点和贡献
本文的主要贡献不是算法改进,而是提出一种具身化的可解释 AI 艺术形式。它将扩散模型的核心过程——去噪——转译为一种观众可以手动调节的物理动作。相比只展示最终生成结果的常见做法,Diffusion TV 把中间状态当作第一手的体验材料,让 “生成过程” 本身成为作品内容。
第二个贡献是把广播电视的旧媒介语言与扩散模型隐喻性地连接起来。天线、频道旋钮、下三分之一字幕等元素构成了熟悉的文化框架,使抽象的 AI 机制可以被观众以身体记忆和日常经验接近。论文将这一做法放在媒体考古学和过时技术再用的传统中,体现了技术形式与生态叙事之间的互文。
第三个贡献是为 XAIxArts 提供案例:它不采用传统技术解释,而采用感官、隐喻、具身互动来激发对生成技术和环境议题的反思。这种设计思路对交互装置、AI 艺术策展和公共科技传播都有参考价值。
展览观察与讨论
Diffusion TV 于 2025 年 5 月 23 日至 29 日在韩国首尔 Hangaram Design Museum 的 ISEA 2025 上首次公开展出。作者强调,以下反思基于展览观察和视频记录,并非结构化实证评估。
据论文第 5 节,观众大多通过自行探索学会操作;对 CRT 电视的既有熟悉度影响了互动表现:年长参与者更能凭直觉上手,年轻观众有时会在界面操作上遇到困难。天线去噪交互被普遍认为直观且有趣;但也有参与者没有完全探索顺序生成内容,或者期待系统产生更多行为。作者认为,调谐隐喻有助于观众对生成过程形成体验性参与,即便没有明确文字说明,也能鼓励对主题的解读。
由于没有定量数据,这些观察只能视为初步设计反馈,不能得出关于学习效果或理解深度的结论。作者也没有声称该装置比传统 XAI 方法更能帮助观众掌握扩散模型。
实践建议
如果要复现或开发类似的具身 XAI 装置,可以优先保留 Diffusion TV 的 “预生成 + 嵌入式播放” 架构。论文显示,在 Raspberry Pi 5 上通过 Processing 客户端调用预生成的去噪中间状态,既能保证响应及时,也能避免在展览现场进行高成本实时推理。若追求更灵活的生成行为,作者在第 6 节提到未来可扩展到实时或混合推理管线,但这需要在响应速度与硬件算力之间做权衡。
物理映射方面,天线旋转到去噪步骤的索引需要设计合适的步长。步长太细会让观众感觉变化微弱,步长太粗则会跳过中间状态、削弱 “去噪” 过程的体验。论文观察到部分观众没有完整探索顺序内容,因此在互动引导上可以考虑增加极简提示,例如让天线自然停在某个中间状态,或使用视觉线索提示可以继续旋转。
对于面向公众的 XAI 研究或展览,不应只记录 “观众觉得有趣”。建议补充结构化观众研究,包括行为日志、问卷和访谈,以区分体验投入与机制理解之间的差异。作者也明确将 “结构化观众研究” 列为未来工作,因此这既是对本文局限的回应,也是后续研究可以深化的方向。
最后,若加入频道切换或内容更新功能,应尽量保持互动上下文连续。Diffusion TV 采用异步更新策略,在后台检查新内容而不打断交互,这种方式适合需要长期运行或每日更新内容的展览环境。