ConVAWG:一种面向暴力侵害妇女和女童领域的基于检索的受控合成对话生成框架
ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls
论文信息
标题: ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls
作者: Chen Lyu, Xingwei Tan, Simon Cullen, et al.
发布日期: 2026-08-11
arXiv ID: 2608.11200v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:该论文要解决在暴力侵害妇女和女童(VAWG)领域,真实多轮对话数据难以大规模获取、发布与标注的问题,现有毒性研究多停留在句子级,难以刻画虐待的关系性与时间展开。
- 核心方法:提出 ConVAWG 框架,将英国 DHR 案例检索、CPS 犯罪定义、ONS 统计和 PersonaHub 人物种子结合,经 “情境构建→层级事件图→角色扮演对话→激活引导毒性注入” 四阶段生成可控多轮对话。
- 关键结果:发布 200 个场景、6,171 个对话事件;在四法官 LLM-as-Judge 与人评中,ConVAWG 总体得分分别为 4.75 与 4.62,优于八个基线,且对话级平均分差异显著(表 1;Holm 校正 Wilcoxon p < 1e-4)。
- 主要局限:生成资源以英国法律、统计和 DHR 案例为基准,跨司法辖区迁移受限;只能覆盖有对话痕迹的虐待行为,非沟通性行为不在数据范围内(见论文 Limitations)。
- 适合读者:从事敏感领域对话生成、毒性/虐待检测、事件与时序建模、合成数据评估及在线安全 NLP 系统的研究者与工程师。
论文背景和研究动机
在亲密关系胁迫、跟踪骚扰等 VAWG 场景中,虐待很少只表现为孤立的有毒句子。消息可被用于监控、威胁、孤立受害者,线下暴力也常通过消息被计划、披露或回溯。然而,隐私和法律约束使大规模真实对话数据难以释放,已有研究多集中在帖子或句子级性别歧视与毒性检测,留下对话级、关系性、时序展开建模的空白。
近年 LLM 角色扮演与 persona 条件生成提高了合成对话的流畅性和人物一致性,但其本身并不足以生成跨实体、跨场景、毒性随事件升级的 VAWG 对话。ConVAWG 由此被提出:不是生成孤立毒性文本,而是从结构化场景与事件时间线出发,生成多场景、多说话人的在线对话,使虐待动态、时间进展和毒性强度可分析。
核心方法和技术细节
ConVAWG 分四个阶段。
阶段 1:真实案例引导的人物与情境构建。 先从 410 份公开英国家庭凶杀审查(DHR)报告中抽取结构化记录并建立向量索引;再从 PersonaHub 采样人物种子,并用英国国家统计局(ONS)受害者统计和 CPS 犯罪定义过滤与约束。给定种子与检索到的真实案例模式,模型生成结构化情境规格:受害者、施暴者、关系类型、犯罪类别、虐待时长、第三方角色,以及叙事大纲。
阶段 2:层级事件图与聊天脚本规划。 将叙事大纲抽取为约 5–8 个高层事件的有向图,边表示时序、因果、证据、对比和升级关系;每个高层事件再分解为 2–4 个子事件,并分配 0–4 级升级等级和时间戳。早期事件间隔较疏,后期高风险事件更密集。在线事件直接转为聊天脚本,离线事件则通过事前计划、事中更新或事后回溯消息来表现。
阶段 3:角色扮演式在线对话生成。 生成器以当前聊天脚本和前文连续性上下文为条件,并控制初始说话者分布;过长回复被后处理为更短聊天轮次。风格控制采用检索式风格笔记,分别按人物、升级等级和犯罪类型注入提示,以保持跨场景语言风格一致且随虐待升级而变化。
阶段 4:定向毒性注入。 只重写被 LLM 标注为升级行为的施暴者话语,如指责、要求、威胁、监视、煤气灯操控。重写使用对比激活添加(CAA),从 Civil Comments 的有毒/清洁对比对中估计毒性方向向量,并按下式扰动隐藏状态:
其中 是归一化方向, 按升级等级设置低、中、高三档强度。非升级消息保持不变,因此毒性只出现在情境合理的节点,而非均匀加毒。
创新点和贡献
- 将 VAWG 建模从句子级毒性推进到对话级、关系性和时序展开现象。
- 以检索接地、层级事件规划和升级感知毒性控制协同,提升多场景长时序生成的连贯性与领域保真度。
- 发布首个 VAWG 对话数据集:200 个 CPS 对齐场景、6,171 个对话事件,平均每场景 31 个对话、每对话 15 轮,覆盖 18 类 CPS 犯罪类型并附带场景/事件/轮次级元数据。
- 建立人评与四种 LLM 法官评估体系,两者在对齐上达到高一致性(平均 Gwet’s AC2 ≥ 0.925,表 2),并辅以消融和下游任务验证。
实验结果分析
在 50 个匹配人物上,ConVAWG 的 LLM-as-Judge 总平均与对话级平均均为 4.75,优于五个直接生成基线和三个框架基线(表 1);其 Humanlikeness 为 4.51,高于直接 GPT-5.2 的 4.34,Toxicity Realism 为 4.93,居所有系统之首。统计上,ConVAWG 在 Avg 与 Avg-D 上显著高于全部基线(Holm 校正 Wilcoxon p < 1e-4,表 4)。人评结果同向:全数据集平均 4.62,共享子集上 ConVAWG 为 4.62,高于 DeepSeek-V4-Flash 的 4.33 和 GPT-5.2 的 4.28(表 1)。
一个值得注意的现象是,直接 GPT-5.2 在 Crime Fidelity(5.00)和 Scenario Realism(4.83)的 LLM 法官分上略高于 ConVAWG(4.99、4.53)。作者将其归因于评分面不对称:单轮单次全局评分更偏好简短、紧密复述情境的生成,而非更长、多场景、非单调升级序列。人评则反转:在共享子集上,ConVAWG 的 Crime Fidelity 为 4.75,高于 GPT-5.2 的 3.80;Scenario Realism 为 4.50,高于 GPT-5.2 的 4.30(论文第 5.3 节)。
消融显示,移除风格笔记后总体平均分下降约 0.13–0.16,其中 GPT-5.2 法官下 Persona Consistency 下降 0.65(附录表 11);关闭 CAA 后 Detoxify 毒性从 0.144 降至 0.038,而 LLM 法官质量基本稳定(附录表 12),说明 CAA 主要控制显式毒性措辞。下游任务中,毒性行为分类的宏 F1 最高为 0.782(DeBERTa-v3,带上下文),关系分类加权 F1 最高为 0.629(表 5、表 6)。升级预测中,持久性基线虽在等级准确率上达 0.703,但跳变 F1 为 0;Longformer-4096 在跳变 F1 上达 0.548(表 7)。跨语料迁移至 Conversations Gone Awry 的最佳 AUROC 为 0.643,超过随机水平(表 8)。
实践建议
若要构建敏感领域可控合成数据集,宜采用 “结构化场景 + 事件图 + 分阶段生成”,而不是单轮提示直接生成长对话。该论文的基线比较表明,直接生成在简短的全局评分上可能占优,但在对话级人评和毒性现实性上不如 ConVAWG(表 1;第 5.3 节)。因此评估体系应同时纳入对话级与全局指标,并结合校准后的人评与多法官评分,避免只依赖单一 LLM 法官。
在毒性控制上,“选择性重写” 比全对话加毒更可取。CAA 可以单独调节显式毒性强度,且在该实验设置下关闭 CAA 不会显著拖累对话质量(附录表 12)。需要调节检测难度时,可在保持自然对话的前提下改变重写比例或 档位。
下游任务设计应区分 “可控制性验证” 与 “外部效用验证”。论文中升级预测的跳变 F1 比单纯等级准确率更有信息量,因为稳态准确率高但无法捕捉风险突增(表 7)。早期预警系统宜关注跳变和 “虐待周期” 中的非单调轨迹,而非仅预测平均等级。
部署与使用时需遵守数据使用协议:不用于真实个体决策、不用于训练以生成虐待内容为主的系统,且不公开校准后的毒性引导向量与毒性注入提示(论文 Ethical Considerations)。若跨法域应用,应重新对齐当地法律定义和统计分布,因为 ConVAWG 的犯罪类别和案例模式为英国特定(论文 Limitations)。