通过机器学习与人工智能测量和促进和平
Measuring and Fostering Peace through Machine Learning and Artificial Intelligence
论文信息
标题: Measuring and Fostering Peace through Machine Learning and Artificial Intelligence
作者: P. Gilda, P. Dungarwal, A. Thongkham, et al.
发布日期: 2026-01-08
arXiv ID: 2601.05232v1
PDF 链接: 下载 PDF
3 分钟速览
- 研究问题:这篇论文试图用机器学习和人工智能自动测量国家层面的和平程度,并开发能实时提升用户媒体素养、促进和平对话的在线工具。
- 核心方法:用神经网络分类新闻文本嵌入来区分高/低和平国家;用 Google GoEmotions 和大语言模型(LLM)分析 YouTube 视频文本的社会情感维度;设计 Chrome 扩展 MirrorMirror,给用户实时反馈其观看视频的和平度。
- 关键结果:LLM 与人类专家在五维度和平评分上的最高皮尔逊相关系数达到 0.773(Gemini 3 Pro Preview,见论文图 3),且所有模型在国家级别的跨数据集分类中完全正确。
- 主要局限:新闻训练的模型在 YouTube 口语化文本上严重过泛化,几乎全部判为高和平;GoEmotions 因上下文窗口小、中性基线高和平均化问题,与人类评分的相关性极弱();缺乏多模态信息与因果行为证据。
- 适合读者:计算社会科学、和平研究、内容安全、媒体分析领域的学者与工程师,以及关注 AI 伦理与用户体验的产品设计者。
论文背景和研究动机
团队此前已用知识图谱、监督学习和检索增强生成等方法,从词汇层面分析高低和平国家新闻的语言差异。本文往前再跨一步:不仅测量和平,还试图 “培育和平”。研究动力来自两组现实观察:
- 语言是冲突与和平的开关,“仇恨言论” 导致暴力,而 “和平言论” 的特征尚未被充分量化。
- 71% 的 16–40 岁人群每天通过社交媒体短视频获取新闻,内容创作者故意制造愤怒等情绪来获取点击,这放大了对立与极化。
因此,研究者希望开发一套自动化工具,既能从新闻和社交媒体的文本中感知一个国家的和平光谱,又能帮助普通用户察觉其所消费媒体的情绪基调,从而实现从 “测量” 到 “干预” 的闭环。
核心方法和技术细节
新闻数据:基于文本嵌入的神经网络分类
研究者从 News on the Web(NOW)语料库收集了约 70 万篇来自 18 个国家的新闻文章,根据外部和平指数给每个国家打上高/低和平标签。文本经 n-gram 预处理后,用 OpenAI 的 text-embedding-3-small 模型转换为 1536 维嵌入向量,作为神经网络的输入。
测试了三种架构:两层卷积网络(CNN)、四层全连接前馈网络以及加入最大池化的改进 CNN。所有模型均采用 80/20 训练测试划分,Adam 优化器(学习率 0.001),二元交叉熵损失,训练 10 个 epoch,并施加 0.3 的 dropout 防过拟合(见论文第 II-B 节)。
YouTube 数据:从词汇情感到语境理解
新闻分类模型在 YouTube 口语化转录文本上全部失败(95‑100% 被判为高和平),说明视频中和平不是由特定话题决定,而是由 “怎么说” 决定。因此转向两种方法:
- Google GoEmotions (RoBERTa):对语句进行 28 类细粒度情感分类,再映射到五个人类专家确定的和平维度(同情‑蔑视、新闻‑观点、预防‑促进、秩序‑创意、细腻‑简单)。但该方法只能看到句子级情绪,且大量输出 “中性”,加上直接求平均会抹平情绪的剧烈波动,导致与人类评分相关性极弱。
- 大语言模型 (LLM):采用迭代提示工程,先为正式新闻设计了详细提示,发现对 YouTube 过于复杂,后简化为可泛化的提示。最终方案结合了 GoEmotions 输出的量化情绪分数与全文上下文,让 LLM 在 5 分量表上打分。测试了 GPT‑3、GPT‑4‑mini、Gemini 等多个模型,部分模型还使用了检索增强(+R)的混合架构。
为建立评判基准,人类和平研究专家对 52 个 YouTube 视频进行五维度独立评分,维度内评分者间相关系数超过 0.93(见论文表 II),证明维度可被可靠观测。
创新点和贡献
- 将文本嵌入驱动的神经网络大规模应用于跨国和平测量,无需依赖特定语言的词典,直接利用高维语义空间区分和平与冲突国家的媒体报道。
- 系统对比了词级情感模型与上下文级 LLM 在复杂社会维度评估中的能力鸿沟,证明单靠表面情绪分类无法替代对叙事框架和微妙立场的理解。
- 提出 “合成模型” 思路:将 GoEmotions 的结构化情绪数据作为 LLM 的辅助输入,以提升可解释性和可信度,避免纯端到端黑箱。
- 以人本设计(HCD)开发了可落地的 MirrorMirror 扩展,把和平研究成果转化为面向普通用户的实时反馈工具,试图超越单纯的点击指标,推动更尊重的沟通。
实验结果分析
新闻分类:跨数据集泛化
在 NOW 测试集上,三种神经网络准确率均超过 96%(CNN 97.24%,前馈网络 97.48%,改进 CNN 96.99%)。在独立 Capstone 和平语料库(16 国,60 万篇)上,单篇文章准确率降至约 70%‑73%(见表 I),但按国家聚合后,全部模型都能正确判断该国属于高或低和平类别。这表明模型学到的语言特征具有一定跨域稳定性,尤其在国家层面的区分度完全保留。
然而,这些模型一遇到 YouTube 转录文本就集体失效,说明书面新闻与口语视频的风格鸿沟极大,基于话题的嵌入表达无法迁移到情绪化和口语化的媒体形式。
YouTube 分析:LLM 大幅领先
在同情‑蔑视维度上,GoEmotions 与人类评分相关性仅 ,而 Gemini 3 Pro Preview 达到 0.773(图 2)。扩展到全部五个维度,Gemini 系列模型普遍优于 GPT 系列,尤其在 “细腻‑简单” 等需要理解多重观点的维度上,Gemini 3 Pro Preview 比之前版本提升 +0.317(图 3)。这一结果表明,最新的推理模型开始捕捉到早期模型难以处理的 “灰色地带”。
另外,为 LLM 加入 RoBERTa 情感特征的混合模型效果参差不齐,说明额外的信号并非总能自动改进推理,提示工程和模型架构的匹配更为关键。
实践建议
MirrorMirror 从研究走向开放工具的过程中,以下实践方向值得参考:
-
多阶段评估管线 别指望单一模型解决所有问题。将轻量级情绪分类器(如 GoEmotions)作为特征提取器,与高成本的 LLM 上下文评估组合,既控制延迟,又保留深度理解。在用户侧可先用 GoEmotions 做粗略实时反馈,再在后台异步调用 LLM 生成更准确的和平度报告。
-
以人为中心的迭代设计 论文强调 HCD 流程,包括设计课程学生和外部用户的反馈。实际开发中应持续用人类专家标注的金标准(如 52 个视频的评分)校准模型,并定期更新,以避免模型与不断变化的媒体语言脱节。
-
多模态融合是下一步 论文已指出纯文本分析的局限,未来的扩展应整合音频特征(语气、语速)和视频画面信息,这可能需要结合预训练的多模态模型(如 Gemini 或 GPT‑4 的视觉能力)。在落地上,可以先在少数有授权的新闻视频上实验,再逐步扩展。
-
从个体工具到平台信号 MirrorMirror 目前是面向用户的浏览器扩展,但长期目标是为内容创作者、记者和平台提供开放工具。可考虑提供 API,让内容管理后台直接展示视频的和平维度评分,辅助编辑判断,或在推荐算法中引入 “平和度” 作为多样性权重,减缓情绪极化。
-
注意隐私与伦理风险 实时分析用户观看的媒体内容,需确保数据不离开本地或充分匿名化。提示用户了解其媒体饮食的演变趋势,而非被平台监控,这一点在 UX 设计上尤为关键。研究者的长期目标推动 “自我觉察” 正是这一工具区别于商业监控产品的核心价值。
通过上述工程化路径,学术研究有望转化为真正能降低冲突热度的公共产品。