面向主动数据收集、出行行为建模与天气敏感需求预测的智能体方法

An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

arXiv: 2608.20320v1

论文信息

标题: An Agentic Approach for Active Data Collection, Travel Behavior Modeling, and Weather-Sensitive Demand Prediction

作者: Narges Ahmadi, Yubo Jiao, Jônatas Augusto Manzolli, et al.

发布日期: 2026-08-20

arXiv ID: 2608.20320v1

PDF 链接: 下载 PDF

3 分钟速览

  • 研究问题:论文试图打通旅行行为研究中数据收集、数据处理和预测建模相互割裂的环节,并系统评估大语言模型(LLM)在天气敏感通勤方式选择预测中的能力。
  • 核心方法:提出数据收集、数据处理、数据建模三个智能体组成的工作流;用聊天机器人收集 92 名 McGill 学生通勤者在 5 种天气场景下的方式选择,并用 MNL、随机森林和 9 个本地 LLM(含零样本、少样本、人格、视觉配置)进行预测。
  • 关键结果:在 454 个观测上,最佳视觉配置的五类方式选择准确率为 71.5%,最佳文本零样本 LLM 为 69.9%,随机森林为 69.6%;作者明确表示这些只是点估计差异,不能视为统计显著优势(论文摘要、表 3)。
  • 主要局限:样本仅为 92 名单一大学学生,且属于陈述偏好而非实际出行行为;每个天气条件只使用一张固定图像;多智能体框架本身未与常规研究流程做对照实验。
  • 适合读者:交通行为与交通需求预测研究者、交通规划从业者,以及对 LLM 行为模拟和多智能体工作流感兴趣的 AI/数据科学人员。

论文背景和研究动机

方式选择是交通规划的核心问题,因为它决定需求如何分布在不同交通系统上,并影响基础设施、环境影响和可持续出行政策。天气是影响方式选择的重要情境变量:降水、极端温度和道路条件会降低步行和骑行的吸引力,使出行者转向公交或私家车。然而,观测数据往往不能覆盖各种天气条件,因此需要陈述偏好(SP)调查来填补这一空白。

传统 SP 调查通常用固定文字描述情境,要求受访者自行构建天气、道路状况等视觉信息。这不仅增加认知负担,也限制了情境一致性。与此同时,AI 进展为调查和建模提供了新可能:对话式聊天机器人可以引导答题并嵌入多媒体,生成式 AI 可以创建图像情境,LLM 可以在少量甚至零任务特定训练下进行行为预测。

但已有研究大多单独评估这些工具,尚未把对话式调查、结构化数据处理、传统离散选择模型、机器学习模型和 LLM 预测放在同一个可审计的工作流中。本文的直接动机,就是把这些阶段连接起来,并回答两个问题:LLM 的预测性能如何随提示设计和输入信息变化;视觉能力 LLM 能否直接利用受访者看到的天气图像进行预测。

核心方法和技术细节

论文提出一个三智能体框架:数据收集智能体、数据处理智能体、数据建模智能体。每个智能体是目标导向、受研究者监督的软件组件,可以调用受限工具,并产出结构化输出。智能体之间通过类型化数据对象传递,而不是自由自然语言通信,以减少错误传播并提高可审计性。

数据收集智能体 以研究者定义的问卷规范为输入,生成可部署的对话式调查。案例研究使用 Voiceflow 构建了 TravelBehaviorSurveyBot,通过网页链接和二维码分发。调查收集人口统计、出行资源、冬夏惯常通勤方式、周方式使用频率和因素重要性评分,然后让受访者依次完成 5 个天气场景下的方式选择。每个场景展示一张生成式照片级图像,对应 Sunny、Hot–humid、Rainy、Foggy/cold、Snowy 五种条件;所有受访者看到相同的固定图像。每个场景下可选方式为步行、骑行、公交、自行车+公交、驾车。

数据处理智能体 将聊天机器人导出的 JSON 原始数据解析为分析就绪数据集。处理步骤包括解析嵌套列表和滑块字段、验证并重编码分类变量、构造衍生特征、标记缺失或不一致记录。92 名受访者本应产生 460 个观测,但有 6 个因方式选择缺失或无法解析被排除,最终得到 454 个有效受访者—场景观测(第 4.2 节)。

数据建模智能体 实现两类模型族:传统模型包括 Biogeme 中的 MNL、逻辑回归和随机森林;LLM 族包括 9 个本地运行模型,参数量从 2B 到 35B。评估使用按受访者分组的交叉验证,确保同一受访者不会同时出现在训练集和测试集。LLM 提示设计系统性地交叉两个维度:Expert(EXP)与 Role-Play(RP)两种框架,以及 Base Context(BC)与 Richer Context(RC)两种信息水平;RC 额外包含惯常出行信息。在此基础上进一步扩展人格增强、少样本 k 值和视觉输入配置。

创新点和贡献

论文列出四个主要贡献。第一,开发了对话式、图像增强的 SP 调查,用聊天机器人收集多天气场景下的重复方式选择,形成面向下游行为预测的结构化数据。第二,提供天气相关方式选择的经验证据,展示同一个体在不同天气条件下的陈述选择变化。第三,系统评估 LLM 作为方式选择预测器,覆盖零样本、少样本、人格增强、旅行历史增强和视觉输入,并与 MNL 和机器学习基准对比。第四,展示了一个从调查管理、数据处理到离散选择、机器学习和 LLM 建模的完整多智能体工作流,为未来可复现的 AI 辅助交通行为研究提供基础。

这些贡献中,多智能体工作流本身并不自动提高预测准确率;论文作者也承认,其价值更多在于模块化、可追溯性和集成能力(第 6 节)。

实验结果分析

天气敏感的行为证据。 描述性结果和 MNL 一致表明:恶劣天气显著抑制骑行相关选项。图 4 显示,公交份额从 Sunny 场景的 17.6% 升至 Snowy 场景的 45.1%;骑行和自行车+公交的份额在 Snowy 场景接近极低水平。MNL 系数进一步支持这一模式:以步行和 Sunny 为参照,骑行在 Snowy 条件下系数为 −1.820-1.820(p=0.009p=0.009),公交在 Snowy 条件下系数为 +1.324+1.324(p<0.001p<0.001),驾车在 Snowy 条件下系数为 +1.042+1.042(p=0.003p=0.003)(表 2)。这表明在该样本中,不利天气使出行者更多转向公交和驾车。

传统模型性能。 在相同的按受访者分组的五折交叉验证下,随机森林五类准确率为 69.6%,二元主动/非主动分类准确率为 88.8%;逻辑回归分别为 60.2% 和 85.1%;MNL 分别为 44.7% 和 81.2%(第 5.1.2 节)。MNL 提供行为可解释性,而随机森林提供更强的数据训练预测基准。

LLM 零样本结果。 习惯性出行信息是最稳定的预测信号来源。以 Gemma 3:4B 为例,EXP-BC 五类准确率为 41.3%,EXP-RC 升至 64.2%(表 3)。Expert 框架总体上优于 Role-Play 框架,尤其在小模型上更明显。最佳文本零样本五类点估计来自 Gemma 4:12B 的 EXP-RC,约为 69.9%(表 3),与随机森林的 69.6% 接近。论文作者未报告这些差异的统计显著性。

高级配置。 人格增强主要在 BC 条件下有用,因为此时缺乏直接旅行历史;在 RC 中已包含习惯出行信息后,人格带来的额外增益有限。少样本提示提高若干模型的五类预测,但随着示例数增加,收益在大约 10 个示例后趋于稳定(图 7)。视觉输入为部分模型提供额外信息,最佳视觉配置五类准确率达到 71.5%(论文摘要),但并非所有视觉能力模型都受益;因此多模态能力本身并不自动保证更强的预测。

需要强调的是,以上均为该小规模、单一大学样本上的点估计。论文作者明确提醒,多个模型和提示配置在同一测试集上的探索性比较,可能使最高准确率部分来自选择效应(第 6 节)。

实践建议

如果要在工程或研究场景中借鉴这套流程,可以从以下几个方面入手。

调查系统设计。 聊天机器人调查适合小规模、需要嵌入图像或多媒体情境的 SP 研究。部署时应保持调查逻辑固定,限制 LLM 只能进行程序性澄清,不能修改实验属性或推荐选项;原始响应应作为不可变数据保存,后续清洗和排除全部记录为独立操作。

LLM 预测的定位。 在缺少标注出行数据、或需要快速建立基线时,LLM 零样本预测可以作为一个补充信号,但不建议替代随机森林等传统训练模型。更稳妥的做法是保留 MNL 或可解释模型的输出,并用随机森林等作为强预测基准,同时将 LLM 视为可以灵活吸收非结构化信息的一种工具。

提示与特征工程。 论文结果显示,习惯性出行信息是提升 LLM 方式选择预测的最一致因素。因此,实际应用中应优先在提示中提供受访者惯常的冬夏通勤、周方式频率等信息,而不是优先构造复杂的人设。人格描述更适合在无法获得直接旅行历史时使用。

视觉输入需谨慎。 视觉图像可能对部分 LLM 有益,但本文每个天气条件只使用一张固定图像,不能区分天气条件本身和图像身份的影响。若要在生产或规划中部署,应先用多张同场景不同图像验证泛化,避免模型只是记住了特定图像。

多智能体工作流。 该框架的主要价值在于模块化和可追溯性:调查、处理、建模各自独立,输出结构化对象,便于定位错误和版本控制。实践中可以按同样方式拆分,但不应期待任务拆分本身带来性能提升;任何环节的修改都应经过研究者审批并作为新工作流版本运行。