海军联邦信用合作社合成数据试点项目揭示的洞察
海军联邦信用合作社与Qualtrics合作开展合成数据试点,发现合成数据在理性判断和效率上表现优异,但在情感理解方面存在局限。

现役军人事务繁忙,鲜有空闲时间,更不愿将宝贵闲暇用于填写调查问卷。这对海军联邦信用合作社(Navy Federal Credit Union)研究战略助理副总裁凯瑟琳·迈尔斯(Kathleen Myers)而言,是一大挑战。该金融机构专为军人、退伍军人及其家属服务,需要会员反馈以精准满足其需求。
对于分析难以触达群体的研究团队而言,合成数据——即旨在模拟真实世界的人工智能生成数据——成为一种颇具吸引力的替代方案。
研究团队已开始使用合成数据,且兴趣与日俱增。Qualtrics发现,41%的市场研究人员正利用合成数据补充或替代真人受访者,62%的受访者表示有意使用。
“现役军人极难触达,”迈尔斯表示,“一旦确信模型已适当调优,便能将其用于快速反馈或大规模反馈,这对我们而言是巨大机遇。”
该信用合作社与Qualtrics合作开展试点项目,旨在了解合成数据相较于第三方真人样本的表现。
“我们的初衷是测试与学习,而非确立用于决策的硬性关键绩效指标,”迈尔斯说,“这本质上是创新探索。”
合成数据优势众多——可节省时间、减少偏差、降低成本。但该技术是否已成熟到可投入实际应用,专家间仍存争议。
对迈尔斯而言,关键在于合成数据的应用场景。
“需审慎选择使用场景,”迈尔斯表示,“我们发现合成数据擅长理性判断,回答功能性导向问题表现优异;但涉及情感层面,则稍显棘手。”
试点发现:理性与情感的差距
海军联邦与Qualtrics利用合成数据测试普通人群对信任及金融服务的态度,以评估潜在信用卡产品。尽管该金融机构看到合成数据在军人群体中的潜在价值,但首次测试仍采取更广泛的方法。
试点旨在确定传统回答与合成回答的相似度、差异领域、时间与成本节省情况,以及是否(及频率)会得出相同决策。
海军联邦提供了一份调查问卷,经与Qualtrics审阅修订后,Qualtrics向501名传统第三方样本成员发放问卷,并据此建模生成498份合成回答。
在所有问题上,人类与合成回答总体一致。两组平均分差异在0.25%以内。
但差异依然存在:合成回答更倾向于强调效率或财务收益,却低估了对同理心的需求。
另一方面,Qualtrics发现合成数据可减少人类偏差。李克特量表问题(即询问同意程度的问题)常受默许偏差影响,人类无论是否真正同意,更倾向于表示赞同。
人类还易受社会期望偏差影响,更可能回避承认风险行为。合成回答则呈现出更差异化的回应。
人类表示因担心被拒而犹豫申请信用卡
试点中,合成与人类被问及对“我因可能被拒绝而犹豫申请(额外)信用卡”的同意程度。此类问题易受默许偏差和社会期望偏差影响。海军联邦观察到20个百分点的差异:41%的人类受访者表示同意,而合成回答中仅21%同意。
合成数据“在社会迎合方面偏差更小,”迈尔斯说,“他们更可能诚实回答,没有羞耻或尴尬感,因此在敏感话题上可能获得非常坦率的答案。”
合成数据的挑战
人类并非总是理性,他们情绪化且易冲动。这正是合成回答难以企及之处。
尽管合成数据擅长减少偏差,但在模拟人类情感及情感对行为的影响方面,准确性不足。
以试点调查中对各行业信任度的回答为例,合成回答更倾向于信任所有行业,而人类则能区分不同行业。
另一显著差异出现在消费者担忧方面。合成回答更可能将网络犯罪列为首要担忧,24%的合成回答选择此项,而人类受访者仅6%。然而,合成回答更贴近皮尤研究中心的研究——约五分之一的美国成年人曾因网络诈骗或攻击损失钱财。
合成数据提供逻辑性回答,但低估情感因素
合成回答偏向效率或财务收益,却低估情感因素,迈尔斯表示。
“我们观察到,合成数据对问题提供更理性的回答,能逻辑有效地处理功能权衡,”迈尔斯说。
贝恩公司(Bain & Co.)客户战略与营销业务成员安迪·皮尔斯(Andy Pierce)也观察到类似现象。
“我们发现大型语言模型高度理性,例如,若训练一个LLM并让其权衡价格与功能,会得到价格与质量或价格与数量间的线性关系,”皮尔斯说,他同时担任贝恩价值主张创新与设计全球负责人。
LLM遵循“越多越好”或“越便宜越好”的原则,但LLM也能学习。
“通过巧妙的提示工程,并引入其他类型数据,我们已学会训练LLM,使其更具同理心,更能理解品牌等高度情感化、非理性的人类行为,可在合成世界中反映出来,”皮尔斯说。
此外,若无适当防护措施,基于合成数据行动也存在风险。
例如,Forrester预计今年至少有两起重大丑闻源于企业依赖AI主导的客户研究,因超负荷的客户体验团队过度依赖合成受众和AI主持访谈等应用。该分析机构敦促领导者借助专业研究来压力测试AI生成的洞察。
决定何时使用合成数据
随着对合成数据的兴趣增长,品牌需决定如何及何时使用。专家指出合成回答可克服的障碍:难以触达的受众、调查疲劳、昂贵耗时的调查。
“我认为它非常适合低发生率受众,即难以找到的‘大海捞针’群体,”迈尔斯说。
它也有助于减少调查疲劳——合成数据不会因冗长调查而疲倦。
在速度和规模上,合成回答具有优势,但在此过程中,必须纳入“人类以获取深度和细微差别”,迈尔斯说。
简言之,“从合成数据获取广度,从人类获取深度,”迈尔斯说。
对于涉及人类情感的问题,真人样本也更受青睐。
“目前,若研究领域涉及情感和自我认同,如品牌相关、忠诚度或审美偏好,真人受访者可能更合适,”迈尔斯说。
合成研究的速度是其最大吸引力之一。据Qualtrics称,传统样本需五天,而合成数据仅四小时即可收集并清洗完毕。
“使用合成数据可能为了追求快速上市,某些情况下,传统调查方法需数月收集的数据,若使用合成来源或合成焦点小组,可在数天或数小时内获得,”高德纳(Gartner)分析师莉兹·福·库恩(Lizzy Foo Kune)表示。
高德纳与一家制药公司的研究发现,传统调查成本约9万美元,而合成版本仅约2万美元,且“结果类型相同”,库恩说。
尽管用合成数据替代真人调查颇具诱惑,库恩及其他分析师并不建议如此。
“我们告诉客户,现阶段合成数据应补充而非替代真实世界数据,因其仍处于早期阶段,”库恩说。
展望未来,迈尔斯已看到潜在用例。近期,营销团队要求研究团队对20条价值主张提供消费者反馈,她认为合成研究可行。
“能否先用合成数据测试这20条信息?”迈尔斯说,“对于优先级排序练习,我对此最兴奋——可快速筛选长列表,获取第一轮反馈。”
海军联邦识别的另一用例是预设计阶段,即“预发布前”,迈尔斯说。
“在设计问卷时,我是否在问正确的问题?问题是否表达了我想要的含义?是否有令人困惑的部分?”她说,“可先利用合成数据获取此类反馈,再投放给真人。”