时间:
引言
语音除了承载语言信息外,也传递了丰富的副语言信息,如说话人的态度、意图等。很多学者研究了传递交际态度的语音。例如,Aubergé 团队先后定义并考察了 12 至 19 种态度,对英语、法语、日语、汉语等多种语言做了声学分析和感知实验。另有一些学者则采用了正反对立的方法定义态度对:Pell 团队针对英语,系统考察了热情 / 冷漠、礼貌 / 粗鲁等若干对态度语音的声学关联物;Gu 等针对汉语,着重考察了友好 / 敌对、礼貌 / 粗鲁、褒扬 / 贬讽等若干对态度语音的韵律特征,发现不同态度的语音在时长和基频特征上有系统的差异,同时句重音的分布也会发生变化。
类似地,“相信”(belief) 和 “不信”(disbelief),也是言语交际中常用的相互对立的态度。Anderson 将人际互动过程中为了促使话者继续话题而向其提供反馈或激励的行为定义为 “反馈行为”。Gardner 指出言语反馈行为不仅反映了听者对话者继续话题的激励,还反映了听者对话者说话内容的评价。表达相信和不信的态度是一种重要的言语反馈行为。“相信” 指个体接受某项陈述,将其视作真值;“不信” 指个体拒绝某项陈述,将其视作假值。厘清相信和不信的态度语音的声学差异,不仅可以深入理解言语交际过程,还有助于完善人机智能语音交互系统。目前仅有少量的研究考察了相信 / 不信的态度语音。Manusov 和 Trees 基于主观听感发现,被试倾向于用讽刺语调表达不信。Levitan 和 Hirschberg 通过分析英文语料库中采访者对被采访者陈述的相信和不信回应发现,不信比相信的语音语速更快、音强中值更高。Yu 和 Levitan 考察了西班牙语和英语,发现两种语言均表现为,相信比不信语音有较长的时长、较低的音强中值、较小的基频斜率。
Gander 等基于 16 个声学特征构建随机森林模型,对相信和不信语音的辨识率高达 0.76。此外,Armstrong 等发现,5 岁儿童基于句末音高升降的语音线索,判断发音人传达的态度是相信还是不信,识别率高达 0.80。以上研究文献表明,相信 / 不信语音在声学特征上存在差异。人格是影响言语交际行为的重要因素。人格指个体稳定的行为模式,Costa 和 McCrae 在 5 个维度上定义人格特质,称为 “大五人格”:(1) 神经质 (Neuroticism, N):高神经质人群情绪波动较大,倾向于体验消极情绪 (如愤怒、敌意、焦虑、脆弱、抑郁);(2) 外倾性 (Extraverts, E):高外倾性人群善于交际,喜欢与他人相处,经常体验到积极情绪,有温暖、社交性、自信、活力等特征;(3) 开放性 (Openness, O):高开放性人群表现出想象力丰富、有创造力、脚踏实地等特征,他们乐于探索世界,体验新鲜事物;(4) 宜人性 (Agreeableness, A):高宜人性人群乐于接受他人的意见、重视他人的观点,有信任、直率、谦虚、善良和顺从等特征;(5) 尽责性 (Conscientiousness, C):高尽责性人群习惯于控制、调节、指导自身的冲动,表现出有能力、有秩序、责任感强、自律和深思熟虑等特征。有学者指出,内在的人格特质、外在的文化规范与情境等共同决定了个体的交际风格。已有大量研究考察了人格维度与言语交际风格的相关关系。
Leung 等发现高外倾性和高开放性人群的言语表达更加直接、开放和准确。Ahmed 等使用交际风格量表 (Communication Style Inventory) 测量了大学生群体交际风格的 6 个潜在维度:表达性 (健谈、幽默、随意),准确性 (考虑周到、语言简洁、内容充实、条理清晰),语言攻击性 (易怒、强硬、使用贬低或攻击言辞、缺乏情感支持),好奇性 (思维开放、充满好奇、善于辩论),情绪性 (沟通中容易流露感伤、焦虑、紧张情绪,采取防御性态度),印象操控性 (奉承、有魅力、难以捉摸、隐瞒信息)。结果发现,外倾性与表达性呈正相关,神经质与语言攻击性、情绪性、印象操控性呈正相关,尽责性与准确性呈正相关,开放性与准确性、语言攻击性、好奇性呈正相关,而宜人性与交际风格之间的相关性不显著。语音是言语交际的物质外壳,已有大量研究考察了人格维度对语音声学特征的影响。Aronovitch 要求被试仅凭语音线索对话者的人格维度评分,发现外倾性与男性发音人的基频和能量范围呈正相关,与女性发音人的基频和能量均值呈正相关。
Song 等通过考察韩国人在正式交际场合中各人格维度的声学关联物发现:神经质与基频均值仅在女性发音人中呈正相关;外倾性与基频范围呈正相关,并且在女性发音人中与基频均值正相关、与共振峰间距负相关;开放性与基频范围呈正相关,并且在女性发音人中与共振峰间距负相关。Aronovitch 和 Michalsky 等都揭示了女性发音人的语速和外倾性之间的关系,但结论相反:前者发现语速和外倾性呈正相关,而后者发现两者呈负相关。Gocsál 考察了男性发音人的语音声学特征与人格维度间的关系,指出语速与外倾性和开放性均呈正相关。Michalsky 等还发现语速与神经质之间的负相关关系、短语时长与尽责性之间的正相关关系。音质特征与人格维度之间也有相关性,如嘎裂声与较低的外倾性、宜人性、尽责性、神经质有稳定的联系。此外,基于声学特征对 5 个人格维度 (以中值为界分为高、低两个水平) 做自动分类发现,外倾性 (0.73) 和尽责性 (0.73) 的识别率最高,其次为神经质 (0.68) 和宜人性 (0.63),开放性的识别率最低 (0.60)。
此外,近年有研究开始探讨人格特质与情感类型对语音的综合作用。例如,盛晨探索了外倾性与宜人性对汉语态度语音 (包括积极态度与消极态度) 声学特征的影响;此外,胡涵和顾文涛揭示了依恋风格对亲密态度语音以及四种基本情绪语音的调节作用。为了深入研究人格特质对态度语音的作用规律,本文从大五人格出发,探究表达相信 / 不信态度的汉语语音声学特征,考察外倾性、神经质、宜人性、尽责性、开放性这 5 个人格维度对相信 / 不信语音声学特征差异模式的调节作用。
1 方法
1.1 实验材料
人格测量问卷:使用大五人格量表 (Neuroticism Extraversion Openness Five-Factor Inventory, NEOFFI) 中文版测量被试的人格维度。NEO-FFI 由 5 个分量表构成,分别对应神经质 (如:有时候我感到愤怒,充满怨恨)、外倾性 (如:我喜欢周围有很多朋友)、开放性 (如:我喜欢培养和发展新的爱好)、宜人性 (如:我尽量对每一个遇到的人彬彬有礼,非常客气)、尽责性 (如:我比较擅长为自己安排好做事进度,以便按时完成任务),每个分量表包含 12 个题项。每个题项均采用 5 度制计分 (1: 非常不符合,5: 非常符合)。最终,计算 12 个题项的总分作为人格维度分数。用 Cronbach’s α 系数检验样本量表题项的同质性,结果表明神经质的 Cronbach’s α 系数为 0.86,外倾性为 0.84,开放性为 0.85,宜人性为 0.73,尽责性为 0.84。产出语料:采用情景诱导式语料。设计 11 个语义中性的陈述句作为目标句 (音节数:均值(M=8.58),标准差(SD=1.83),范围(range =6 ~ 12)。
每个目标句设计两个语境,分别诱发相信和不信态度。诱发相信态度的语境强调话者已知信息与传递信息相符,诱发不信态度的语境强调话者已知信息与传递信息不符。为了贴近日常言语交际,设计了 3~4 个交际话轮,由实验助理充当被试的交际对象,共同完成对话,并引导被试自然地说出目标句。以下是目标句为 “外面在下大雨” 的语境和对话脚本,目标句由被试 A 说出。【相信】昨天晚上看天气预报说今天是晴天,但早上 A 打开窗户看到外面在下大雨,舍友 B 在收拾东西准备一会儿出门。B: 等一下我还要和小李去剪头发。A: 剪头发?那你们只能在附近了,记得带伞。B: 带伞?不用吧,天气预报说今天是晴天啊。A: 不是,我早上打开窗户看到的,外面在下大雨。【不信】A 昨天晚上看天气预报说今天是晴天。傍晚,舍友 B 和 A 聊起晚饭吃什么。B: 等会儿晚饭咱们只能点外卖吃了。A: 怎么了?为什么只能点外卖吃啊?B: 你也不看看,今天外面下大雨呢!A: 不是吧,外面在下大雨,天气预报不是说晴天吗?
1.2 被试选取
使用仿真算法,估计在显著水平为 0.05 (双尾)、功效值大于 80% 时态度 (相信 / 不信) 效应显著所需的样本量。基于预实验 10 名被试的数据,分别以每个声学特征为因变量构建线性混合模型 (Linear Mixed Model, LMM),态度为固定效应,被试和目标句为随机效应,做 1000 次仿真模拟。计算所有声学特征上态度因子对应功效值的算术平均后发现,样本量为 40 的功效值为 93%。用 R 4.3.1 的 MixedPower 程序包做仿真分析。共招募 47 名无言语听力疾病史且普通话流利的被试 (22 男 25 女),平均年龄(M=21.55)岁((SD =2.59),(range =18 ~ 27)均为在校大学生或研究生。采用 Wilcoxon 秩和检验比较男性和女性在年龄和人格维度分数上的差异,结果显示性别效应均不显著((ps>0.1))表明年龄和人格维度分数在两性间分布均衡,可排除性别对后续统计结果的影响。
1.3 实验过程
录音在专业录音棚内进行。语音采集设备为 Apogee BOOM 声卡和 AKG 头戴式传声器,采集到的语音信号存为 WAV 文件 (采样率 44.1 kHz,精度 16 bit)。使用 Eprime 3.0 设计实验程序,并在 Philips 220SW 显示屏 (分辨率:1280×1024) 上呈现。实验分为三个阶段:问卷填写、实验准备、语音实验。实验持续约 1 小时。问卷填写阶段。被试在阅读并签署知情同意书后,填写个人基本信息和 NEO-FFI 线上问卷。人格维度得分对被试保密,防止被试根据某类人格的刻板印象做语音表达。实验准备阶段。实验助理将被试引入录音棚,安置在距离显示屏约 70 cm 的座椅上,并调整座椅高度确保被试平视屏幕中央。用头戴式传声器采集语音,传声器距被试嘴部约 10 cm,实验过程中被试不得触碰传声器。
被试有充分的时间熟悉语料。语音实验阶段。按照角色扮演的对话脚本,被试感受角色的心理状态,与实验助理充当的对话者,以日常方式自然地交流。屏幕上首先呈现 500 ms 注视点,提示被试集中注意力。其次,呈现语境与交际话轮,目标句用粗体突出显示。被试先经练习阶段充分熟悉实验流程后,进入正式实验。如果被试有错读和漏读,或对话语表达效果不满意,可重新开始对话。所有目标句均由被试产出。不同目标句与其对应的交际情景随机呈现,同一目标句诱发相信和不信态度的情景顺次呈现。最终,共采集 47 被试 ×2. 态度 (相信 / 不信)×11 目标句 = 1034 个语音文件。在去除 3 个有缺失值的样本后,得到 1031 个语音样本用于数据分析。
1.4 声学参数
参考以往有关情感和人格研究采用的声学特征,采用 Praat 6.3,对每个目标句提取 11 个韵律参数和 12 个音质参数:基频 (f0):声带振动的频率。采用自相关算法获取基频的时变曲线,并手动修正异常值。对内插和平滑后基频曲线上的每个基频值做半音转换,公式为 12・log2 (f0/f0ref),其中 f0ref 为参考值 (设置为 50 Hz)。基于转换后的基频曲线,计算均值 (f0mean)、标准差 (f0std)、最小值 (f0min)、最大值 (f0max)、范围 (f0range)。音强 (Int):语音的强度。计算语音幅值的均方根得到音强的时变曲线。基于内插和平滑后的音强曲线计算均值 (Intmean)、标准差 (Intstd)、最小值 (Intmin)、最大值 (Intmax)、范围 (Intrange)。单位为 dB。语速 (SpRate):发音人每秒产出的音节数。计算方法为全句的音节数除以全句的时长。
单位为音节数 / 秒。谱矩 (Spec):频谱能量的分布,包括谱重心 (Spec-cog) 和谱离散度 (Spec-std)。前者为一阶原点矩,后者为二阶中心矩。单位为 Hz。谐波差 (HD):不同频段谐波能量的差异,反映声门的收紧程度。提取经过共振峰带宽修正的低频段谐波差 H1–H2、H2–H4,高频段谐波差 H2K–H5K (2000 Hz 和 5000 Hz 谐波能量的差值),以及 H1 与三个共振峰能量间的差值 H1–A1、H1–A2、H1–A3。谐波差值越大,声门的收紧度越低。嗓音规则性参数:包括基频扰动 (Jitter)、振幅扰动 (Shimmer)、谐噪比 (HNR)、平滑倒谱峰值系数 (CPPS)。Jitter 和 Shimmer 分别表示相邻周期基频和振幅的变异度,用百分数表示,数值越小,嗓音越规则。HNR 表示谐波成分与噪声成分的能量比值,单位为 dB,数值越大,嗓音越规则。CPPS 指平滑倒谱能量的峰值与峰值下回归线之间的距离,单位为 dB,数值越大,嗓音越规则。
1.5 统计分析
首先,用有监督分类器对相信 / 不信的态度语音做自动分类,考察两类态度语音在声学空间中的分布差异。基于分类模型计算每个声学特征对模型输出的边际贡献 (SHapley Additive exPlanation, Shap),选取贡献高于均值的特征做后续分析。
其次,基于选取的重要声学特征做冗余分析 (Redundancy Analysis, RDA),揭示解释变量矩阵 (人格维度) 对响应变量矩阵 (声学特征) 方差的解释率。具体分为两步:(1) 基于原始声学特征做 RDA,分别考察人格维度和相信 / 不信态度对声学特征的影响。(2) 基于相信 / 不信的态度语音声学特征的绝对差值做 RDA,探究人格维度对两种态度语音声学模式差异的调节作用。同时,采用层次划分法计算每个人格维度对多维声学特征方差解释率的独立贡献。然后,由于 RDA 未对人格维度的调节作用做假设检验,所以对选取的重要声学特征逐一拟合线性混合模型 (LMM),考察每个人格维度与相信 / 不信态度的二阶交互效应。
最后,由于受到样本量的限制,LMM 只能分别考察单个人格维度对相信 / 不信语音声学特征的调节作用。因此,进一步采用线性混合模型树 (LMMT),综合考察 5 个人格维度整体上对两种态度语音的调节作用。LMMT 由两部分组成:(1) 利用决策树算法,根据人格维度将声学数据分为多个同质的亚组,作为叶节点;(2) 对每个叶节点上的数据做 LMM,计算固定效应和随机效应。
2 结果
2.1 有监督分类器
基于 1031 个样本、23 个声学特征,构建核 K 近邻模型 (KKNNM)、灵活判别模型 (FDM)、径向基支持向量机 (RSVM)、随机森林 (RF)、轻量级梯度提升决策树 (LGBDT),对语音表达的相信与否的态度做自动分类。为了提升模型的识别效果,将 5 个基模型 3 重 10 折交叉验证的预测值作为新特征,纳入线性惩罚模型,计算堆叠系数,构建堆叠模型 (Stacks Model, SM)。为了消除个体差异的影响,每个声学特征以被试为单位转换为 z 分数。数据集分为 70% 训练集 (720 个样本) 和 30% 测试集 (311 个样本),训练集用于建模和调参,测试集用于评价模型的表现。采用模拟退火算法 (迭代 100 次) 和 3 重 5 折交叉验证法调参。使用准确率 (Accuracy, ACC) 和接受者工作特征曲线下面积 (Area Under Curve, AUC) 评估模型的识别效果。
5 种基模型在测试集上的 ACC 都在 0.71 以上,显著高于 0.50 的机会水平 (95% CI 均不包含 0.50),AUC 都在 0.79 以上;其中,RSVM 识别效果最优 (ACC=0.76,AUC=0.84)。堆叠模型相比于除 RSVM 以外的基模型,AUC 提升了 2%~5%。基于 SM 计算每个声学特征的 Shap 值,选出对相信 / 不信的判断有重要贡献的声学特征。贡献值高于绝对 Shap 均值的声学特征,由高至低排列为:f0mean, Jitter, HNR, f0std, f0max, f0min, SpRate, H2–H4。基于这 8 个声学特征做后续分析。
2.2 冗余分析
所有特征都在标准化 (转换为 z 分数) 后做 RDA。选取方差解释率占总体可解释方差的比例最高的两个维度 (RDA1 和 RDA2) 作三标图,描述了人格维度和相信 / 不信语音在声学空间上的分布。不信比相信语音有较高的 f0mean、f0min、f0max、HNR,较低的 Jitter、H2–H4。人格维度对声学特征的方差解释率由高至低分别为:尽责性 (37.12%)、外倾性 (30.62%)、开放性 (14.00%)、神经质 (13.62%)、宜人性 (5.12%)。尽责性与 f0mean、f0std、f0max、f0min、SpRate 呈正相关,与 H2–H4、Jitter 呈负相关。外倾性、开放性和神经质与 H2–H4、Jitter 呈正相关,与 f0mean、f0min、f0max、HNR 呈负相关。宜人性与 HNR、f0min、f0mean 呈正相关,与 H2–H4、Jitter 呈负相关。
人格维度的方差解释率由高到低分别是:神经质 (25.73%)、外倾性 (25.48%)、开放性 (22.58%)、尽责性 (13.31%)、宜人性 (12.98)。神经质与 f0max、f0std、SpRate、Jitter 呈正相关、与 f0mean、f0min 呈负相关。外倾性与 f0mean、f0min、f0max、Jitter、HNR 呈正相关,与 SpRate、H2–H4 的呈负相关。开放性与 SpRate、H2–H4 呈正相关,与 f0mean、f0min、f0max、Jitter、HNR 的呈负相关。尽责性与 H2–H4 呈正相关,与 f0mean、f0std、f0min、f0max、Jitter、HNR 呈负相关。宜人性与 f0std、f0max、SpRate、Jitter、HNR 呈负相关。
2.3 线性混合模型
为了检验 5 个人格维度对相信 / 不信态度语音的调节作用是否有统计学意义,基于 8 个重要的声学特征逐一拟合 LMM。固定效应为每个人格维度 (连续变量) 和态度 (离散变量:相信 / 不信) 间的二阶交互效应,随机效应为被试和目标句。为平衡模型的复杂度和拟合优度,采用重要性排序和逐步剔除法优化模型。采用似然比检验,估计最简模型的主效应和交互效应。对态度效应做事后检验时,将人格维度以(Mpm SD)作为高、低两个水平,用 Cohen’s d 表示效应量;对人格效应做事后检验时,分别计算人格维度在相信 / 不信条件下对声学特征的预测斜率。为了便于模型解读,对人格维度做中心化处理。
3 讨论
3.1 相信 / 不信语音在声学空间中的分布差异
基于 23 个声学特征构建的有监督分类器发现,表达相信 / 不信的语音在声学空间中有清晰的决策边界,模型的 ACC 和 AUC 最高可达 0.76 和 0.84。根据 Shap 值,f0mean、Jitter、HNR、f0std、f0max、f0min、SpRate、H2–H4 对区分相信 / 不信有较大贡献。基于上述 8 个重要特征做 RDA和 LMM 发现,不信比相信语音有更高的 f0mean、f0std、f0min、f0max、HNR,以及更低的 SpRate、H2–H4、Jitter。
汉语的不信比相信语音有更高的 f0mean 和 f0std,这与西班牙语和英语的研究结果一致。较高的 f0mean 与疑问、怀疑、惊讶有关,例如:Liu 和 Xu 发现句末音高上升是疑问语气的重要特征;Jiang 和 Pell 指出,怀疑比确信的语音有更高的 f0mean;Liu 等发现惊讶比中性的语音有更高的 f0mean。较大的 f0std,根据努力编码 (Effort Code) 假说,表明话者对信息有更多的强调。
表达不信时,语音有较小的 H1–H2 和 Jitter、较大的 HNR,说明嗓音更加规则和清晰,这与讽刺语音的嗓音表现一致,支持 “个体倾向于使用讽刺语调表达不信态度” 的观点。使用清晰且规则的嗓音,有利于提高语音的可懂度,从而让否定更加突显。
3.2 人格维度对相信 / 不信语音声学特征差异的调节作用
神经质、外倾性、开放性对相信 / 不信语音之间的声学特征差异有重要的调节作用。神经质的调节作用表现在 f0mean、f0min 和 f0std,外倾性的调节作用表现在 f0mean 和 HNR,而开放性的调节作用表现在 f0std。
相比于低神经质人群,高神经质人群在表达相信和不信态度时 f0mean 和 f0min 的差异较小,这与高神经质人群有较弱的情绪表达能力有关。而且,表达不信态度时,高神经质人群比低神经质人群有更高的 f0std,表明更高的情绪激活,符合高神经质人群易情绪化的性格特征。
相比于低外倾性人群,高外倾性人群表达相信和不信态度时 f0mean 和 HNR 的差异较大,这与高外倾性人群有较强的交际能力和情绪表达能力相符。而且,表达相信态度时,高外倾性人群比低外倾性人群对声门控制的规则性减弱 (较小的 HNR),说明他们在言语表达时较为放松和随意,与文献的结果一致。
相比于低开放性人群,高开放性人群表达相信和不信态度时 f0std 的差异较大,这可能受到开放性人群好奇性交际风格 (思维开放、充满好奇、善于辩论等) 的影响。好奇性促使高开放性人群表达不信时倾向于加强疑问语气,导致不信和相信的 f0std 有较大的差异。但是,开放性对相信 / 不信态度 f0std 的预测作用都不显著,该假设仍需进一步验证。
LMMT 综合考察了大五人格整体上对相信 / 不信语音之间声学特征差异的影响。相比于其他人群,同时具有低神经质、高外倾性、低尽责性的人群,f0mean 的差异较大;同时具有低神经质、低开放性的人群,f0std 的差异较小;同时具有低神经质、低开放性的人群,以及同时具有高神经质、高开放性的人群,SpRate 的差异较小。
3.3 不足与展望
虽然研究的样本量超过了 80% 统计功效所需的最小样本量,但是毕竟样本量较小,后续研究可通过增加样本量获得更可靠的结论。同时,人格维度是普适的心理学概念、与语言无关,因此可以预期,人格维度对相信 / 不信语音声学特征的影响,有很多语言共通的性质,后续研究可将被试人群拓展至其他语言,获得更具普遍性的结论。此外,态度在语音上的表现不会在话语中均匀分布,某些局部的声学特征更能体现态度上的区别。例如,Gu 等发现,基频特征在不同态度间的对比,在句重音部位表现更加强烈,Jiang 和 Pell 发现态度对比的声学差异随音节在句中的位置而变化。本文只分析了全句的整体声学参数,后续研究可以通过提取句子不同位置的声学参数做更细致的局部分析。
4 结论
采用有监督机器学习、冗余分析、线性混合模型和线性混合模型树四种分析方法,揭示了相信和不信语音的声学特征的差异,以及 5 个人格维度 (神经质、外倾性、开放性、宜人性、尽责性) 对这些声学特征的影响。研究发现,相信 / 不信的态度语音在声学空间中有清晰的聚类边界,不信比相信语音有更高的基频均值、基频标准差、基频最小值、基频最大值、谐噪比,以及更低的语速、谐波差 H1–H2、基频扰动;大五人格维度,尤其是神经质、外倾性、开放性,对相信和不信语音的声学特征差异有显著的调节作用。未来的智能人机语音交互系统,离不开个性化的需求,而人格特质正是个性化的重要体现。本文以相信与不信语音为例,揭示了大五人格对态度语音声学特征的影响,为个性化人机语音交互的发展提供了数据支持。
胡 涵;吴思衡;顾文涛;叶名扬;管欣怡,南京师范大学文学院;麦吉尔大学沟通科学与障碍学院,202502