复旦高研院“应用数据科学”国际学术会议举行

2023年7月4日至6日,由复旦大学社会科学高等研究院主办的“应用数据科学”国际学术会议在复旦大学美国研究中心举行。
此次会议吸引了来自中国、美国、加拿大、英国、中国香港、中国台湾等11个国家和地区的80多位学者现场参加,同时还有20余位学者选择线上方式参与。在为期三天六个上下午场中,共有59组研究进行了实时报告,其中包括15个常规报告和44个快速报告。另有10个录像报告。
会议伊始,高研院院长、复旦大学特聘教授郭苏建博士致开幕词。郭院长在开幕词中特别强调了数据科学在各个学科的应用,尤其是与社会科学研究的深度结合。他表示,在这个数据驱动的时代,数据科学已经渗透到我们生活的方方面面,当我们谈及数据科学在各个领域的应用时,除了医学、工程和经济学等传统的数据应用领域,数据科学与社会科学其他学科领域的结合同样具有深远意义。他认为,社会科学关注人类社会的行为和结构及其运行规律,而数据科学为我们提供了一个全新的视角和工具。例如,在社会学研究中,通过大数据分析,我们不仅可以更准确地预测社会趋势,还能深入挖掘人群行为模式,为政策制定提供更为精准的数据支持。最后,他希望通过这次国际会议,不仅能够加强国际学术交流,还能进一步提高我们应用数据科学在国内外的学术影响力和地位。
国际数据科学与分析方法学会主席、美国圣母大学心理系教授张志勇博士致辞。张教授首先对所有参与者的投稿和支持表示感谢,并对复旦大学高研院的精心组织及所有相关工作人员表示衷心的感谢。他指出,本次会议对于推动数据科学领域的学术研究和技术发展具有重要意义。他说这是一次高端学术成果展示的盛会,参与者在数据科学领域的研究成果和创新技术将在会议上得到发表;这是一次学术合作交流的盛会,它为数据科学领域的专家、学者和从业人员提供了一个宝贵的交流合作平台,参与者可以通过发表论文、展示研究成果、参加讨论等方式分享自己的经验和见解,结识同行,建立合作关系;这是一次新技术学习的盛会,参与者可以在这里学习到最新的数据分析方法,从而提高自己的研究能力和水平。
随后,会议报告正式开始,7月4日上午场共有4个常规报告与3个快速报告。
香港中文大学教育心理学系侯杰泰教授就《Large-Scale International Education Surveys: Analyses of Slopes Can be More Interesting Than Comparisons of Means(大型国际教育测评中的斜率分析与均值比较之深度研究)》进行了发言,他指出大型国际教育调查如国际学生评估计划(PISA)和国际数学和科学趋势研究(TIMSS)受到广泛关注,主要因为可以比较各经济体的教育优势与劣势。他的团队利用PISA探讨不同单位(如学校、经济体)之间量表比较的复杂性。具体而言,该研究检查了(a)学生、学校和经济体层面的方差,(b)不同层面(学生、学校、经济体)上各种量表与外部标准(例如,成就、社会经济地位[SES]、性别)之间的关系强度,以及(c)不同层面上各种量表之间的关系强度。他详细介绍了研究成果并总结到,认知测试和社会经济地位在不同经济体和学校间的方差较大,而问卷量表的方差则较小,并且容易受到框架和其他才能-成就悖论现象的影响。同时,他指出,值得注意的是,学校和经济体层面的均值解释可能与学生层面的不同。因此,检查每所学校内量表得分与成就、SES和性别之间的关系可能提供与传统文献一致的更丰富的信息和意义。
美国圣母大学历史系的Liang Cai教授就《DATA OF NARRATIVE AND NARRATIVE OF DATA: HOW LONG-DISTANT READING CAN HELP REEXAMINE EARLY IMPERIAL CHINA(历史叙述中的数据、数据中的历史叙述 :数字人文之下的全景阅读与秦汉历史)》进行了线上报告。首先,她展示了如何利用早期中国帝国历史人物的结构化信息为文本叙述提供新的视角。其次,她认为系统提取的数据可以将我们的论证从分析实例转移到关系一个计算每个记录案例的全面历史。通过使用更新的工具和技术持续传统的研究,将文本源转化为数据有助于修正传统的范式。她提到,《史记》、《西汉志》和《东汉志》是研究秦汉帝国时期的重要史书,它们为中华文明提供了丰富的资料。这些书籍记载了众多历史名人和大事件,其中的内容可以被整理为结构化传记体与社交网络数据。在她的报告中,蔡教授通过两个实际案例进行解析:第一例中,她揭示了基于师徒关系的社交网络如何助儒家学者跳过繁琐的官僚体系,并获得政治权利。这个发现突显了这一段时期内的历史变迁,那时的儒家学者梦想成真,被尊为帝师。这种“帝师”儒家的角色被广为接受,形成了一种深入人心的传统,直至20世纪初期。第二例中,蔡教授基于西汉官员的犯罪记录,详解了儒家对法治的严苛评价。这份犯罪记录进一步揭示了法律在中国古代与国家权力之间的微妙关系。最后,她深入讨论了如何为广大读者提供和应用这些数据集所带来的挑战。她还简要提及了一个名为“Digital Empires(数字帝国)”的项目,该项目探讨了AI(人工智能)在从史书中提取和整理数据方面的潜在价值。
美国圣母大学心理系教授王丽娟博士就《Modeling intraindividual variability as a predictor with longitudinal data: Methods and evaluations(个体内变异作为纵向数据预测指标建模:方法与评价)》进行了报告。她强调,在心理学多个子领域,研究者都对个体内变异性(IIV)如何预测行为与健康的结果有浓厚兴趣,尤其是在控制了个体的平均值之后。(IIV为此,IIV指标如观察到的个体内部标准偏差(ISD)或观察到的个体内部方差(IVAR)经常被模型化为常规回归分析的预测指标。但是,王教授的团队发现,尤其在观察次数较少时,已发现观察到的ISD或IVAR分数存在低可靠性问题。这个低可靠性问题可能导致关于ISD或IVAR的系数从常规回归中得出的统计推断不正确。进一步的研究还表明,随着观测次数的增加,使用常规回归方法似乎能更精确地评估IVAR,但对ISD的评估则不尽如人意。她的团队比较了三种备选的建模方法,包括时间分割法(time parceling)、单一指标潜在变量法(single indicator latent variable method)和贝叶斯变异性建模法(Bayesian variability modeling method),以及常规回归模型ISD或IVAR作为预测指标的性能。模拟结果与分析结果一致,进一步表明提出的(a)带有自举法的时间分割和(b)贝叶斯变异建模方法的性能良好,而且比回归模型IVAR作为预测指标更好。王教授最后建议应用研究者在面对纵向数据时,特别是要分析个体内的变异性时,积极尝试并选择最合适的建模方法,以确保得到更为精确和有洞察力的研究结果。
美国俄克拉荷马大学健康科学中心的助理教授廖小兰博士联合该大学的David Bard教授,就《Using Baseline Case Characteristics to Predict Successful Treatment Completion(使用基线案例特征预测治疗成功完成率)》进行了报告。廖教授指出,在医疗预防研究中,准确预测治疗完成率在治疗分配之前至关重要,因为它不仅可以降低医疗成本,还可以确定可能需要加强的治疗领域,以提高治疗的依从性和成功完成率。但是,当预测因子数量较多时,使用传统统计模型进行准确预测具有挑战性。因此,该研究团队评估了机器学习技术在预测未来治疗完成中的应用,并采用了集成模型的两步法。同时,他们还介绍了一个实际案例来验证方法,案例数据来自一个新型的干预治疗项目,样本中包括40个协变量,并随机分为训练和测试两组以进行交叉验证。结果显示,所有模型的评估指标AUC都大于0.50,自由森林模型具有最大的准确性和F1分数。整体而言,研究表明所有的机器学习模型在分类成功和未成功完成方面的表现都优于随机猜测。最后,他们建议使用两步法进行变量选择、模型构建和选择,并建议根据性能和实际考虑定期和动态评估所选部署模型的性能,以确保部署模型仍然达到可接受的性能水平。
华南师范大学心理学院的研究生王一帆针对《A 2-stage Latent-standardization Method in Second-order Latent Growth Modeling(二阶潜增长模型的两阶段标准化方法)》进行了深入的研究和讨论。她指出,潜增长模型(LGM)是分析纵向数据的一种重要方法,尤其在心理学及其他社会科学领域有广泛的应用。当涉及由多个指标测量的变量时,二阶潜增长模型在众多方面都显著优于基于合成分数的单变量潜增长模型。她强调,在纵向测量中,二阶LGM中的增长参数估计依赖于潜变量的标度方法,而现有的标准化方法需要知道初始时间点的信度。为了解决这一问题,他们团队提出了一个两阶段的潜变量标准化方法,该方法首先固定了潜变量在初始时间点的均值和方差,然后再建立二阶潜增长模型。经过模拟研究后,结果显示这一新方法与现有方法在效果上相近,但更具操作性,因为它无需知道信度。他们希望这一新的方法能为纵向数据分析提供一个更简便、高效的工具。
美国乔治亚大学心理系的Laura Lu副教授发表了题为《PCA, FA, LCA, LPA, LDA, which model is the best choice for your data?(PCA、FA、LCA、LPA、LDA:哪种模型是最佳选择?)》的报告。她指出,在社会和行为科学中,主成分分析(PCA)、因子分析(FA)、潜在类别分析(LCA)和潜在剖面分析(LPA)被广泛用来识别大数据集中的基本模式和关系。近年来,主题建模(TM)和潜在狄利克雷分配(LDA)方法在这些领域越来越受欢迎,除数值响应外,还用于文本数据分析。所有这些模型的目标都是揭示观察到的大量数据中的隐藏结构和维度。吕教授深入探讨了这些模型在统计学理论、算法和应用上的差异,并为研究者提供了实用的指导,帮助他们选择合适的模型进行研究。此外,她还提供了从各种角度总结和比较这些模型的实际建议,突出了它们的差异和相似之处,旨在帮助研究者更有效地构建自己的模型并分析数据。
美国圣母大学心理系的博士研究生邵思静在其报告《A Comparison of Mathematical and Statistical Modeling with Longitudinal Data(纵向数据的数学与统计模型比较)》中,讨论了生态瞬时评估法(EMA)在行为研究中的应用。EMA被广泛用于实时收集纵向数据的研究中,研究行为、动机和情感的每日或日内变化。她比较了两种常用方法,广义估计方程和广义线性混合模型,与另外三种在其他领域广泛使用但在行为研究中较少使用的方法,即马尔可夫模型、广义线性混合效应马尔可夫模型和微分方程。她的报告详细展示这五种不同分析方法在饮酒行为的密集纵向数据集上的应用,并强调每种方法的实用性。
7月4日下午分会议由南京邮电大学理学院院长唐加山教授主持。下午场共有3个常规报告和10个快速报告。
美国圣母大学的Jun Li教授进行了《Using response time for compromised item detection(使用响应时间检测受损题目的研究)》的报告。他指出,随着信息技术的进步,现今许多测试都在计算机上进行,这比传统的纸笔测试为考生带来了更大的便利。但这同时也引发了关于测试安全的担忧,例如,较早参加测试的考生可能会与其他考生分享他们遇到的题目,导致题库泄露,从而威胁到测试的有效性和公平性。为了应对这一挑战,本研究提出了一个新颖的检测模型,该模型利用计算机测试过程中收集的响应时间数据。该模型考虑了不同场景的泄漏率,不仅可以标记可能已经受损的题目,还可以估算每个题目被泄露的时间点。通过模拟研究和真实数据集,该课题组评估了该方法的有效性。与只使用题目反应而不使用响应时间的检测模型相比,新提出的方法在保持高检测power(功效)的同时,更好地控制了type I error rate(一型错误率)。
加拿大维多利亚大学的Xuekui Zhang副教授发布了关于《scAnnotate: an automated cell type annotation tool for single-cell RNA-sequencing data (scAnnotate:单细胞RNA测序数据的自动细胞类型注释工具)》的研究报告。他指出,单细胞RNA测序(scRNA-seq)技术使研究者能够以更高的分辨率探查细胞水平上的基因组。一个生物体由各种各样的细胞类型组成,每种细胞在各种生物过程中都起着独特的作用。因此,scRNA-seq数据分析的第一步通常是区分细胞类型,以便后续对各种类型分别进行研究。近年来,研究者们开发了几种自动的细胞类型注释工具,无需生物学知识或主观的人为决策。而dropout是scRNA-seq数据中用于差异表达分析的关键特征。然而,当前没有哪种细胞注释方法明确地使用了dropout信息。全面利用dropout信息激发了这项工作的灵感。张教授接着介绍了scAnnotate,一个充分利用dropout信息的细胞注释工具。他们使用混合模型为每个基因的边际分布建模,描述了dropout比例和非dropout表达水平的分布。然后,使用集成机器学习方法,他们将所有基因的混合模型组合成一个用于细胞类型注释的单一模型。这种组合方法可以避免估计所有基因的高维联合分布中的大量参数。通过使用14个真实的scRNA-seq数据集,他们展示了scAnnotate与现有九种注释方法的竞争性。此外,由于其独特的建模策略,scAnnotate的误分类细胞与竞争方法大相径庭。这表明将scAnnotate与其他方法一起使用可以进一步提高标注的准确性。
美国圣母大学心理系的博士研究生陈燕然做了题为《Factors Affecting Reading Growth in Language Minority Learners(影响语言少数群体学生阅读成长的因素)》的报告。她指出,在英语为主要语言的国家,语言少数群体(LM)的学生主要来自于家中主要使用非英语的家庭。这一群体涵盖了各种背景的孩子,并且他们在进入幼儿园时的语言能力各不相同,他们参与语言支持计划的情况也各异。这些差异对于预测语言少数群体学生未来的阅读技能成长具有高度的预测性,但尚未得到广泛的研究。通过利用美国的全国代表性数据集(2010-2011年幼儿园学年的早期儿童纵向研究),他们的研究团队对LM学生从幼儿园到五年级的阅读成长轨迹进行了深入研究。该研究使用了混合效应的纵向框架中的递归划分来检测特征变量和阅读得分之间的关系。结果显示,学生在幼儿园入学时参加的筛选测试的分数是预测其未来阅读成长模式的最有影响力的因素。社会经济地位是第二重要的变量,而不同类型的语言支持计划在预测的轨迹中并没有产生显著的差异。来自劣势家庭的学生在时间上的改进也更为缓慢,她在报告中强调了早期文化教育的重要性以及为来自劣势家庭的学生提供针对性帮助的重要性。
北京师范大学心理学部的博士研究生王璞珏带来了题为《Automated evaluation and measurement model for the effectiveness of state transitions in problem-solving tasks(问题解决任务中状态转换有效性的自动评估和测量模型)》的报告。他们课题组主要针对计算机模拟交互任务的状态转换进行研究。近年来,对于评估这种状态转换有效性的测量模型尚主要依靠人工,并受到其应用场景的限制。为解决这些问题,他们提出了一个新的指标——CSDT(目标状态的最短距离的变化),能够自动计算任何状态转换的有效性并产生多类别得分。此外,他们还提出了一个结合CSDT的新测量模型——REMM,适用于更多种类的问题解决任务。两种基于计算机的交互任务被选择为此次研究的对象,分别是PISA 2012的Tickets任务和ATC21S的Balance任务。最终,他指出,该新方法能够更为精确地评估每一个状态转换的倾向性,以及每一位主题在问题解决中的潜在能力。
北京师范大学心理学部的研究生刘清山分享了题为《Fit Multilevel Differential Equation Models to Intensive Longitudinal Data Using Numerical Optimization(使用数值优化方法对密集纵向数据进行多层次微分方程模型的拟合)》的研究。他阐述了微分方程模型在研究单变量或多变量动态系统中的应用,例如情感的自我调节过程、压力与睡眠质量之间的双向关系、以及父母与孩子之间的互动。基于密集的纵向数据,他们课题组提出了一种一步法来估计微分方程模型的参数,即使用数值优化方法直接对密集的纵向数据进行微分方程的拟合。此外,他们还开发了这种方法的多层次模型,从而可以获得个体级的参数估计。他们使用了密歇根大学收集的消费者情绪指数数据作为例子来说明这种方法,并开发了R和Python包以便于研究者使用这种微分方程模型的数值优化方法。
北京师范大学心理学部的研究生李明澜进行了题为《A hybrid method: solve the impact of variable ordering in Bayesian network structure learning(混合方法:解决贝叶斯网络结构学习中的变量排序影响)》的报告。她强调了贝叶斯网络作为一个重要的不确定性推断工具,在自动化、生物学、医学等领域的应用,以及其在心理学中用于风险预测的价值。然而,现有的研究没有关注到机器学习中变量的输入顺序对结果的显著影响。为了解决这一问题,他们提出了一种混合方法来确定变量的最佳排序,从而提高贝叶斯网络结构的稳定性和准确性。这种方法结合了部分有向非循环图(CPDAGs),能够表示双向关系。通过这种方法,他们不仅可以获得稳定的结果,还可以明确关系类型是单向还是双向的。他们还通过一个实证研究,即预测青少年的抑郁和攻击行为,来说明这种方法在心理学研究中的适用性。
华东师范大学教育心理学系研究生朱训报告了题为《Assessing relative importance of multiple mediators(多重中介变量的相对重要性分析)》的报告。她指出,中介分析广泛应用于社会科学研究,通过中介变量识别自变量和因变量之间的关系。在并行多重中介模型中评估中介变量的相对重要性可以帮助研究者更好地理解中介效应并指导干预措施。基于路径系数的传统重要性指标仅关注偏效应,可能导致重要性的估计偏差。因此他们课题组提出了测量多重中介变量重要性的新方法,从相对重要性的视角给出中介效应量。将简单中介模型中提出的中介效应方差解释度量拓展到多重中介模型中。应用相对重要性分析领域的流行的优势分析方法,他们将中介效应方差解释分配到各中介变量。使用频率和贝叶斯方法对中介变量的重要性进行统计推断。模拟研究展示了新度量指标和统计推断方法的表现,最后她以真实数据例子说明如何在多重中介模型中评估相对重要性。
布朗大学生物统计系的刘涛副教授在题为《Causal Effect Estimation and Transportation Using Modified Bootstrap(使用修正的Bootstrap方法进行因果效应估计和转移)》的研究中探讨了观测数据的重要性,如电子健康记录(EHR)和保险索赔数据,这些数据为临床研究提供了丰富的资料来源。他指出,观测研究为研究治疗对研究对象的影响提供了一个重要的替代方案。然而,观测研究分析面临诸多挑战,如:非随机化干预的性质导致了混杂和选择偏见;以及源数据的人口可能不能代表研究(目标)的人口,这是一个常见的问题,被称为协变量转移。刘教授在报告中提出了一个基于倾向得分模型和半参数倾斜模型的修改后的bootstrap方法,同时解决了这些挑战,并通过仿真验证了该方法的有效性。
美国圣母大学心理系博士研究生徐子谦在题为《Integrating Structural Equation Modeling with Social Networks(结构方程模型与社交网络的结合方法)》的研究中,指出结构方程建模在社会科学中的广泛应用,传统上被应用于连续、有序和分类数据。然而,随着数字技术的迅速发展,社会科学现在涌现了大量的新数据类型,如文本数据、生物特征数据和网络数据。因此,她指出,扩展结构方程模型的适用性变得越来越重要。在这项研究中,他们课题组重点研究了如何将社交网络作为变量适应到结构方程模型中进行分析。社交网络可以提供有价值的信息,如人际关系和受欢迎程度,这可以增强结构方程模型在解释行为、认知模式和心理特征与社交关系之间的关系时的解释能力。她讨论了在结构方程模型中使用社交网络作为变量的两种方法:在以个体为中心的结构方程模型中使用网络节点作为变量,以及在以关系为中心的结构方程模型中使用网络对作为变量。这些方法可以直接使用了网络特征,但也可以扩展到不同的网络模型,如潜在空间模型。最后,她列举了一个实践中如何使用网络变量进行结构方程建模的例子。
香港中文大学教育心理系博士研究生肖磊峰就《Revisiting the Evaluation with Coefficient Alpha on Varying Length Scales and Sample Sizes(再论alpha系数: 样本和量表长度的影响)》进行了报告。她指出,社会科学研究对短量表越来越感兴趣,研究人员通常错误地认为短量表具有与长量表相同的α系数,在此研究中,她讨论了使用系数α的一些误解。他们课题组首先通过数学推导进一步解释了α系数与量表长度之间的关系,并阐明了一些常见的挑战和误解。对于不同长度的量表来说,采用一个普遍适用的信度标准(如 .70)是不合适的;对于短且因子载荷不高的量表,题目数量对信度的影响更大;量表越长、样本量越大(N≥500),测量越精确。随后,她提出了一个简单的指导规则应用于“alpha-if-item-deleted”程序中来完善量表;具体来说,对于一个量表,如果删除一个项目后α下降不到 .02,则可以移除该项目; 但如果删除一个项目后α下降超过 .05,则应该保留该项目。最后,考虑到量表长度和α之间的关系,她建议随着量表长度的变化使用不同的信度标准,并为较长的量表和更大的样本资料设置更高的信度标准。在大多数情况下, .80是相对安全的可靠性基准;题目越长,信度标准应该更高。同时,她建议可以通过对项目内容、表面效度、内容覆盖范围的补充分析来确保量表的质量。
中山大学心理学系的研究生冯咏琳就《How does prior distribution affect model fit indices of Bayesian Structural Equation Modeling(贝叶斯结构方程模型的先验分布如何影响模型的拟合指标)》进行了报告。通过研究发现,贝叶斯结构方程模型(BSEM)将贝叶斯方法的优势整合到结构方程模型框架中,并确保通过分配小方差的先验来实现模型的识别。尽管以往的研究已经揭示了BSEM中的先验规格如何影响模型参数的估计,但其对模型拟合指标的影响仍然不清楚。两项模拟研究表明,先验设置会影响评估模型拟合和选择模型的贝叶斯模型拟合指标,特别是在样本量小的情况下。她建议,在BSEM框架下,使用贝叶斯近似拟合指数可能更适合评估模型拟合和选择模型。
中山大学心理学系的研究生乔欣宇对《The Influence of Prior Variance on the Detection of Local Dependence in Factor Analysis(先验方差对因子分析中局部依赖性检测的影响)》进行了深入探讨。她指出,局部独立性是确定性因子分析(CFA)的基本假设。然而,贝叶斯结构方程模型可以用于处理局部依赖性。研究人员可以通过为残差协方差矩阵分配零均值和小方差先验来允许存在小的局部依赖性。两项模拟研究表明,先验方差主要影响残差协方差的估计的准确性。她对此提出了建议,并通过两个真实数据分析来证明这些建议的有效性。
中山大学心理学系的研究生路智明针对《Synthesizing data from pretest-posttest-control-group designs in mediation meta-analysis(在中介元分析中综合前测-后测-对照组设计的数据研究)》进行了报告。研究目的是比较在前测-后测对照组(PPCG)设计的随机研究数据上计算中介元分析(MMA)效应量的方法。她指出,此项研究使用蒙特卡洛模拟评估了两种可能的方法,即PSMMA或CSMMA,来解决此不一致性,并比较了每种背景下计算效应大小的现有方法。结果表明,CSMMA更受青睐,能够获得足够强大的结果。最后,他们课题组还提供了实际指南,并使用元分析对以正念为基础的干预对健康结果变量的治疗机制的效应进行了说明,总结了研究。
7月5日上午会议由美国圣母大学心理系袁克海教授主持。上午场共有2个常规报告和8个快速报告。
复旦大学社会科学高等研究院博士后研究员陈功博士在《Parasocial but Meaningful: Exposure to Foreign Cultures Encourages Pro-Outsider Attitudes(基于文化接触改善人们对外态度的跨国定量研究)》中探讨了接触外国文化是如何影响个人对外部群体的态度的。根据假想社交接触理论,通过屏幕与外部群体成员的间接接触可以减少群体间偏见,但这一效应受到媒体内容和生产者的影响。他认为,消费外国制造的文化产品(例如电视节目和电影)在改善外部群体态度方面起到更好的作用。首先,特定群体对外国文化的接触与去分类有关,它淡化了基于群体的差异,并加强了与接触媒体角色的个体化的假想关系。其次,对多元外国文化的广泛接触有助于重新分类,通过这种方式,超越国家身份构建更具包容性的超国家身份,使内部群体成员不仅对一个外国国家,而且对移民和全球化普遍持有积极意见。对亚洲晴雨表调查、东亚社会调查和亚洲学生调查的分析为两种文化接触提供了实证支持。他指出,使用有线电视所有权作为工具,基本的发现对一系列的敏感性测试都是稳健的。
美国伊利诺伊州立大学数学系助理教授耿沛博士进行了题为《Functional-coefficient autoregressive models with measurement errors(具有测量误差的函数系数自回归模型的估计)》。耿教授指出,函数系数自回归(FAR)模型适用于拟合时间序列数据中的非线性特征。在FAR框架下,Cai、Fan和Yao(2000)开发了一种有效的局部线性估计程序。当时间序列数据伴有测量误差时,他们课题组首先导出忽略测量误差的简单局部线性估计器(LLE)的渐近偏差。随后,课题组提出了一个修正偏差的局部线性估计程序,用于函数系数和自回归误差方差。通过模拟研究,他们发现简单的LLE是有偏的,而提议的估计方法在各种FAR模型设置下都表现出色,偏差大大减少。
德克萨斯大学奥斯汀分校教育心理系的助理教授刘笑博士做了《Detecting mediation effects with the Bayes factor: Performance evaluation and tools for sample size determination(使用贝叶斯因子检测中介效应:性能评估和样本量确定工具)》的报告。她认为,测试中介效应的存在在社会科学研究中非常常见。近年来,使用贝叶斯因子(BFs)的贝叶斯假设检验变得越来越受欢迎。然而,尽管贝叶斯中介分析的文献不断增长,但使用BFs测试中介效应的使用尚未得到充分研究。在这项研究中,他们课题组系统地检查了BF用于测试中介效应存在与否的性能。性能评估措施包括假阳性和真阳性率。为了计算性能评估措施,他们扩展了之前使用BFs确定样本量的文献,并开发了一种新的基于模拟的方法,以及R程序包和应用程序。
美国罗格斯大学新布伦瑞克分校经济系博士研究生Yang Liu进行了题为《Construct Different Uncertainty Indexes to Forecast Macroeconomic Variables(构建不同的不确定性指数来预测宏观经济变量)》的报告。在经济文献中,许多研究已经使用高维数据集来预测宏观经济变量。刘博士其团队进一步提出了新的宏观经济不确定性指数和预测因子,并对其预测能力进行了测试。通过使用FRED-MD数据集的月度数据,他们预测了全经济的八个方面的14个目标变量。实验主要包括四个步骤,首先是使用增强的AR(SIC)模型预测,然后基于第一步的预测误差方差构建不确定性指数,接着,他们比较了这些因子和指数的预测能力,并最后与VXO指数进行了对比。研究结果显示,新的因子和指数在所有的预测时期都有更好的表现,尤其是对于住房市场变量。她指出,在考虑到所有这些因素和指数时,目标变量可以获得最佳的预测表现。
加州大学默塞德分校心理系助理教授刘海燕博士进行了题为《An analysis of emotion contagion with longitudinal text data(情感传染与纵向文本数据分析)》的报告。情感传染是指人们与他们的互动伙伴产生相同的情感状态。在此研究中,59对之前不相识的参与者每周进行一次对话,共计六周。在研究中,他们课题组将这些对话转化为文本数据,并运用情感检测文本分析方法来研究双方的整体情感以及每个时间点的情感分数的变化。随后,他们应用潜在增长模型来研究情感的变化以及伙伴之间情感的距离如何随时间变化。
香港中文大学教育心理系博士研究生郭露阳就《Chinese Adolescents' Career Choice in Large-Scale International Studies: Trends and Methodologies(中国青少年的职业选择:趋势与方法论)》进行了报告,她对中国青少年的职业选择进行了研究,在大型国际研究中探讨了趋势和方法。在青春期,年轻人开始理解职业选择的复杂性,他们的职业期望会对其教育和职业成就产生显著影响。文化和社会背景也会影响职业期望,因此了解中国年轻人中精英职业的受欢迎程度,并为未来吸引潜在候选人是至关重要的。通过使用2000至2018年的PISA数据,她发现中国女孩越来越倾向于选择教育职业,而更多的中国男孩更喜欢商业和管理。与许多其他高效率经济体相比,科学和医疗职业并未受到足够的关注。从国家层面来看,金融支出、工作条件和社会对职业的评价在塑造青少年的职业选择中起到了关键作用。
中山大学心理学系的研究生夏昂进行了《A psychometric network analysis of adolescents’ mental health status: Evidence for key features for interventions青少年心理健康状况的心理测量网络分析:干预的关键特征证据》的报告,他指出,在过去的几十年中,中国的城乡地区在经济发展、教育资源和文化规范方面都存在巨大的差异。该研究旨在揭示中国城乡青少年心理社会问题的特征。使用“强度和困难问卷”(SDQ),分析了城市和农村地区青少年的报告数据。结果显示,城市和农村网络在SDQ总体及其子量表上有相似的模式,但在中心性上存在差异。这些发现可以用于帮助制定干预策略,以保护青少年的心理健康。
中山大学心理学系的研究生周悦做了题为《Communication Patterns of Adolescents’ Distress in Mother-Adolescent Dyads Predict Adolescents ’Suicidal Ideation: Mediated by Adolescents’ Internalizing and Externalizing Problems(母亲-青少年双向交流模式预测青少年的自杀意念:中介研究)》的报告。在这一项纵向研究中,她探讨了青少年的情绪困扰沟通模式(CPAED)是否可以预测青少年的自杀意念。这项研究涉及836名青少年(平均年龄=15.85,43.9%为女性),分为两个阶段(相隔一年)。结果显示,青少年在第一阶段的主动和反应性情感分享负向预测了他们在第二阶段的自杀意念,而在第一阶段,当母亲询问时,青少年避免沟通的情况则正向预测了他们在第二阶段的自杀意念。此外,研究还发现青少年在第二阶段的内化和外化问题都显著地中介了这两种沟通模式和青少年自杀意念之间的关系。总之,这项研究强调了CPAED在青少年自杀意念中的重要性,并为CPAED预测青少年自杀意念提供了底层机制的信息。
江西师范大学心理学院的助理教授李喻骏博士做了题为《Determinate the number of attributes using neural network(基于神经网络确定属性指标数量的研究)》的报告。他指出,这项研究从数据驱动的角度设计了一种估计属性指标的数量方法。他们课题组通过使用神经网络模型进行训练,并与其他三种常用的提取方法进行比较。结果显示,对于模拟数据,他们的方法的准确率高达94%,而现有方法的最高准确率只有16%。对于真实数据,他们的方法与领域专家的结果完全相同,而其他方法都低估了属性指标的数量。这项研究为认知诊断分析中属性指标数量的确定提供了新的方法,并证明了它在模拟和真实数据中的优越性。
斯坦福大学教育研究生院的博士研究生张沥今做了题为《The InterModel Vigorish for Model Comparison in Confirmatory Factor Analysis with Binary Outcomes(在具有二进制结果的验证性因子分析中的模型比较的InterModel Vigorish指标研究)》的报告。她首先介绍了一个新的指标-InterModel Vigorish (IMV),用于衡量基于预测精度选择一个模型而非另一个模型的价值。研究扩展了IMV到具有二进制结果的CFA模型,并证明了IMV为模型比较提供了独特的视角。结果表明,IMV提供了模型级和项目级的信息,以检测模型的错误规范,并且对样本大小的变化不敏感。与传统的拟合指数相比,IMV更加注重模型预测并可以惩罚过拟合的模型。她指出,这项研究为使用CFA模型的研究者和从业者提供了实际意义,并可以在未来的研究中扩展到结构模型。
7月5日下午的会议由北京师范大学心理学部的刘红云教授主持,共有2个常规报告和10个快速报告。
华东师范大学教育心理学系的助理教授肖悦博士发表了题为《Two-Parameter State Response Measurement Model for Process Data and Its Mixture Extension(过程数据的双参数状态响应测量模型及其混合扩展)》的报告。她强调,计算机交互式评估中的过程数据详细地揭示了应答者如何达到最终结果的机制,并为理解应答者的问题解决能力和认知过程提供了更全面的画像。通过聚类分析或传统心理测量模型的离散混合版本,已经确定了具有不同问题解决行为模式的明显子群体。肖博士课题组首先开发了一个基于双参数状态的响应(2P-SR)模型,并进一步扩展为带有类特定状态参数的混合模型,以检测对任务状态有不同响应倾向的潜在子群体。两种模型的参数估计都经过了两个小型模拟研究的检验。此外,她还提供了一个使用PISA 2012中的两个问题解决任务的过程数据的实证示例,来展示模型的应用。
宁夏大学的研究生郑铭清做了题为《How Does Self-Compassion Associate with Coping Self-Efficacy in Daily Life? A Dynamic Structural Equation Model Analysis(自悯如何与日常生活中的应对自效感关联?一种基于动态结构方程模型分析)》的报告。这项研究旨在探索自悯和应对自效感之间的时序关系。研究方法采用了经验抽样法,参与者完成了连续14天的日记记录。动态结构方程建模被用于合并两个相互关联的时间序列。结果显示自悯和应对自效感之间存在相互作用效应。总体来说,这项研究表明,在短期动态层面,应对自效感既可以被视为自悯的前因也可以被视为其结果,意味着自悯和应对自效感之间存在一个良性循环。
宁夏大学的研究生周续珠做了题为《A Tutorial in Longitudinal Network Analysis(纵向网络分析的教程: 一种分离网络关系和个体属性动态变化的方法)》的报告,她表示,如今纵向网络分析越来越受欢迎,它通过测量由两个或多个重复测量的个体属性和网络关系组成的时间序列数据来捕捉个体属性的动态变化,可以用大量的图表数据分析变量间的关系强度和影响方向。此研究在截面数据网络分析的基础上,结合低收入母亲的抑郁症状和自我效能感的网络分析数据实例,介绍了交叉滞后面板网络模型(CLPN)和涉及多个时间点的纵向网络分析的统计分析原理。介绍了不同网络分析的结果特征和解析语句,为研究者开展纵向网络分析提供了方法上的指导。
北京师范大学心理学部的研究生甘凯宇进行了题为《Improvements to Regularization Differential Item Functioning Detection Methods: Combining Regularization with Traditional Methods(正则化项目功能差异检测方法的改进:正则化与传统方法的结合)》的报告。他着重讨论了教育和心理测量研究中测试公平性的重要性,以及DIF作为测试公平性和有效性的关键指标。该研究提出了一种结合正则化方法和传统方法的新方法,用于选择锚点项并使用Mantel-Haenszel方法来识别DIF项。通过模拟和实证研究,结果显示,该建议的方法比MH方法更好地控制了Type I误差,而且比正则化方法具有更高的效能。
四川师范大学的研究生万志林做了题为《Evaluating the Threshold of Missingness Percentage in the Modeling of Intensive Longitudinal Data(密集纵向数据建模中丢失数据百分比的阈值评估)》的研究。他指出,体验抽样方法(ESM)是心理学研究中收集密集纵向数据的常用方法。该研究的主要目标是研究丢失数据的百分比如何影响密集纵向数据的模型估计和假设检验。通过模拟研究,研究者发现,丢失数据百分比在5%以下时,模型参数估计和假设检验的结果都相对稳健;然而,当丢失数据超过10%时,估计和假设检验都会受到严重的偏见。这项研究为心理学研究者提供了丢失数据处理和研究设计的实践建议。
中国科学技术大学管理学院统计与金融系的博士研究生曾民进行了题为《Estimating average treatment effect in the context of outcome dependent sampling with mismeasured outcome(在结果依赖抽样和误测结果的背景下估计平均处理效果的方法)》的报告。他表示,结果依赖抽样设计在多个科学领域中被广泛应用,包括流行病学、生态学和经济学。此外,如果用于样本选择的结果也被误测,那么准确估计平均处理效果(ATE)可能更具挑战性。据他们课题组研究得知,没有现有的方法可以同时解决这两个问题。为了填补这一空白,他们提出了一种在广义线性模型背景下估计ATE的新方法。基于估计方程方法,他们开发了一个计算简单的估计器,并在某些规律条件下证明了其一致性。为了放宽模型假设,他们还考虑了广义加法模型,并提议使用惩罚B样条来估计ATE,并为所提议的估计器建立渐进特性,并通过广泛的模拟研究和基于英国生物银行的半合成数据集(其中处理为酒精摄入,结果为痛风)应用,验证了此方法的有效性。
香港中文大学社会学系博士后研究员王鹏博士做了《The Story After Mobility: Debates and Critiques on Methods for Estimating Social Mobility Effects(流动之后的故事——社会流动效应的方法争论与评议)》的报告。他指出,社会流动是社会学的核心研究议题之一。社会流动作用于不同领域,对个体与社会产生一系列的后果,社会流动的效应也开始受到越来越多的关注。然而,共线性问题的存在使社会流动效应的测量一直面临挑战。二十世纪中叶以来,从邓肯的方形加法(SA)模型到奥普的菱形加法(DA)模型,再到索贝尔的对角线参照模型(DRM),社会流动效应的测量方法经历了长足的发展。其中尤以对角线参照模型的应用最为广泛,甚至成为测量社会流动效应的“黄金标准”。近年来,学者对对角线参照模型提出了一系列批评,并提出了新的测量流动效应的方法,如流动对照模型(MCM)。本文通过梳理社会流动效应测量方法的发展历程和核心争论,系统比较了几种方法在理论假设与方法设定等方面的差异,特别是广为使用的DRM模型以及新近提出的MCM模型之间的比较。利用模拟数据的结果以及现实数据的方法应用,本文指出,不同方法之间的最大差异在于其背后所暗含的理论假设的不同,及其解决不同理论关切的能力的差别,而非模型设定本身的优劣。因此在选择方法时需要考虑其理论假设在现实中的适用性。最后,本文也指出了在应用方法时需要注意的问题以及稳健性检验的方式。
北京师范大学心理系的博士研究生罗晓慧进行了题为《Assessing between- and within-person reliabilities of items and scale for daily procrastination: A multilevel and dynamic approach(评估日常拖延行为项目及其量表的人际间和人际内的可靠性:基于多层次和动态的方法)》的报告。在此项研究中,他们课题组采集了大量的纵向数据,用来捕捉拖延的动态波动。然而,大多数研究者在测量日常拖延时通常将特质量表进行了修改,但未能充分测试其可靠性。因此,本研究的主要目的是使用动态结构方程建模方法,来评估一个广泛使用的六项日常拖延量表的人际间和人际内的可靠性。样本方面,本研究中共有252名参与者连续34天完成了各种特质拖延的回顾性测量和日常拖延的测量。结果显示,日常拖延整个量表的人际间和人际内的可靠性都很高,但某一项的可靠性较低,这表明这一项在日常情境中可能不适用。此外,研究还发现拖延的潜在特质因子与特质拖延的测量之间存在中度到强烈的关联。总体上,此项研究评估了日常拖延量表的可靠性,为未来的研究提供了更为可靠和一致的结果,更好地估计了纵向数据的可靠性。
美国夏威夷大学马诺亚分校的Kentaro Hayashi副教授做了题为《On the Relationship between Factor Loadings and Component Loadings when Latent Traits and Specificities are Treated as Latent Factors(关于潜在特质与特异性被视为潜在因子时因子载荷与成分载荷的关系)》的报告。此研究主要探讨了特定情景下因子分析和主成分分析之间的关系。结果显示,当观测变量数(p)增加时,两种载荷之间的ascc趋近于1.0。这项研究为因子分析和主成分分析的关系提供了新的视角,并对高维数据分析中两种方法的选择提供了额外的见解。
中国北京师范大学认知神经科学与学习国家重点实验室的研究生黄顺森进行了题为《Multiverse-style analysis: Current bibliometric status and tutorial(多元宇宙样分析MSA:当前的文献计量学现状与教程)》的报告。他指出,多元宇宙样分析(MSA)的受欢迎度在社会科学中不断增长。文献计量分析显示,与MSA相关的论文从2015年的6篇增长到2022年的176篇,其中美国为主要贡献国。MSA的主题包括心理健康、青少年、fMRI等,教程主要涵盖了三大步骤。黄顺森还指出,中国在这一领域的贡献相对较小,需要进一步发展和应用,倡导开放科学和提高透明度。
中国科学技术大学博士研究生赵赛骏进行了题为《L0-regularized high-dimensional mediation analysis(L0-正则化的高维中介分析)》的报告。中介分析在心理学、经济学、社会科学和健康科学等众多科学领域中被广泛应用。随着数据收集技术的进步,研究者对开发使用各种正则化技术的高维中介分析方法产生了越来越浓厚的兴趣。尽管如此,基于L0正则化的方法尚未被探索。为了解决这一缺口,他们课题组提出了一种新颖的高维介导分析方法,称为L0-正则化高维中介分析(L0HMA)方法,基于线性介导模型。此外,他提议可以将L0HMA方法扩展到生存模型,包括Cox比例风险模型和加速失效时间模型。模拟结果显示,L0HMA方法在中介者选择和中介效应估计中具有良好的性能。最后,他汇报了将L0HMA方法应用于真实数据集的情况,以说明其实际应用的能力。
北京师范大学心理学部的博士研究生吴凡针对《Effects of BAS/BIS on person-situation dynamics(BAS/BIS对人格-情境动态的影响研究)》进行了报告。人格动态是一个新兴的研究领域,它强调日常生活中的人格过程及其底层机制。从这个角度出发,他们课题组提出了两种在人格动态中测试假设的方法。第一种方法关注的是人格状态与情境之间的关系,而第二种方法关注的是人格状态在不同情境中波动的稳定机制。她使用体验采样法介绍了这两种方法。在第一项研究中,参与者(n=97)连续14天每天三次接受了测量大五人格状态和主观情境八特性的问卷。通过多层次动态结构方程模型来分析情境特性和人格状态的自回归和交叉滞后效应。研究发现,主观情境特性和人格状态都具有适度的稳定性。对于交叉滞后关联,结果显示,情境特性(t-1)可以显著地预测大部分人-情境链接的人格状态(t),但反之则不然。神经质是一个例外,因为它与情境特性有显著的互惠关系。在第二项研究中,旨在检查动态情境评价和稳定的人格特质如何互相影响,以预测日常生活中的人格表现。结果发现,行为接近系统(BAS)起到了保护作用,它削弱了负面情境特性(t-1)对神经质状态(t)的影响,并加强了积极情境特性(t-1)对外向状态(t)的影响。基于这两项研究,他们得出结论,类似性格的倾向与类似状态的情境评价在影响个体在日常生活中的行为方面有着有意义的互动。
7月6日上午的会议由复旦大学社会科学高等研究院的青年副研究员曲文博士主持,共有2个常规报告和11个快速报告。
美国弗吉尼亚大学研究生贾第进行了题为《Bayesian Compositional Data Analysis with Informative Priors(具有信息性先验的贝叶斯成分数据分析)》的报告。她指出,成分数据有时被称为ipsative数据,是具有对样本值进行常数和约束的非负数据。虽然成分数据允许我们研究成分的相对重要性,但由于它们引入了确切的共线性问题,这在社会和行为科学中并不常见。传统方法通常会将成分从单纯体变换出去,例如使用对数比率或概率比率。然而,转换后的模型解释并不直白。在此研究中,他们课题组提出了一个贝叶斯方法,使用信息性先验来直接使用比例作为预测因子进行成分数据回归分析,并选择重要的成分预测因子。通过Monte Carlo模拟评估了所提方法的性能,并与现有的惩罚方法进行了比较。
美国俄克拉荷马大学心理学系的宋海荣教授进行了题为《Impact of temporal order selection on clustering of intensive longitudinal data based on VAR models(基于向量自回归VAR模型的密集纵向数据聚类的时间顺序选择影响)》的报告。她指出,基于模型的方法对密集的纵向数据进行聚类是研究多个个体之间的动态特征相似性和不同性的有力工具。在实施此类聚类技术时,研究者需要设置所有个体的内部进程的时间顺序为相同。目前有两种方法:一种是为所有个体的进程应用最复杂的结构或最高的顺序HO,而另一种则为所有个体选择最简单的结构或最低的顺序LO。在不同的数据条件下,哪种方法,HO还是LO,在聚类多变量动态过程中的表现如何?这个问题尚未得到很好的回答。在这项研究中,他们课题组引入了一个基于VAR的两步聚类过程,并使用此过程和高斯混合模型(GMM)以及K-均值聚类算法研究了HO和LO的性能。模拟研究显示,LO在恢复真实的簇数量和簇成员资格方面的表现通常优于HO。此外,与K-均值相比,GMM算法在恢复簇的数量和簇成员资格上显示出更高的准确性;然而,GMM算法对时间顺序的选择更为敏感,并在高阶VAR模型的动态过程聚类上表现更差。
美国宾夕法尼亚州立大学的博士研究生武靖川进行了题为《Small Data Approaches to Link Faster Time Scale Engagement Dynamics with Slower Time Scale Outcomes in Biobehavioral Interventions(生物行为干预中快速时间尺度参与动态与慢速时间尺度结果的小数据方法)》的研究。他们课题组在这次研究中进行了一次关于患有肾结石的患者液体摄入的数字干预的一个月的单组试验的二次数据分析。他们利用两种方法——时间序列聚类和特征工程方法,评估了与连接的水瓶和移动应用程序的一个月的参与模式之间的尿液体积(在这一人群中的肾结石风险的替代生物标记)之间的关系。结果显示,通过两种方法,研究者可以从每天的时间尺度的数字干预的密集参与数据中链接到慢时间尺度的生物行为效果。这项研究提供了生物行为干预研究中的数据驱动的时间尺度联系策略,可能在个性化的干预适应中是有用的。
美国德克萨斯大学达拉斯分校的博士研究生石敏进行了题为《China’s COVID Lockdown Policy and Trade with U.S.: A Deep Learning Time Series Approach(中国的COVID封控政策与美国贸易:基于深度学习时间序列方法的研究)》的报告。该研究旨在探讨COVID-19疫情下,中国的封控政策对美国贸易及其在企业层面的进一步影响。通过深度学习时间序列方法,研究对两种情境下的深度学习模型进行了构建:一是COVID-19情境,另一是非COVID-19情境。对比两种情境下的预测结果,来评估中国因COVID-19采取的封控政策对美国企业层面贸易的影响。她指出,研究结果将对策略制定和未来贸易趋势提供有力的参考。
湘潭大学的助理教授旷怡进行了题为《Rationality Evaluation and Continuous Improvement of the Curriculum System Using Factor Analysis(使用因子分析对课程体系的合理性评估和持续改进)》的报告。此研究旨在为工程教育专业认证提供更科学、客观和合理的课程体系的改进方法。通过对2018年和2019年通信工程专业的32门课程考试成绩数据进行因子分析,研究探讨了课程与五种技术毕业属性的关系。研究结果显示,通过改进“课程-毕业属性”关系矩阵,可以持续改进课程体系。
英国伦敦大学学院博士研究生程泳天做了《Can training neural network model solve the replication crisis? -A Monte Carlo Simulation Study with ordinal data(神经网络模型训练能解决复制危机吗?- 使用序数数据的蒙特卡罗模拟研究)》的报告。他指出,可重复性是科学的重要组成部分,自从心理学的可重复性被质疑后,心理学家提供了了许多建议用于增强心理学的可重复性,其中之一就是提供预测性,而非描述性的结论。有监督的机械学习恰好可以提供预测性的结论。在训练监督的机械学习模型时,数据集常常被分割为训练集和测试集。该研究使用神经网络在心理学常见的数据集上,研究基于蒙特卡洛模拟检验有监督的机械学习的可重复性。同时,该研究检验了一类错误的可能性,尤其是当样本量不足的时候。研究证明,即使在样本量严重不足的情况下,一类错误发生的概率依然较低。因此,神经网络得出的结论具有一定的可重复性。
台湾师范大学教育学院的邱皓政教授做了题为《Estimation of the learning trajectories with observed and latent heterogeneity: Application of growth mixture model with BCH correction for error(观测与潜在异质性下的学习轨迹估计—BCH修正的增长混合模型的应用)》的报告。邱教授在报告中探讨了如何鉴别学术成就的优劣群体,并采用了增长混合建模来识别学习成就的增长轨迹的方法。通过使用混合模型进行分析,该研究揭示了高中生和大学生在学业成就上的不同增长轨迹,以及性别和入学方式等因素对这些轨迹的影响,经分析,发现非线性模型对两个数据集都是最佳的拟合。该研究结果揭示了高中生和大学生在学习轨迹上的不同模式和异质性,特别强调了马太效应在高中生中的显现。此外,还探讨了混合建模在分析异质性时的方法论意义。
北京师范大学心理学部的研究生陈晓宇进行了题为《The Dynamic Impact Between Intraindividual Perceived Stress and Perceptual Speed in Young and Old Individuals(年轻和老年个体中的个体感知压力与知觉速度之间的动态影响)》的报告。她指出,使用残差动态结构方程模型(RDSEM)可以研究个体感知压力波动与知觉速度波动之间的互动关系,以及年轻和老年人之间的差异。研究发现,在老年人群中,感知的无助对知觉速度有负面影响,而感知的自我效能对知觉速度有正面影响。然而,年轻群体并未表现出这种情况。这些发现增强了人们对感知压力与认知能力关系的理解,尤其是在老年人群中知觉压力对知觉速度的影响的理解。
北京师范大学心理学部的研究生辛畅进行了题为《Using semantic items to detect careless responding and warning in real-time and its effect on response quality of the questionnaires(使用语义项目实时检测和警告粗心应答及其对问卷反应质量的影响)》的报告。他指出,粗心应答(CR)是自我管理数据中测量误差的常见来源,特别是在调查和问卷中。他们课题组使用NaoDao平台和jsPsych实施实时警告功能,并增加了语义索引,包括虚假项目(BI)、指导应答项目(IR)、语义同义词与反义词(SS & SA)以及偶-奇一致性,来实时筛查应答者。此外,此研究还使用了其他质量标准,包括马氏距离、自我报告项目和心理测量同义词与反义词。他们还计算了准则效度和结构效度,评估实时警告对问卷质量的影响。
北京师范大学心理学部的研究生董洁源进行了题为《When Predictors Sum to a Constant: Trade-off Effect Analysis Using a Regression Model Based on Isometric Log-ratio Transformation(当预测指标之和为常数时:基于等距对数比转换的回归模型的权衡效应分析)》的报告。他指出,针对预测变量的组成特性,他们课题组采用了计划的顺序二进制划分过程,将预测变量转化为等距对数比(ILR)坐标,并构建了基于ILR变换的回归模型。他们提出了一种基于改进模型的权衡效应的估计方法,新方法提供了更好的回归模型和更合理的权衡效应估计结果。
北京师范大学心理学部的研究生陈漪澜进行了题为《A Two-Step Method based on lz* for Identifying Effortful Respondents(基于lz*的识别用心作答者的两步法研究)》的报告。她提出了一种两步方法,通过估计项目参数来改进person-fit统计量lz*。结果表明,K-means可以提供较少的偏见项目参数估计,有助于在非用心作答严重的情况下提高识别用心作答者的lz*的准确性。
孟加拉国达卡大学ISRT的Md Hasinur Khan教授进行了题为《Implementation of Gradient Boosting for Survival Analysis with Competing Risk(在竞争风险下实施梯度提升法进行生存分析)》的报告。他提议使用现代集成机器学习技术来分析高维竞争风险数据。在多个模拟中,他们课题组评估了提议方法的性能,并与现有的CoxBoost方法进行了比较。结果表明,梯度提升方法在大多数场景中都提供了等效的结果,但在某些场景中,CoxBoost的结果稍微准确些。最后,他们将方法应用于膀胱癌的公开数据,并发现LightGBM在CoxBoost和XGBoost中表现最好。
美国圣母大学心理系的博士研究生仝凌波做了题为《Evaluation of the Bass-Ackward Method for Identifying the Number of Factors(使用Bass-Ackward方法确定因子数量的评估研究)》的报告。在研究中,她使用蒙特卡洛模拟评估Bass-Ackward在识别适当的因子数量方面的表现。研究结果显示,当存在交叉加载和大的因子相关性时,BA-maxLoading在识别因子数量方面优于并行分析。她还提供了应该在何时使用何种方法的建议,并提供了一个在线工具,用于通过BA方法可视化因子结构。
7月6日下午的会议由美国圣母大学心理系的张志勇教授主持,共有2个常规报告和2个快速报告。
弘业期货有限公司的博士后研究员杭天博士进行了题为《University Major Decision and its Effect on Wage: Modeling Interaction between Major Specificity and Education-Job Relevance(大学专业选择及其对薪酬的影响:专业特异性与教育-工作相关性之间的交互作用模型)》的报告。在报告中,他首先讲解了中国劳动力市场中大学生专业选择与工资的关系,并指出专业特定性是通过毕业生在职业选择中的集中度来衡量的,这表示每个专业所具有的知识和技能的特定性。该研究探讨了工资函数中专业特定性与教育-工作相关性的交互关系,同时采用机器学习技术,使用Lasso模型、KNN拟合和随机森林模型来进行变量选择和衡量特征重要性。调整后的Friedman的H2统计量用于测量交互关系。通过网络图和带有叶排序算法的热图进行交互关系的可视化。他指出,此研究达到了三个目标:首先,验证了专业特定性;其次,研究并可视化了专业特定性与教育-工作相关性之间的交互作用;最后,该结果对政府和个人都具有指导和信息价值。
美国圣母大学心理系的袁克海教授做了题为《Modeling Data with Measurement Errors but without Predefined Metrics: Fact vs Fallacy(在无预设度量标准下带有测量误差的数据建模:事实与误区)》的报告。袁教授指出,社会和行为科学中的数据通常包含测量误差,并且也没有预定义的度量。结构方程建模(SEM)通常用于分析这类数据。随后,他讨论了潜在变量建模与复合得分回归分析之间的问题,并通过对一个真实数据集的分析,一些与偏见、参数效率、标准化和结果解释有关的观念被证明是错误而非事实。这些澄清有助于更好地理解SEM和加权复合回归分析的优势和局限性,并有望推进社会和行为数据科学。
江西师范大学心理学院的助理教授林闻正进行了题为《The Re-individualization of the Internet: aggressiveness in social media posts before and after the geo-ip tag policy(互联网的再个体化:地理IP标签政策前后社交媒体帖子中的攻击性研究)》的报告。他指出,从2022年8月起,中国大陆的大多数社交媒体网站已经实施了公开发表评论时标注用户地理IP信息的政策,这项政策为测试社会心理学中的去个体化过程提供了一个极好的机会。去个体化理论认为,当人们的自我身份被剥夺时,他们会以违反规范的方式行事。这些理论已被用来解释在线的侵略行为。由于GEO-IP政策揭示的个人信息在一定程度上暴露了一个人的自我身份,因此假设它可以使人们“再次个体化”以更符合规范的方式行事。为了检验这一假设,他们课题组计划通过网络爬虫收集和分析政策实施前后的公开帖子,使用文本分析的方法比较互联网言论的侵略性和礼貌程度。
美国圣母大学的张志勇教授做了题为《WebPower: A tool for Statistical Power Analysis(WebPower:统计功效分析工具)》的报告。在报告中,张教授介绍了一个由他们课题组研发的基于多种统计模型的功效分析工具,该工具为线上应用,拥有简介的操作和丰富的功能,可以为研究者在数据分析过程中提供可视化、集成性的综合分析服务。
在发言结束后,会议分别设置了问答与讨论环节,与会学者围绕报告内容进行了深入的探讨。最后,主持人张志勇教授以及郭苏建教授感谢与会学者的热情参与并宣布会议结束。
曲文/文