高研院青年研究员王宇博士在SCI顶刊PNAS发表论文
论文题目
Large Language Models for Identifying Social Determinants of
Health (大型语言模型在识别健康社会决定因素中的应用)
国际期刊
Proceedings of the National Academy of Sciences (PNAS) (2023年影响因子:9.4,SCI一区)
作者简介
王宇博士
● 复旦大学社会科学高等研究院青年研究员
● 美国罗切斯特大学政治科学与计算机科学双博士
● 人工智能与计算社会科学研究实验室(筹)主任
● 研究领域:计算政治学、人工智能、大数据
论文摘要
大型语言模型,以BERT和GPT为代表,正在自然语言处理领域展开激烈竞争。总体而言,BERT仍在文本分类任务中占据优势。在这一背景下,Gabriel等人近期开展了一项关于识别健康社会决定因素(Social Determinants of Health, SDoH)的研究,提出了一种基于 RoBERTa(BERT 的变体)的方法,在标注数据极为有限的情况下,尝试识别无家可归、食物短缺和家庭暴力等问题。在本研究中,我们围绕BERT模型的微调策略、模型选择标准以及合成数据的使用效果展开了深入讨论。首先,从Gabriel等人的实验结果来看,RoBERTa的微调效果并不理想,尤其是在“食物短缺”这一任务中,其ROC-AUC指标仅为 0.13。其次,尽管在文本分类任务中BERT目前仍优于GPT,但像Gabriel等人仅有四五十条训练样本的情况,zero-shot或few-shot GPT模型往往能取得比微调BERT更优的表现。最后,在数据增强与合成数据方面,Gabriel等人认为合成数据有助于提升模型性能。但我们指出,这种提升的大小高度依赖于真实数据的数量。对于微调BERT模型来说,一旦真实数据量达到一定规模,数据增强与合成数据所带来的边际收益就会显著下降。
关于微调BERT模型,作者先前的研究工作有(如下链接请复制到浏览器打开):
Large Language Models for Depression Prediction (PNAS
(https://www.pnas.org/doi/10.1073/pnas.2409757121)
On Finetuning Large Language Models (Political Analysis, 2023)
Monitoring Depression Trends on Twitter During the COVID-19 Pandemic: Observational Study (JMIR Infodemiology, 2021)
(https://infodemiology.jmir.org/2021/1/e26769)
关于GPT和BERT的模型选择,作者最近的研究工作有:
Selecting Between BERT and GPT for Text Classification in Political Science Research (arxiv:2411.05050, 2024)
(https://arxiv.org/pdf/2411.05050)
关于BERT模型的数据增强,作者先前的研究工作有:
How Effective is Task-Agnostic Data Augmentation for Pretrained Transformers? (EMNLP Findings, 2020)
(https://aclanthology.org/2020.findings-emnlp.394.pdf)
论文链接:
https://www.pnas.org/doi/full/10.1073/pnas.2501506122