高研院青年研究员王宇博士在SCI顶刊PNAS发表论文

栏目:论著推荐发布时间:2025-04-02浏览次数:507


论文题目

Large Language Models for Identifying Social Determinants of Health (大型语言模型在识别健康社会决定因素中的应用)

国际期刊

Proceedings of the National Academy of Sciences (PNAS) (2023年影响因子:9.4SCI一区)

作者简介

王宇博士

●    复旦大学社会科学高等研究院青年研究员

●    美国罗切斯特大学政治科学与计算机科学双博士

●    人工智能与计算社会科学研究实验室(筹)主任

●    研究领域:计算政治学、人工智能、大数据


论文摘要

大型语言模型,以BERTGPT为代表,正在自然语言处理领域展开激烈竞争。总体而言,BERT仍在文本分类任务中占据优势。在这一背景下,Gabriel等人近期开展了一项关于识别健康社会决定因素(Social Determinants of Health, SDoH)的研究,提出了一种基于 RoBERTaBERT 的变体)的方法,在标注数据极为有限的情况下,尝试识别无家可归、食物短缺和家庭暴力等问题。在本研究中,我们围绕BERT模型的微调策略、模型选择标准以及合成数据的使用效果展开了深入讨论。首先,从Gabriel等人的实验结果来看,RoBERTa的微调效果并不理想,尤其是在食物短缺这一任务中,其ROC-AUC指标仅为 0.13。其次,尽管在文本分类任务中BERT目前仍优于GPT,但像Gabriel等人仅有四五十条训练样本的情况,zero-shotfew-shot GPT模型往往能取得比微调BERT更优的表现。最后,在数据增强与合成数据方面,Gabriel等人认为合成数据有助于提升模型性能。但我们指出,这种提升的大小高度依赖于真实数据的数量。对于微调BERT模型来说,一旦真实数据量达到一定规模,数据增强与合成数据所带来的边际收益就会显著下降。


关于微调BERT模型,作者先前的研究工作有(如下链接请复制到浏览器打开):

Large Language Models for Depression Prediction (PNAS, 2024)

(https://www.pnas.org/doi/10.1073/pnas.2409757121)

On Finetuning Large Language Models (Political Analysis, 2023)

(https://www.cambridge.org/core/journals/political-analysis/article/on-finetuning-large-language-models/443356A60ACD5B1716B14DD204BDEA1F)

Monitoring Depression Trends on Twitter During the COVID-19 Pandemic: Observational Study (JMIR Infodemiology, 2021)

(https://infodemiology.jmir.org/2021/1/e26769)


关于GPTBERT的模型选择,作者最近的研究工作有:

Selecting Between BERT and GPT for Text Classification in Political Science Research (arxiv:2411.05050, 2024)

(https://arxiv.org/pdf/2411.05050)


关于BERT模型的数据增强,作者先前的研究工作有:

How Effective is Task-Agnostic Data Augmentation for Pretrained Transformers? (EMNLP Findings, 2020)

(https://aclanthology.org/2020.findings-emnlp.394.pdf)


论文链接:

https://www.pnas.org/doi/full/10.1073/pnas.2501506122