高研院青年研究员在SSCI顶刊Political Analysis发表论文
论文题目:
On Finetuning Large Language Models (论微调大规模语言模型)
期刊:
Political Analysis (2022年影响因子:5.4,SSCI一区,政治学排名第8位)
王宇博士
复旦大学社会科学高等研究院青年研究员
美国罗切斯特大学政治科学与计算机科学双博士
研究领域:计算政治学、国际关系、人工智能、大数据
论文简介
最近,Häffner等学者的一篇论文(2023年,《政治分析》第31卷,第481-499页)介绍了一种可解释的深度学习方法,用于创建特定领域的词典。该论文声称,基于词典的方法在预测准确性方面优于经过微调的语言模型,同时保持了可解释性。我们的研究结果发现,基于词典的方法所报告的优于大型语言模型(特别是BERT)的优势,是因为在微调中排除了语言模型中的大多数参数。在本文中,我们首先讨论了BERT模型的架构,然后解释了仅微调顶层分类器的局限性,并最后报告了我们研究发现:一旦允许这些参数在微调中学习,经过微调的语言模型在������2方面优于新提出的基于词典的方法27%,在均方误差方面优于46%。对于大型语言模型、文本分类和文本回归感兴趣的研究人员,欢迎阅读此文。我们的代码和数据可公开获取。
阅读全文: https://doi.org/10.1017/pan.2023.36
王宇今年发表在同一期刊Political Analysis另一篇关于语言模型论文: https://doi.org/10.1017/pan.2023.3