当前位置:首页  成果展示  用户成果

An empirical study of best practices for code pre-trained models on software engineering classification tasks

时间:2026-05-07作者:编辑:审核:阅读:216

作者信息:

学院:计算机科学与技术学院

作者:赵宇


论文简介:


在软件工程实践中,解决代码相关的分类挑战至关重要。利用自然语言处理领域的预训练模型通过生成上下文相关的词嵌入,在文本分类方面展现出显著优势。类似地,对于代码相关的分类任务,研究人员和实践者越来越倾向于利用面向代码的PTM应用于下游任务。然而,我们观察到,软件工程研究人员和实践者在使用代码PTM时,常常将代码和文本视为与NLP策略相同的对象。尽管软件工程领域之前的研究表明编程语言和自然语言之间存在相似性,但对于当前的研究人员来说,直接应用NLP知识来假设代码也具有类似的行为可能并不完全合适。因此,为了总结出研究人员和实践者使用代码PTM进行软件工程分类任务的最佳实践,我们对六种不同的代码PTM进行了实证分析。这些PTM涵盖三种架构框架并应用于四种软件工程分类任务同时考虑了两种场景。我们的研究结果揭示了使用代码PTM进行特定代码分类任务的几个重要见解。


论文链接:

https://www.sciencedirect.com/science/article/abs/pii/S0957417425003847

期刊名:《Expert Systems with Applications 







分享: