2025面向AI研发语言模型训练的可解释性分析与验证_第1页
2025面向AI研发语言模型训练的可解释性分析与验证_第2页
2025面向AI研发语言模型训练的可解释性分析与验证_第3页
2025面向AI研发语言模型训练的可解释性分析与验证_第4页
2025面向AI研发语言模型训练的可解释性分析与验证_第5页
已阅读5页,还剩58页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

面向AI研发语言模型训练的可解释性分析与验证2025设计编程测试调试

2EMNLP’23,

ISSTA’24基于语言模型的代码编辑

3FSE’23,

FSE’21,ISSTA’20基于语言模型的测试生成LLMOptimized

testinitializationand

mutationRAG

4TSE’19,

ASE’18,

ICSE’

5基于语言模型的代码调试(调试过程生成)训练数据开发过程仓库代码模型IDE训练软件工程语言模型的“套路”清洗

6训练部署训练数据开发过程仓库代码模型IDE训练软件工程语言模型的“套路”清洗训练部署模型为什么会有这样的预测?模型的预测是如何形成的?我们如果纠正和调整模型预测?

7训练数据开发过程仓库代码模型IDE训练软件工程语言模型的“套路”清洗训练部署SE

for(AI

for

SE)基础框架训练样本归因表征归因仿真验证(数字孪生)

8案例研究:交互式代码编辑(CoEdPilot)CoEdPilot:

Recommending

Code

Edits

with

Learned

Prior

EditRelevance,

Project-wise

Awareness,

and

Interactive

Nature(ISSTA

2024).

9编辑定位研究工作案例:代码编辑工具CoEdPilotCoEdPilot:

Recommending

Code

Edits

with

Learned

Prior

EditRelevance,

Project-wise

Awareness,

and

Interactive

Nature(ISSTA

2024).

10编辑生成研究工作案例:代码编辑工具CoEdPilotCoEdPilot:

Recommending

Code

Edits

with

Learned

Prior

EditRelevance,

Project-wise

Awareness,

and

Interactive

Nature(ISSTA

2024).

11下一轮编辑定位

12滑动窗口(编辑前)testing:

added

name

matcher

andsanitizerThe

matcher

is

responsible

for

sanitizing

anduniquing

the

test

and

benchmark

names

andthus

…commit消息前编辑(已经发生的编辑)基本想法

13testing:

added

name

matcher

andsanitizerThe

matcher

is

responsible

for

sanitizing

anduniquing

the

test

and

benchmark

names

andthus

…commit消息前编辑(已经发生的编辑)基本想法

14滑动窗口(编辑后)代码编辑的基本设计想法模型任务分解:

15协同编辑评估模型依赖分析模型编辑生成模型反馈设计:反馈信息增量预测和矫正一体化代码编辑的基本设计想法模型任务分解:

16协同编辑评估模型依赖分析模型编辑生成模型反馈设计:反馈信息增量预测和矫正一体化代码编辑的基本设计想法模型任务分解:

17协同编辑评估模型依赖分析模型编辑生成模型反馈设计:反馈信息增量预测和矫正一体化步骤1:协同编辑评估Code

ACode

BCodeBertdepDep

ReasonDependency

AnalyzerCodeBertSemanticRelvanceCode

ACode

BCo-changePredication

18步骤2:编辑位置预测(指令微调)Replace

19Keep步骤3:编辑内容生成(指令微调)

20反馈设计

21实验结果:编辑位置数据集收集

22实验结果:编辑内容数据集收集

23实验结果:反馈效果数据集收集

24训练数据开发过程仓库代码模型IDE训练软件工程语言模型清洗训练部署SE

for(AI

for

SE)基础框架训练样本归因表征归因仿真验证(数字孪生)

25哪些训练数据影响了这次预测?训练数据集代码模型Koh,

Pang

Wei,

and

Percy

Liang.

"Understandingblack-box

predictions

viainfluence

functions."

International

conference

on

machine

learning.

PMLR,

2017.定义:给定一个训练样本��,如果我们对��提权或者降权�,那么训练模型会发生什么变化?

26哪些训练数据影响了这次预测?训练数据集代码模型Koh,

Pang

Wei,

and

Percy

Liang.

"Understandingblack-box

predictions

viainfluence

functions."

International

conference

on

machine

learning.

PMLR,

2017.定义:给定一个训练样本��,如果我们对��提权或者降权�,那么训练模型会发生什么变化?拟合测试样本的方向

27拟合训练样本的方向所有样本的交互效应改进方法Liu,

Ruofan,

Yun

Lin,

et

al.

"Debugging

and

explaining

metriclearningapproaches:

An

influence

function

based

perspective."

NeurIPS’22.基本想法:给定模型�0,我们生成多个变异模型�1,�2,…,��,来预估拟合一个训练样

本��和一个测试样本��的方向协同效应Empirical

Influence

Function

28哪些训练数据影响了这次预测?训练数据集代码模型Koh,

Pang

Wei,

and

Percy

Liang.

"Understandingblack-box

predictions

viainfluence

functions."

International

conference

on

machine

learning.

PMLR,

2017.定义:给定一个训练样本��,如果我们对��提权或者降权�,那么训练模型会发生什么变化?拟合测试样本的方向拟合训练样本的方向所有样本的交互效应

29将影响函数应用于代码编辑生成任务有益训练样本相关度分析

30有害训练样本相关度分析编辑模型的预测分析到的相关样本

31编辑定位模型的预测训练样本归因

32编辑定位模型的预测

33训练样本归因训练样本会“打架”代码替换代码删除+新增代码替换代码删除+新增训练样本会“打架”普遍“打架”现象:过长Commit

Message带来过多冲突

36训练数据集代码模型标注清洗编程代码训练数据分析与定位

37代码数据重标注代码训练数据合并训练数据开发过程仓库代码模型IDE训练软件工程语言模型清洗训练部署SE

for(AI

for

SE)基础框架训练样本归因表征归因仿真验证(数字孪生)

38深度学习即表征学习

39可视化的表征空间

40可视化的表征空间Yang,

Xianglin,

Yun

Lin,

etal.

"DeepDebugger:

An

Interactive

Time-TravellingDebugging

Approach

for

Deep

Classifiers."

FSE.

2023.Yang,

Xianglin,

Yun

Lin,

et

al.

"Deepvisualinsight:

Time-travelling

visualizationforspatio-temporal

causality

of

deep

classification

training."

AAAI

2022.

41训练过程中噪音样本表征运动e1e2e3e4e5代码表征分析(搜索任务)CodeRepresentation

43Natural

Language

RepresentationMRR:

0.31高层语义编辑距离token编辑距离ATACGAAAG…

44………高层语义编辑距离(代码-代码)def

max_version(self):data

=

self.version_downloadsif

not

data:return

None,

0return

max(data.items(),

key=lamda

item:

item[1])def

min_version(self):data

=

self.version_downloadsif

not

data:return

(None,

0)return

min(data.items(),

key=lamda

item:

item[1])表征相似度:0.912

45高层语义编辑距离(代码-代码)def

max_version(self):data

=

self.version_downloadsif

not

data:return

None,

0return

max(data.items(),

key=lamda

item:

item[1])def

min_version(self):data

=

self.version_downloadsif

not

data:return

(None,

0)return

min(data.items(),

key=lamda

item:

item[1])

46高层语义编辑距离(代码-代码)def

max_version(self):data

=

self.version_downloadsif

not

data:return

None,

0return

max(data.items(),

key=lamda

item:

item[1])def

min_version(self):data

=

self.version_downloadsif

not

data:return

(None,

0)return

min(data.items(),

key=lamda

item:

item[1])

47高层语义编辑距离(代码-代码)

48高层语义编辑距离(代码-代码)MRR:0.38

49加入表征对齐预训练任务(对比学习)MRR:0.50

(+0.12)训练数据开发过程仓库代码模型IDE训练软件工程语言模型清洗训练部署SE

for(AI

for

SE)基础框架训练样本归因表征归因仿真验证(数字孪生)

50基本想法:从提交历史重现“当年的”开发过程代码提交赋能预估准确率生产力

51实验从项目旧版本commit开始(一个commit可视为若干次编辑的集合),初始未完成编辑集合=所有编辑,初始先前编辑集合为空模拟的程序员作出第一个编辑,并输入commit

message作为模型的用户描述检查是否有未完成的编辑。若无,流程结束验证编辑行定位器返回的编辑位置是否与真实的编辑位置匹配。如果有匹配的位置,从中选择一个编辑位置继续进行。根据生成的编辑内容最高的BLEU4分数评估生成的编辑质量。如果BLEU

4

分数介于50

100,则用户会在推荐内容基础上进行手动修改。如果没有匹配,从未完成的编辑集合中选择下一个编辑位置。如果BLEU4分数小于50,则用户会拒绝推荐内容,手动编辑。如果BLEU4分数等于100,则用户直接接受推荐内容,无需手动编辑。将此次完成的编辑从未完成编辑集合中移除,并加入到先前编辑集合中

52

53定义用户查看Locator推荐的单个位置所

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论