版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
面向AI研发语言模型训练的可解释性分析与验证2025设计编程测试调试
2EMNLP’23,
ISSTA’24基于语言模型的代码编辑
3FSE’23,
FSE’21,ISSTA’20基于语言模型的测试生成LLMOptimized
testinitializationand
mutationRAG
4TSE’19,
ASE’18,
ICSE’
5基于语言模型的代码调试(调试过程生成)训练数据开发过程仓库代码模型IDE训练软件工程语言模型的“套路”清洗
6训练部署训练数据开发过程仓库代码模型IDE训练软件工程语言模型的“套路”清洗训练部署模型为什么会有这样的预测?模型的预测是如何形成的?我们如果纠正和调整模型预测?
7训练数据开发过程仓库代码模型IDE训练软件工程语言模型的“套路”清洗训练部署SE
for(AI
for
SE)基础框架训练样本归因表征归因仿真验证(数字孪生)
8案例研究:交互式代码编辑(CoEdPilot)CoEdPilot:
Recommending
Code
Edits
with
Learned
Prior
EditRelevance,
Project-wise
Awareness,
and
Interactive
Nature(ISSTA
2024).
9编辑定位研究工作案例:代码编辑工具CoEdPilotCoEdPilot:
Recommending
Code
Edits
with
Learned
Prior
EditRelevance,
Project-wise
Awareness,
and
Interactive
Nature(ISSTA
2024).
10编辑生成研究工作案例:代码编辑工具CoEdPilotCoEdPilot:
Recommending
Code
Edits
with
Learned
Prior
EditRelevance,
Project-wise
Awareness,
and
Interactive
Nature(ISSTA
2024).
11下一轮编辑定位
12滑动窗口(编辑前)testing:
added
name
matcher
andsanitizerThe
matcher
is
responsible
for
sanitizing
anduniquing
the
test
and
benchmark
names
andthus
…commit消息前编辑(已经发生的编辑)基本想法
13testing:
added
name
matcher
andsanitizerThe
matcher
is
responsible
for
sanitizing
anduniquing
the
test
and
benchmark
names
andthus
…commit消息前编辑(已经发生的编辑)基本想法
14滑动窗口(编辑后)代码编辑的基本设计想法模型任务分解:
15协同编辑评估模型依赖分析模型编辑生成模型反馈设计:反馈信息增量预测和矫正一体化代码编辑的基本设计想法模型任务分解:
16协同编辑评估模型依赖分析模型编辑生成模型反馈设计:反馈信息增量预测和矫正一体化代码编辑的基本设计想法模型任务分解:
17协同编辑评估模型依赖分析模型编辑生成模型反馈设计:反馈信息增量预测和矫正一体化步骤1:协同编辑评估Code
ACode
BCodeBertdepDep
ReasonDependency
AnalyzerCodeBertSemanticRelvanceCode
ACode
BCo-changePredication
18步骤2:编辑位置预测(指令微调)Replace
19Keep步骤3:编辑内容生成(指令微调)
20反馈设计
21实验结果:编辑位置数据集收集
22实验结果:编辑内容数据集收集
23实验结果:反馈效果数据集收集
24训练数据开发过程仓库代码模型IDE训练软件工程语言模型清洗训练部署SE
for(AI
for
SE)基础框架训练样本归因表征归因仿真验证(数字孪生)
25哪些训练数据影响了这次预测?训练数据集代码模型Koh,
Pang
Wei,
and
Percy
Liang.
"Understandingblack-box
predictions
viainfluence
functions."
International
conference
on
machine
learning.
PMLR,
2017.定义:给定一个训练样本��,如果我们对��提权或者降权�,那么训练模型会发生什么变化?
26哪些训练数据影响了这次预测?训练数据集代码模型Koh,
Pang
Wei,
and
Percy
Liang.
"Understandingblack-box
predictions
viainfluence
functions."
International
conference
on
machine
learning.
PMLR,
2017.定义:给定一个训练样本��,如果我们对��提权或者降权�,那么训练模型会发生什么变化?拟合测试样本的方向
27拟合训练样本的方向所有样本的交互效应改进方法Liu,
Ruofan,
Yun
Lin,
et
al.
"Debugging
and
explaining
metriclearningapproaches:
An
influence
function
based
perspective."
NeurIPS’22.基本想法:给定模型�0,我们生成多个变异模型�1,�2,…,��,来预估拟合一个训练样
本��和一个测试样本��的方向协同效应Empirical
Influence
Function
28哪些训练数据影响了这次预测?训练数据集代码模型Koh,
Pang
Wei,
and
Percy
Liang.
"Understandingblack-box
predictions
viainfluence
functions."
International
conference
on
machine
learning.
PMLR,
2017.定义:给定一个训练样本��,如果我们对��提权或者降权�,那么训练模型会发生什么变化?拟合测试样本的方向拟合训练样本的方向所有样本的交互效应
29将影响函数应用于代码编辑生成任务有益训练样本相关度分析
30有害训练样本相关度分析编辑模型的预测分析到的相关样本
31编辑定位模型的预测训练样本归因
32编辑定位模型的预测
33训练样本归因训练样本会“打架”代码替换代码删除+新增代码替换代码删除+新增训练样本会“打架”普遍“打架”现象:过长Commit
Message带来过多冲突
36训练数据集代码模型标注清洗编程代码训练数据分析与定位
37代码数据重标注代码训练数据合并训练数据开发过程仓库代码模型IDE训练软件工程语言模型清洗训练部署SE
for(AI
for
SE)基础框架训练样本归因表征归因仿真验证(数字孪生)
38深度学习即表征学习
39可视化的表征空间
40可视化的表征空间Yang,
Xianglin,
Yun
Lin,
etal.
"DeepDebugger:
An
Interactive
Time-TravellingDebugging
Approach
for
Deep
Classifiers."
FSE.
2023.Yang,
Xianglin,
Yun
Lin,
et
al.
"Deepvisualinsight:
Time-travelling
visualizationforspatio-temporal
causality
of
deep
classification
training."
AAAI
2022.
41训练过程中噪音样本表征运动e1e2e3e4e5代码表征分析(搜索任务)CodeRepresentation
43Natural
Language
RepresentationMRR:
0.31高层语义编辑距离token编辑距离ATACGAAAG…
44………高层语义编辑距离(代码-代码)def
max_version(self):data
=
self.version_downloadsif
not
data:return
None,
0return
max(data.items(),
key=lamda
item:
item[1])def
min_version(self):data
=
self.version_downloadsif
not
data:return
(None,
0)return
min(data.items(),
key=lamda
item:
item[1])表征相似度:0.912
45高层语义编辑距离(代码-代码)def
max_version(self):data
=
self.version_downloadsif
not
data:return
None,
0return
max(data.items(),
key=lamda
item:
item[1])def
min_version(self):data
=
self.version_downloadsif
not
data:return
(None,
0)return
min(data.items(),
key=lamda
item:
item[1])
46高层语义编辑距离(代码-代码)def
max_version(self):data
=
self.version_downloadsif
not
data:return
None,
0return
max(data.items(),
key=lamda
item:
item[1])def
min_version(self):data
=
self.version_downloadsif
not
data:return
(None,
0)return
min(data.items(),
key=lamda
item:
item[1])
47高层语义编辑距离(代码-代码)
48高层语义编辑距离(代码-代码)MRR:0.38
49加入表征对齐预训练任务(对比学习)MRR:0.50
(+0.12)训练数据开发过程仓库代码模型IDE训练软件工程语言模型清洗训练部署SE
for(AI
for
SE)基础框架训练样本归因表征归因仿真验证(数字孪生)
50基本想法:从提交历史重现“当年的”开发过程代码提交赋能预估准确率生产力
51实验从项目旧版本commit开始(一个commit可视为若干次编辑的集合),初始未完成编辑集合=所有编辑,初始先前编辑集合为空模拟的程序员作出第一个编辑,并输入commit
message作为模型的用户描述检查是否有未完成的编辑。若无,流程结束验证编辑行定位器返回的编辑位置是否与真实的编辑位置匹配。如果有匹配的位置,从中选择一个编辑位置继续进行。根据生成的编辑内容最高的BLEU4分数评估生成的编辑质量。如果BLEU
4
分数介于50
到
100,则用户会在推荐内容基础上进行手动修改。如果没有匹配,从未完成的编辑集合中选择下一个编辑位置。如果BLEU4分数小于50,则用户会拒绝推荐内容,手动编辑。如果BLEU4分数等于100,则用户直接接受推荐内容,无需手动编辑。将此次完成的编辑从未完成编辑集合中移除,并加入到先前编辑集合中
52
53定义用户查看Locator推荐的单个位置所
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 客户服务管理师备考冲刺模拟试卷及答案
- 发电厂风力发电管理
- 加强外包施工作业安全管理工作的实施意见培训考核试题及答案
- 混凝土安全教育试题及答案
- 货运机动车驾驶证科目四专项练习模拟考试及答案
- 好医生2026年《基层医疗机构医院感染管理岗位培训》习题及答案
- 护理冷热疗法试题及答案
- 国际贸易实务案例分析题附答案
- 工程保修期的质量保证措施
- 食品加工厂卫生管理办法
- 中药湿热敷技术评分标准
- 国家职业技能标准申报表
- 《论语译注》-杨伯峻译注-中华书局
- GB/T 6682-2008分析实验室用水规格和试验方法
- GB/T 19886-2005声学隔声罩和隔声间噪声控制指南
- GB/T 15065-2009电线电缆用黑色聚乙烯塑料
- 农业生物环境工程第 温室设施环境调节与控制1
- 化学品安全技术说明书MSDS(液氨)
- 《建设项目全过程造价咨询规程》2017年1月18日
- 52206马工程组织行为学课件
- 中医药翻译的技巧精讲18张课件
评论
0/150
提交评论