




已阅读5页,还剩6页未读, 继续免费阅读
版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
实验项目一 词法分析器一、实验类型本实验为验证性实验。二、实验目的 1通过本实验加深对词法分析程序的功能及实现方法的理解;2使用flex实现词法分析程序。三、准备工作和预备知识Lex(Lexical Analyzar词法分析生成器)是Unix下十分重要的词法分析工具。经常用于语言分析,公式编译等广泛领域。1.Lex(Lexical Analyzar)初步示例先看简单的例子:一个简单的Lex文件exfirst.l内容:%#include stdio.h%n;0-9+ printf(Int: %sn,yytext);0-9*.0-9+ printf(Float: %sn,yytext);a-zA-Za-zA-Z0-9*printf(Var: %sn,yytext);+-*/%printf(Op: %sn,yytext);“.”printf(Unknown : %cn,yytext0);%在命令行下执行命令flex解析,会自动生成lex.yy.c文件:rootlocalhost liweitestflex exfirst.l进行编译生成parser可执行程序:rootlocalhost liweitestcc -o parser lex.yy.c ll或者rootlocalhost liweitestgcc lex.yy.c ll -o parser注意:如果不加-ll链结选项,cc编译时会出现以下错误,后面会进一步说明。/tmp/cciACkbX.o(.text+0x37b): In function yylex: undefined reference to yywrap/tmp/cciACkbX.o(.text+0xabd): In function input: undefined reference to yywrap创建待解析的文件file.txt:titlei=1+3.9;a3=909/6bcd=4%9-333通过已生成的可执行程序,进行文件解析。rootlocalhost liweitest# ./parser file.txtVar: titleVar: iUnknown : =Int: 1Op: +Float: 3.9Unknown : ;Var: a3Unknown : =Int: 909Op: /Int: 6Var: bcdUnknown : =Int: 4Op: %Int: 9Op: -Int: 333到此Lex用法会有个直观的了解:a.定义Lex描述文件b.通过lex,flex工具解析成lex.yy.c文件c.使用cc或gcc编译lex.yy.c生成可执行程序再来看一个比较完整的Lex描述文件exsec.l:%#include stdio.hint linenum;%“title”showtitle();nlinenum+;0-9+printf(Int: %sn,yytext);0-9*.0-9+printf(Float: %sn,yytext);a-zA-Za-zA-Z0-9*printf(Var: %sn,yytext);+-*/%printf(Op: %sn,yytext);“.”printf(Unknown : %cn,yytext0);%showtitle()printf(- Lex Example -n);int main()linenum=0;yylex(); /*进行分析*/printf(nLine Count: %dn,linenum);return 0;int yywrap()return 1;进行解析编译:rootlocalhost liweitestflex exsec.lrootlocalhost liweitestcc -o parser lex.yy.crootlocalhost liweitest./parser file.txt- Lex Example -Var: iUnknown : =Int: 1Op: +Float: 3.9Unknown : ;Var: a3Unknown : =Int: 909Op: /Int: 6Var: bcdUnknown : =Int: 4Op: %Int: 9Op: -Int: 333Line Count: 4这里就没有加-ll选项,但是可以编译通过。下面开始着重整理下Lex描述文件.l。2.Lex(Lexical Analyzar)描述文件的结构介绍Lex工具是一种词法分析程序生成器,它可以根据词法规则说明书的要求来生成单词识别程序,由该程序识别出输入文本中的各个单词。一般可以分为。其中规则部分是必须的,定义和用户子程序部分是任选的。(1)定义部分定义部分起始于%符号,终止于%符号,其间可以是包括include语句、声明语句在内的C语句。这部分跟普通C程序开头没什么区别。%#include stdio.hint linenum;%(2)规则部分规则部分起始于%符号,终止于%符号,其间则是词法规则。词法规则由模式和动作两部分组成。模式部分可以由任意的正则表达式组成,动作部分是由C语言语句组成,这些语句用来对所匹配的模式进行相应处理。需要注意的是,lex将识别出来的单词存放在yytext字符数据中,因此该数组的内容就代表了所识别出来的单词的内容。类似yytext这些预定义的变量函数会随着后面内容展开一一介绍。动作部分如果有多行执行语句,也可以用括起来。%titleshowtitle();nlinenum+;0-9+printf(Int: %sn,yytext);0-9*.0-9+printf(Float: %sn,yytext);a-zA-Za-zA-Z0-9*printf(Var: %sn,yytext);+-*/%printf(Op: %sn,yytext);.printf(Unknown : %cn,yytext0);%A.规则部分的正则表达式规则部分是Lex描述文件中最为复杂的一部分,下面列出一些模式部分的正则表达式字符含义:A-Z, 0-9, a-z构成模式部分的字符和数字。-指定范围。例如:a-z指从a到z之间的所有字符。转义元字符。用来覆盖字符在此表达式中定义的特殊意义,只取字符的本身。表示一个字符集合。匹配括号内的任意字符。如果第一个字符是那么它表示否定模式。例如: abC匹配a, b,和C的任何一个。表示否定。*匹配0个或者多个上述模式。+ 匹配1个或者多个上述模式。?匹配0个或1个上述模式。$作为模式的最后一个字符时匹配一行的结尾。 表示一个模式可能出现的次数。 例如: A1,3表示A可能出现1次或3次。a-z5表示长度为5的,由a-z组成的字符。此外,还可以表示预定义的变量。.匹配任意字符,除了n。( )将一系列常规表达式分组。如:Letter(Letter|Digit)*|表达式间的逻辑或。一些符号字符的字面含义。元字符具有。如:*相当于*。/向前匹配。如果在匹配的模式中的/后跟有后续表达式,只匹配模版中/前面的部分。如:模式为ABC/D输入ABCD,时ABC会匹配ABC/D,而D会匹配相应的模式。输入ABCE的话,ABCE就不会去匹配ABC/D。B.规则部分的优先级规则部分具有优先级的概念,先举个简单的例子:%#include stdio.h%n;Aprintf(ONEn);AAprintf(TWOn);AAAAprintf(THREEn);%此时,如果输入内容:rootlocalhost liweitest# cat file1.txtAAAAAAArootlocalhost liweitest# ./parser file1.txtTHREETWOONELex分析词法时,是逐个字符进行读取,自上而下进行规则匹配的,读取到第一个A字符时,遍历后发现三个规则皆匹配成功,Lex会继续分析下去,读至第五个字符时,发现AAAA只有一个规则可用,即按行为进行处理,以此类推。可见Lex会选择最长的字符匹配规则。如果将规则AAAAprintf(THREEn);改为AAAAAprintf(THREEn);./parser file1.txt输出结果为:THREETWO再来一个特殊的例子:%titleshowtitle();a-zA-Za-zA-Z0-9*printf(Var: %sn,yytext);%并输入title,Lex解析完后发现,仍然存在两个规则,这时Lex只会选择第一个规则,下面的则被忽略的。这里就体现了Lex的顺序优先级。把这个例子稍微改一下:%a-zA-Za-zA-Z0-9*printf(Var: %sn,yytext);titleshowtitle();%Lex编译时会提示:warning, rule cannot be matched.这时处理title字符时,匹配到第一个规则后,第二个规则就无效了。再把刚才第一个例子修改下,加深下印象!%#include stdio.h%n;Aprintf(ONEn);AAprintf(TWOn);AAAAprintf(THREEn);AAAAprintf(Cannot be executed!);./parser file1.txt显示效果是一样的,最后一项规则肯定是会忽略掉的。C.规则部分的使用变量且看下面示例:%#include stdio.hint linenum;%int0-9+float0-9*.0-9+%intprintf(Int: %sn,yytext);floatprintf(Float: %sn,yytext);.printf(Unknown : %cn,yytext0);%在%和%之间,加入了一些类似变量的东西,注意是没有;的,这表示int,float分别代指特定的含义,在两个%之间,可以通过intfloat进行直接引用,简化模式定义。(3)用户子程序部分最后一个%后面的内容是用户子程序部分,可以包含用C语言编写的子程序,而这些子程序可以用在前面的动作中,这样就可以达到简化编程的目的。这里需要注意的是,当编译时不带-ll选项时,是必须加入main函数和yywrap(yywrap将下后面说明)。如:.%showtitle()printf(- Lex Example -n);int main()linenum=0;yylex(); /*进行Lex分析*/printf(nLine Count: %dn,linenum);return 0;int yywrap()return 1;3.Lex(Lexical Analyzar)一些的内部变量和函数内部预定义变量:yytextchar *当前匹配的字符串yylengint当前匹配的字符串长度yyinFILE *lex当前的解析文件,默认为标准输出yyoutFILE *lex解析后的输出文件,默认为标准输入yylineno int当前的行数信息内部预定义宏:ECHO#define ECHO fwrite(yytext, yyleng, 1, yyout)也是未匹配字符的默认动作内部预定义的函数:int yylex(void)调用Lex进行词法分析int yywrap(void)在文件(或输入)的末尾调用。如果函数的返回值是1,就停止解析。 因此它可以用来解析多个文件。代码可以写在第三段,这样可以解析多个文件。 方法是使用yyin文件指针指向不同的文件,直到所有的文件都被解析。最后,yywrap()可以返回1来表示解析的结束。lex和flex都是解析Lex文件的工具,用法相近,flex意为fast lexical analyzer generator。可以看成lex的升级版本。相关更多内容就需要参考flex的man手册。4.关于Lex的一些综述Lex其实就是词法分析器,通过配置文件*.l,依据正则表达式逐字符去顺序解析文件,并动态更新内存的数据解析状态。Lex善长于模式匹配。四、实验内容1、进入ubuntu的终端,查看系统中有没有安装flex,若没有则安装。2、有下面是简单C语言的
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 备选公益岗位发言稿
- 学生开学典礼发言稿
- 时间的脚印微课课件
- 时间序列课件王燕
- 金蝶销售流程培训
- 2025版大型企业总部办公室设备搬迁与配置服务合同
- 2025版跨境电商玩具出口合同文本
- 2025版电子商务平台用户体验优化托管服务合同
- 二零二五年度产品发布会速记工作及保密协议
- 二零二五年度商业综合体电梯购置、安装及运营合同
- 2025年合肥东新融媒科技有限公司招聘5人笔试参考题库附带答案详解析集合
- 记账实操-节能环保企业的全盘账务处理实例
- 绿化庭院合同协议书
- 超高层建筑机电安装施工技术控制要点
- 卵巢癌类器官规范化建立及临床转化初步应用专家共识(2025年版)解读
- 解剖学基础课程全册教案
- 2024年煤矿重大事故隐患判定标准解读与查找方法培训课件
- 优化企业集团关联交易对账管理的研究与探讨措施实践应用探讨
- 秋季驾驶员安全培训
- 西安市城中村改造管理办法
- Unit8 Our Blue Planet 大单元整体教学设计 -2024-2025学年仁爱科普版英语七年级下册
评论
0/150
提交评论