版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
2026年数据库系统期末试题及参考答案一、单项选择题(每题2分,共30分)1.2026年主流云原生分布式数据库普遍采用存算分离架构,其核心优势是()A.存储节点算力可独立扩缩容B.计算节点无状态可实现秒级弹性C.可完全消除跨节点数据一致性开销D.能够大幅降低存储介质采购成本参考答案:B2.下列近似最近邻搜索算法中,2024年后逐步替代HNSW成为向量数据库工业界主流的是()A.IVF-PQB.FAISS-IVFC.DiskANND.SIFT参考答案:C3.下列关于PostgreSQL17(2024年发布稳定版,2026年成为主流关系型数据库版本)可重复读隔离级别的描述,正确的是()A.已经完全解决了幻读问题B.底层基于多版本并发控制(MVCC)实现C.允许读取其他事务未提交的更新数据D.并发性能比串行化隔离级别更低参考答案:B4.下列不属于湖仓一体架构核心能力的是()A.支持ACID事务保证数据一致性B.采用存算紧耦合架构提升查询性能C.提供全局统一的元数据管理能力D.原生支持半结构化、非结构化数据存储参考答案:B5.下列关于自适应机器学习索引的描述,错误的是()A.可根据查询负载动态调整索引结构B.可完全替代传统B+树索引在所有场景的应用C.可减少DBA人工索引运维的时间成本D.可针对冷热数据自动切换索引存储介质参考答案:B6.下列关于EPaxos协议相比原生Raft协议的核心优化点,正确的是()A.减少了Leader节点的算力开销B.允许非Leader节点直接提交日志C.可降低跨可用区部署时的事务提交延迟D.完全不需要共识节点即可保证数据一致性参考答案:C7.下列关于密态数据库的描述,正确的是()A.仅支持数据静态加密,不支持查询过程中的密态计算B.同态加密技术可实现密文状态下的等值查询、范围查询操作C.密态数据库的查询性能比明文数据库高30%以上D.不需要密钥管理体系即可完成密文数据的访问控制参考答案:B8.AI驱动的数据库查询优化器相比传统基于代价的优化器(CBO),核心优势不包括()A.可基于历史查询负载预测最优执行计划B.可减少复杂多表关联查询的优化时间开销C.可完全消除执行计划选错的概率D.可适配动态变化的硬件资源环境调整执行计划参考答案:C9.下列不属于时序数据库典型优化策略的是()A.按时间分片存储数据B.支持高吞吐批量写入C.实现冷热数据分层存储D.默认支持行级锁的频繁更新操作参考答案:D10.二阶段提交协议(2PC)的核心缺陷是()A.不会出现事务阻塞问题B.协调者单点故障会导致整个事务长时间阻塞C.不需要所有参与者反馈即可完成事务提交D.事务提交成功率比一阶段提交更低参考答案:B11.下列关于数据仓库星型模型的描述,正确的是()A.维度表存在多层级关联,冗余度比雪花模型更低B.查询时需要关联的表更少,查询性能更高C.适合数据一致性要求极高的OLTP场景D.比雪花模型占用的存储空间更小参考答案:B12.下列属于NewSQL数据库核心特性的是()A.完全放弃ACID事务支持换取高并发能力B.仅支持键值型数据模型C.同时具备NoSQL的高扩展能力和传统关系型数据库的ACID支持D.不支持标准SQL语法参考答案:C13.在向量数据库的近似最近邻查询中,下列操作会同时提升召回率和查询延迟的是()A.减小检索的候选集大小B.开启向量量化压缩C.增加检索的候选集大小D.关闭磁盘预读机制参考答案:C14.下列关于数据库持续数据保护(CDP)技术的描述,错误的是()A.可恢复到任意时间点的数据状态B.比传统增量备份的恢复时间更长C.不需要全量备份即可完成数据恢复D.可捕捉每一次数据修改操作并记录日志参考答案:C15.2026年主流的数据库自治服务(DAS)不具备以下哪个能力()A.自动发现慢查询并给出优化建议B.自动完成故障自愈C.自动调整数据库内核源码适配业务场景D.自动弹性扩缩容计算存储资源参考答案:C二、填空题(每题2分,共20分)1.2026年主流分布式数据库广泛采用的多版本并发控制技术中,用于标记事务版本的全局唯一标识通常被称为____。参考答案:事务ID(TXID)2.湖仓一体架构中,用于实现数据版本管理、支持时间旅行查询的三大主流开源表格式是____、DeltaLake、Hudi。参考答案:ApacheIceberg3.向量数据库中,将高维向量压缩为低维编码以减少存储和检索开销的核心技术被称为____。参考答案:向量量化4.分布式一致性协议Raft中,负责日志同步和事务提交的核心节点角色是____。参考答案:Leader节点5.数据库中用于记录所有数据修改操作、支撑崩溃恢复和主从同步的日志文件的通用缩写是____。参考答案:WAL(预写日志)6.数据仓库领域用于衡量多维分析性能的最常用基准测试标准是____基准。参考答案:TPC-H7.密态数据库中,支持任意类型运算的同态加密类型被称为____同态加密。参考答案:全8.2026年工业界为解决大模型RAG场景下的向量检索和结构化查询融合需求,推出的同时支持结构化、半结构化、非结构化、向量数据存储查询的数据库被称为____数据库。参考答案:多模融合9.分布式数据库中,将大表按照某个字段拆分存储到不同节点的水平拆分策略通常被称为____。参考答案:分片(Sharding/分库分表)10.数据库查询优化器中,基于规则的优化器的通用缩写是____。参考答案:RBO三、判断题(每题1分,共10分)1.云原生数据库的存算分离架构中,存储节点和计算节点必须采用同构的硬件配置。()参考答案:×2.向量数据库的精确最近邻搜索比近似最近邻搜索的召回率更高,查询速度更快。()参考答案:×3.PostgreSQL17的可重复读隔离级别已经完全解决了幻读问题。()参考答案:×4.湖仓一体架构可以同时支持OLTP类的事务性操作和OLAP类的分析查询操作。()参考答案:√5.三副本Raft共识协议只要有2个节点存活即可保证数据不丢失和服务可用。()参考答案:√6.密态数据库的同态加密操作不需要密钥即可完成。()参考答案:×7.AI驱动的查询优化器可以完全替代DBA进行所有SQL优化工作。()参考答案:×8.时序数据库适合存储工业传感器的时间序列数据,不适合存储电商的订单交易数据。()参考答案:√9.数据仓库的星型模型相比雪花模型,数据冗余度更高,但查询性能更好。()参考答案:√10.分布式数据库的分布式事务性能随着节点数量的增加而线性提升。()参考答案:×四、简答题(每题10分,共40分)1.请简述2026年主流分布式数据库采用的存算分离架构相比传统存算耦合架构的核心优势,以及其适用的典型业务场景。参考答案:核心优势共4点,每点2分:(1)弹性扩缩容效率大幅提升:计算节点为无状态设计,可根据业务峰值(如电商大促、年终报表查询)在秒级完成扩容缩容,不需要迁移底层数据,资源利用率相比存算耦合架构提升60%以上。(2)整体拥有成本(TCO)优化:存储和计算资源可独立选型,冷数据可存储到低成本的对象存储,热数据存放在高性能SSD,计算资源按需分配,相比存算耦合架构TCO降低40%左右。(3)多工作负载隔离:不同的业务负载(如OLTP交易、OLAP分析、向量检索)可以运行在独立的计算节点池,互不干扰,避免慢查询影响核心交易业务的稳定性。(4)容灾能力增强:存储层多副本跨区域部署,计算层不需要持久化存储数据,区域故障时可快速在备用区域拉起计算节点,恢复时间目标(RTO)可降低到分钟级。适用典型场景共2分,答出2个即可得满分:流量波动大的互联网业务、海量数据融合分析的企业数据中台、跨区域部署的全球化业务、大模型RAG业务场景。2.请简述向量数据库中HNSW和DiskANN两种近似最近邻搜索算法的核心区别,以及DiskANN在2026年成为工业界主流的核心原因。参考答案:核心区别共6分,每点2分:(1)存储介质适配差异:HNSW是内存优先的算法,所有向量索引都存储在内存中,当向量规模超过内存容量时会触发swap,性能大幅下降;DiskANN是适配持久性内存(PMEM)和SSD的混合存储算法,热索引存在内存/PMEM,冷索引存在SSD,支持10倍于内存容量的向量规模,性能下降幅度不超过20%。(2)索引构建效率差异:HNSW的索引构建时间随向量规模增长呈指数级上升,1亿条768维向量的构建时间超过24小时;DiskANN采用分层构建策略,1亿条同维度向量的构建时间仅需3小时左右,同时支持增量构建,新增向量可秒级写入。(3)高维场景适配差异:HNSW在高维向量(超过1024维)场景下召回率下降明显,当维度达到4096维时,90%召回率对应的延迟是768维的3倍;DiskANN针对高维向量做了量化优化,4096维向量的检索性能仅比768维低30%左右,召回率稳定保持在95%以上。DiskANN成为主流的原因共4分,每点1分:适配大模型RAG场景的超大规模高维向量检索需求、存储成本相比全内存的HNSW降低70%以上、和云原生存算分离架构天然契合、2025年后主流向量数据库都完成了DiskANN的生态适配。3.请简述二阶段提交协议(2PC)的工作流程,以及2026年主流分布式数据库对2PC协议的优化点。参考答案:工作流程共4分:第一阶段(准备阶段):协调者向所有参与者发送事务准备请求,询问是否可以提交事务,参与者执行事务操作但不提交,记录WAL日志,向协调者返回同意或者拒绝的响应。第二阶段(提交/回滚阶段):如果协调者收到所有参与者的同意响应,就向所有参与者发送提交请求,参与者提交事务并释放资源,返回提交成功响应;如果有任意参与者返回拒绝,或者协调者等待超时,就向所有参与者发送回滚请求,参与者回滚事务并释放资源,返回回滚成功响应。优化点共6分,答出3点即可得满分:(1)只读事务优化:对于只读事务,不需要执行第二阶段的提交操作,协调者收到所有参与者的只读响应后直接返回事务成功,减少1次RPC交互,延迟降低30%左右。(2)协调者高可用优化:原生2PC的协调者是单点,故障后会导致事务阻塞,主流数据库采用Raft共识集群部署协调者,协调者故障后秒级选主切换,不会出现事务长时间阻塞的问题。(3)异步提交优化:对于一致性要求不高的场景,允许协调者收到大多数参与者的同意响应后就提前返回成功,剩余的提交操作异步执行,提交延迟降低50%以上。(4)跨区域部署优化:跨可用区部署时,协调者优先将日志同步到就近的参与者节点,再异步同步到远端节点,跨区域提交延迟降低40%左右。(5)冲突预判优化:基于AI模型预判事务冲突概率,对于冲突概率低的事务,提前执行提交操作,减少锁等待时间,并发吞吐量提升20%以上。4.请简述湖仓一体架构相比传统数据湖和数据仓库的核心优势,以及2026年主流湖仓架构的核心技术栈。参考答案:核心优势共5分,答出4点即可得满分:(1)解决数据孤岛问题:统一存储结构化、半结构化、非结构化、向量数据,不需要在数据湖和数据仓库之间做ETL数据同步,数据延迟从小时级降低到秒级。(2)成本优势:采用存算分离架构,冷数据存储到低成本对象存储,相比传统数仓TCO降低50%以上。(3)多工作负载支持:同时支持OLTP事务操作、OLAP分析查询、向量检索、机器学习训练等多种负载,不需要多个系统来回切换。(4)数据一致性强:支持ACID事务、数据版本管理、时间旅行查询,可回滚到任意时间点的数据状态,解决了传统数据湖数据不一致的问题。(5)Schema演化支持:支持灵活的Schema修改,不需要重写全表数据,适配快速变化的业务需求。核心技术栈共5分,每点1分:(1)存储层:采用对象存储(如S3、OSS、MinIO)作为统一存储底座,支持EB级数据存储。(2)表格式层:采用Iceberg、DeltaLake3.0、Hudi2.0作为开源表格式,支持ACID事务、版本管理、Schema演化。(3)计算引擎层:采用Spark4.0、Flink2.0、Presto0.300作为计算引擎,支持批流一体处理、交互式查询、机器学习训练。(4)元数据层:采用统一的元数据管理平台(如Atlas、Amundsen),支持全局数据目录、数据血缘追踪、权限管理。(5)访问层:支持标准SQL、PythonSDK、向量查询接口,兼容各种BI工具、大模型RAG框架。五、实操题(共15分)给定电商业务的三张业务表:订单表:`order`(order_idbigint主键,user_idbigint,shop_idbigint,order_amountdecimal(10,2),create_timetimestamp,statustinyint),其中status=1代表已支付的有效订单用户表:`user`(user_idbigint主键,user_namevarchar(64),phonevarchar(11),register_timetimestamp)店铺表:`shop`(shop_idbigint主键,shop_namevarchar(128),owner_idbigint,create_timetimestamp)要求1:写出SQL查询2025年全年每个店铺的成交总金额、成交订单数、成交用户数,结果按照成交总金额倒序排序,只返回Top10的店铺。(7分)要求2:该查询在生产环境中执行耗时超过10秒,请给出至少3种优化方案,说明优化原理。(8分)参考答案:要求1的SQL语句(7分,核心逻辑正确即可得分):SELECTs.shop_id,s.shop_name,SUM(o.order_amount)AStotal_amount,COUNT(o.order_id)ASorder_count,COUNT(DISTINCTo.user_id)ASuser_countFROM`order`oJOINshopsONo.shop_id=s.shop_idWHEREo.create_timeBETWEEN'2025-01-0100:00:00'AND'2025-12-3123:59:59'ANDo.status=1GROUPBYs.shop_id,s.shop_nameORDERBYtotal_amountDESCLIMIT10;要求2的优化方案(8分,答出3种即可得满分,每种方案2分,原理1分):(1)索引优化:给order表建立(status,create_time,shop_id,user_id,order_amount)的联合覆盖索引。原理:该索引是覆盖索引,查询时不需要回表读取order表的全量数据,直接从索引中就能获取所有需要的字段,同时status和create_time作为前置字段可以快速过滤出2025年的有效订单,减少扫描的数据量,查询性能可提升5-10倍。(2)分区分表优化:将order表按照create_time按月份进行水平分区。原理:查询时只需要扫描2025年12个分区的数据,不需要扫描历史其他年份的分区,扫描的数据量减少70%以上,性能提升3倍以上。(3)预聚合优化:提前通过Flink流计算或者Spark批处理每天统计每个店铺的成交金额、订单数、用户数,存入中间汇总表shop_daily_stat(shop_idbigint,stat_datedate,total_amountdecimal(10,2),order_countint,user_countint),查询时直接从汇总表中聚合2025年的全年数据。原理:汇总表的数据量比原始订单表小两个数量级,聚合计算的开销大幅降低,查询耗时可降低到1秒以内。(4)执行计划优化:如果是分布式数据库,开启JoinBroadcast优化,将小表shop表广播到所有计算节点。原理:shop表的数据量通常远小于order表,广播后不需要在节点之间传输order表的大量数据,Join性能提升2倍以上。六、综合设计题(共15分)某企业2026年要搭建一套支撑大模型RAG场景的知识库系统,需要存储10亿条768维的文本向量、100TB的结构化元数据(文档ID、标题、分类、标签、上传时间、作者)、5PB的非结构化文档数据(PDF、Word、图片),要求支持每秒1万次的向量+结构化条件混合查询(比如“分类为‘技术文档’且上传时间在2025年之后的文档中,和查询向量最相似的Top10文档”),查询延迟不超过200ms,数据可靠性达到99.9999%,全年downtime不超过5分钟。请设计该系统的数据库架构,说明每个组件的选型、核心作用、关键配置参数。参考答案:架构设计采用存算分离的多模融合数据库架构,分为存储层、索引引擎层、计算层、访问层四个层级,整体跨3个可用区部署,满足容灾要求:1.存储层(3分):选型采用兼容S3协议的对象存储集群+高性能持久化内存(PMEM)存储池。核心作用:对象存储存储全量的非结构化文档数据、冷向量数据、冷结构化元数据;PMEM存储池存储热向量索引、热结构化数据、WAL日志。关键配置:对象存储采用EC4+2纠删码策略,跨3个可用区部署,数据可靠性达到99.999999%;PMEM存储池配置3副本,跨3个可用区放置,单副本容量10TB,总容量30TB,可容纳所有热索引数据。2.索引引擎层(4分):选型采用Milvus2.5作为向量检索引擎,PostgreSQL17作为结构化查询引擎,两者共享统一的Raft三副本元数据层。核心作用:Milvus负责向量的近似最近邻检
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 广电集团招聘笔试题库
- 事业单位湖北社会保障服务中心笔试专项刷题题库含答案
- 精神病学中级(基础知识)模拟试卷18(题后含答案及解析)
- 高中地理教资面试地图重难点题库及答案
- 趣味古诗创意试题及答案
- 关于全球疫情的试题与答案
- 考研物化试题及答案呈现
- 贵阳公安招聘考试题目与答案解析
- 五年级升学准备:给家长的6条建议
- 2027届辽宁省抚顺市抚顺县数学七上期末联考模拟试题含解析
- 湖南省长沙市长郡集团初中校2025-2026学年七年级上学期11月期中联考语文(含答案)
- 活动礼品提供协议合同
- 工厂部门职责分工及岗位说明
- Unit 2 Helping at home 大单元教学任务单-2025外研版(三起)四年级英语上册
- 2025年中专无人机专业试题及答案
- 隐睾病人的护理
- 物流系统仿真flexsim仿真实验手册
- T-EBA 43007-2024 电子器件微小漏率检测方法
- 小学生芯片课件
- 《滚珠丝杠螺母副》课件
- 初中英语阅读理解强化100篇(含答案)
评论
0/150
提交评论