中国餐饮经营Agent能力白皮书2026_第1页
中国餐饮经营Agent能力白皮书2026_第2页
中国餐饮经营Agent能力白皮书2026_第3页
中国餐饮经营Agent能力白皮书2026_第4页
中国餐饮经营Agent能力白皮书2026_第5页
已阅读5页,还剩62页未读 继续免费阅读

下载本文档

版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领

文档简介

CHINARESTAURANTOPERATINGAGENT·WHITEPAPER从“会回答”到“经营判断辅助”,再到“能持续参与经营”发布机构北京餐鸟科技有限公司研究与测评餐饮AI经营能力测评项目组研究发起祁忠(面总老祁)版本日期2026年8月27日正式发布版|出版设计规范V1.0发布说明中国餐饮经营Agent能力白皮书V0.2研究前言发布说明AI正在进入餐饮经营。越来越多产品开始以“AI助手”“老板助手”“经营助手”“智能体”“Agent”等不同名称进入餐饮行业。一个产品使用了“Agent”这个名称,并不能证明它已经具备真实经营能力;一个产品没有使用“Agent”这个名称,也不意味着它没有向餐饮经营Agent发展的可能。当AI开始进入餐饮经营以后,我们应该用什么方法判断它到底会不会经营、能不能用于真实经营,以及哪些事情还不能直接交给AI?本白皮书研究“餐饮经营Agent及具有餐饮经营Agent发展方向的AI/经营助手”,重点关注已经进入真实餐饮经营判断链,或正在向这一方向发展的产品。判断一个产品是否进入研究范围,不以名称为依据,而看它是否实际触及C1|经营测量|账算得明白、C2|经营分析|关系看得懂、C3|异常发现|问题找得到、C4|经营诊断|原因判得准、C5|预测模拟|未来算得出、C6|决策优化|动作定得好中的一项或多项。截至2026年8月27日,本项目已完成餐剑、窄门餐谋、红餐AI、奥琦玮老板助手、袋鼠参谋、食悟AI六个产品的V0.1.1统一标准化直接测评。本轮采用统一冻结的题目、数据、顺序和评分规则;产品原始回答先封存、后审计;产品自我声明不直接作为能力得分;没有取得充分真实运行证据的能力标记为“待验证”。·本研究不是国家标准、官方行业标准、产品认证规则或产品排行榜。·六个样本不是对中国餐饮AI市场的随机代表性抽样,而是按研究目的筛选形成的目的性测试样本。·本轮结论只对应测试当时的时间、版本、入口、账号权限与测试环境。·本轮主要直接验证在规定数据、口径和任务条件下的C1-C6六项条件性经营判断能力;A1-A4四项Agent运行能力仍需进入真实系统与跨周期运行环境验证。·“待验证”表示证据尚未形成,不等于0分,也不等于产品没有这项能力。V0.2的目标不是宣布一套最终标准,V0.2的目标不是宣布一套最终标准,而是提出一套可以讨论、测试、复查、接受反例检验并持续修订的餐饮经营Agent能力框架。版本说明:本版为V0.2正式发布版,已基于两轮外部红队审计完成修订;第二轮聚焦复核同时完成“研究背景与外部参照”及参考资料[1]—[12]的原始来源核验。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组02摘要中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组03研究前言摘要“会回答餐饮问题”和“能够持续参与一家餐厅的真实经营”不是同一件事。本白皮书尝试回答三个问题:在规定数据和任务条件下,什么样的经营判断能力已经达到可用线?这些能力距离真实门店环境还有多远?距离真正能够持续参与经营的Agent,还有多远?本研究把餐饮经营Agent拆成五个层面:G|经营目标与约束回答“为什么干、什么不能碰”;D|四项运行底座条件回答“有没有条件干”;C|六项经营能力回答“会不会经营”;A|四项Agent运行能力回答“能不能持续参与经营”;T|可信约束回答“什么时候必须停、问人、降级或把决定交还给人”。本研究采用0—5级有序能力等级,3级定义为“真实经营辅助可用线”。3级并不意味着AI可以独立经营,而是指:在限定任务和明确输入边界内,该项能力的核心结果已经可以进入真实经营辅助,且未出现足以使核心结论失去使用价值的严重错误;重要经营判断仍由人最终复核。616.7%统一标准化直接测评产品样本C1|经营测量达到3级可用线C4|经营诊断达到3级可用线经营能力样本均值达到3级可用线C1|经营测量|账算得明白3.336/6|100%C2|经营分析|关系看得懂2.833/6|50%C3|异常发现|问题找得到3.20*5/5|100%*C4|经营诊断|原因判得准2.331/6|16.7%C5|预测模拟|未来算得出2.333/6|50%C6|决策优化|动作定得好2.172/6|33.3%*C3有1个样本因测试入口无法完整承载冻结数据,正式状态为“待验证”,不记0分;均值和通过率按5个有效样本计算。0—5级属于有序能力等级,样本均值只用于描述本组六样本在某项能力上的阶段性位置,不作为精确等距量表,也不用于单个产品总分排名。核心局限性:本轮C1-C6验证的是“条件性经营判断能力”核心局限性:本轮C1-C6验证的是“条件性经营判断能力”——即测试者已经按冻结协议提供规定经营数据、口径和任务条件后,产品能否正确完成相应经营判断。它不同时证明产品能够自动取得、清洗、融合并持续维护这些数据,也不等同于完整的端到端餐饮经营Agent能力。阅读指南中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组04基于截至2026年8月27日的六样本标准化直接测试,本轮样本中已经出现从信息回答向结构化经营判断辅助延伸的明确迹象。最先表现出较稳定测试结果的是经营测量、经营分析和异常发现;更困难的下一步,是原因诊断、动态预测、持续决策,以及真实的数据获取—主动发现—系统执行—结果闭环。研究前言阅读指南读者建议重点餐饮老板/经营者定义与边界→六项经营能力→3级可用线→六样本发现→经营者“五验”产品经理/技术团队总体模型→D/C/A/T→严重错误与可信传导→测试方法→“下一步应该补什么”行业研究者建议阅读全文,并重点看方法、样本边界、匿名规则、R0—R4真实性层级与附录媒体/投资机构/行业组织摘要→五个阶段性发现→“我们明确不做哪些判断”→下一阶段验证研究前言研究背景与外部参照 本白皮书不是在通用Agent标准之外重新发明一套技术标准,而是聚焦“餐饮经营业务能力”这一中间层。外部政策、标准和行业研究用于帮助理解Agent定义、可信治理、通用评测、餐饮数字化底座与AI应用场景;它们不是对本白皮书C1—C6六项经营能力框架的官方背书,也不能替代本项目自己的直接测试证据。截至本版冻结日期,已经可以确认几条重要外部背景:三部门《智能体规范应用与创新发展实施意见》将智能体界定为具备自主感知、记忆、决策、交互与执行能力的智能系统,并强调安全、可靠、可信贯穿研发与应用全过程[1];全国标准信息公共服务平台显示《人工智能智能体评测指标与方法》项目登记号20262604-Z-469仍处于起草阶段,不能表述为已经发布的国家标准[2];上海市人工智能行业协会发布的T/SAIAS059—2026已经形成通用数字智能体评测框架[3]。餐饮侧的外部研究则提供了另一层背景:国家信息中心《中国餐饮业数字化发展报告(2024)》从线上化、平台化、智能化三个内核及供应、加工、管理、销售全链条构建餐饮数字化指标体系[6];中国烹饪协会2026年发布的AI餐饮调研基于2446份有效问卷,并提出推动工具从“应答”走向“分析”[7];红餐产业研究院与红餐成长社发布《中国餐饮AI应用研究报告2026》,持续讨论餐饮AI的感知、决策、交互和执行场景[8]。目录北京餐鸟科技有限公司|餐饮AI经营能力测评项目组05通用Agent评测工程方面,美团技术团队公开提出Agent评测不能只停留在一次Demo或离线打榜,而要观察复杂系统在真实业务流程中的稳定交付,并强调结果、过程和业务场景的结合[11]。这些外部研究帮助我们确定“Agent不能只看一次回答”的研究方向,但本白皮书对餐饮经营能力的具体定义、评分和六样本结论,仍以本项目冻结协议和直接测试证据为主。目录发布说明2阅读指南4研究背景与外部参照4第一部分|我们到底研究什么7第1章|为什么要重新定义“餐饮经营AI”8第2章|本白皮书研究什么、不研究什么9第3章|什么是餐饮经营Agent10第二部分|一个餐饮经营Agent应该具备什么11第5章|D1-D4:四项运行底座条件13第6章|C1-C6:六项经营能力14第8章|T1-T8:可信约束16第三部分|我们怎样判断“能不能用”17第9章|一个错误为什么会一路传下去18第10章|0—5级与3级真实经营辅助可用线19第11章|严重错误、综合定级、置信度与待验证20第四部分|我们是怎么测的21第12章|统一标准化直接测评22第13章|Q0不评分与Q1-Q8测试任务设计23第14章|R0-R4:测试真实性层级24目录北京餐鸟科技有限公司|餐饮AI经营能力测评项目组06第五部分|我们在市场上寻找什么产品25第15章|市场扫描与样本选择原则26第16章|本轮6个点名样本:价值与下一步最值得增强27第17章|从点名测试到分项统计29第六部分|六个统一样本告诉了我们什么30第18章|能力分布与统计边界31第19章|五个阶段性发现32第20章|基于当前证据,我们明确不做哪些判断33第七部分|这意味着什么34第21章|餐饮老板判断一个AI,先做“五验”35第22章|如果想从AI助手继续走向餐饮经营Agent,我们建议下一步应该补什么36第23章|餐饮经营Agent可能怎样一步步成熟37第24章|下一阶段还需要验证什么38第25章|结语:我们希望推动的不是一张排行榜39附录40附录A|六项经营能力0—5级行为评分尺41附录B|四项Agent运行能力0—5级行为评分尺44附录C|统一标准化直接测试任务模板46附录D|六样本证据、匿名规则与方法边界47附录E|餐饮经营者“五验”快速检查卡48附录F|术语表49附录G|V0.1.1统一测评协议与版本控制说明50参考资料|主要公开研究与标准51内部证据来源52V0.2版本说明53我们到底研究什么从经营者每天面对的判断链出发,界定研究对象与边界。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组08第1章|为什么要重新定义“餐饮经营AI”中国餐饮经营Agent能力白皮书V0.2第一部分|我们到底研究什么第1章|为什么要重新定义“餐饮经营AI” 餐饮行业并不缺少AI。写营销文案、生成菜单图片、智能客服、员工培训、巡店、点餐、会员营销、经营报表分析,都可以使用AI。问题是:当越来越多产品开始叫“AI店长”“老板助手”“经营智能体”“Agent”以后,我们到底应该用什么标准判断它是否真正进入了经营?店现在到底怎么样?发生了什么变化?哪里有问题?为什么发生?未来可能怎样?现在应该怎么办?本白皮书不从产品名称或技术术语出发,而从这条餐饮经营者每天都要面对的判断链出发。只要AI已经实际开始承担其中一项或多项任务,就进入我们的核心观察范围。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组09第2章|本白皮书研究什么、不研究什么中国餐饮经营Agent能力白皮书V0.2第一部分|我们到底研究什么第2章|本白皮书研究什么、不研究什么本研究聚焦“经营判断型/经营决策型AI与Agent”,即围绕真实经营结果帮助经营者判断店怎么样、问题在哪里、为什么、未来会怎样、现在应该怎么办。类型主要回答的问题本版处理经营判断型/经营决策型Agent店怎么样?哪里有问题?为什么?未来怎样?现在怎么办?核心研究对象运营执行型/店长Agent决定以后怎么巡店、执行SOP、安排任务、培训、提醒和落实动作?原则上不作为本轮核心测评对象;若实际进入经营判断链,可进入候选池餐饮相关AI文案、图片、点餐、客服、识别、培训等观察,但不自动进入经营Agent测评一个叫“老板助手”的产品,只要真正进入经营判断链,也可能成为餐饮经营Agent候选;一个叫“Agent”的产品,如果主要做SOP执行和任务提醒,也不会因为名称自动进入本轮核心测评。第3章|什么是餐饮经营Agent中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组10第一部分|我们到底研究什么 理想形态下,本白皮书所称“餐饮经营Agent”,是以餐饮经营目标和约束为导向,在可信数据和经营语义基础上,具备经营测量、经营分析、异常发现、经营诊断、预测模拟和决策优化等能力,并能够逐步通过持续数据获取、主动发现、系统执行和结果跟踪参与真实经营,同时在证据、权限和风险边界内保持人类最终控制的AI系统。本定义描述的是餐饮经营Agent的完整目标形态,不代表本轮六个测试样本已经具备上述全部能力;尤其A1-A4四项Agent运行能力仍需R3/R4层证据继续验证。这个定义包含三层:第一,它必须会经营;第二,它最终要能够持续参与经营;第三,它必须可信、可控。成熟Agent不是“自动做得越多越好”,而是知道什么可以自己做、什么需要先试、什么必须问人、什么证据不足时应该停止。把“会不会经营”和“能不能持续参与经营”拆成可讨论、可验证的能力层。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组12第二部分|一个餐饮经营Agent应该具备什么DD四项运行底座条件有没有条件干数据、语义、状态、工具与权限A能不能持续干持续取数、主动发现、系统执行、结果闭环G经营目标与约束为什么干、什么不能碰利润、现金、营业额、服务、复购等目标和红线T可信约束什么时候必须停证据、不确定性、因果、权限、风险、追溯、人类控制、澄清C六项经营能力会不会经营测量、分析、发现、诊断、预测、决策需要特别说明:G-D-C-A-T首先是架构依赖关系,不等于产品研发资源必须机械按这个顺序投入。当前很多产品的自动化能力已经发展很快,但如果C1-C6经营判断还不稳定,就不应急于把更多高风险动作自动化。T|可信约束贯穿D、C、A全过程,而不是最后才加。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组13第5章|D1-D4:四项运行底座条件中国餐饮经营Agent能力白皮书V0.2第二部分|一个餐饮经营Agent应该具备什么D1|数据连接与质量不能只问“数据接进来了吗”,还要问是否完整、及时,有没有漏单、重复和明显异常,不同系统口径是否一致。垃圾数据进入以后,AI只会更快地产生错误经营判断。D2|经营数据语义同一个“营业额”“实收”“食材成本”“人工成本”,在不同门店和系统中可能有不同含义。Agent必须理解数字在这家店的真实经营口径,而不是只认字段名。D3|持续状态与记忆一个经营Agent不能每天重新认识这家店。它需要持续维护经营目标、基线、历史判断、已经采取的动作以及后续结果。聊天记忆不等于经营状态。D4|工具与权限能不能调价、改排班、发券、下采购单,不是Agent自己说了算。技术能力和经营权限必须分开设计,每次执行还应留下必要记录。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组14第6章|C1-C6:六项经营能力中国餐饮经营Agent能力白皮书V0.2第二部分|一个餐饮经营Agent应该具备什么C1|经营测量|账算得明白回答“这家店现在到底经营得怎么样”。利润、成本率、保本、边际贡献等必须口径正确、关键成本不漏、前后数字闭合。一次算对还不够,多轮和新证据回来以后仍要保持稳定。C2|经营分析|关系看得懂回答“经营结果为什么变成现在这样——先从结构上看,哪些因素分别贡献了多少”。它首先解决利润桥和结构贡献,不直接等于因果诊断。C3|异常发现|问题找得到回答“老板不告诉AI哪里有问题,它能不能从连续经营数据里找到值得先管的异常”。高质量异常发现还需要排序、归并和控制误报。C4|经营诊断|原因判得准回答“为什么发生”。必须区分事实、相关关系、候选原因和已验证原因。证据不足时停在“无法确认”,本身就是成熟能力的一部分。C5|预测模拟|未来算得出回答“如果什么都不变会怎样,以及如果价格、人员、促销、营业时间改变会怎样”。真实经营模拟要处理固定成本、变动成本、阶梯成本、阈值、产能和需求变化。C6|决策优化|动作定得好回答“现在到底怎么办”。不仅要给建议,还要在目标和硬约束下做选择,说明优先级、投入、周期、指标、停止条件和回滚机制。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组15第7章|A1-A4:四项Agent运行能力第二部分|一个餐饮经营Agent应该具备什么A1|持续数据获取|数据自己来不是成功读取一次报表,而是在授权范围内持续、稳定地取得经营数据。D1回答“有没有可用数据”,A1回答“能不能长期持续得到”。A2|主动发现与提醒|问题自己找C3是“给它数据以后能不能发现异常”,A2是“没人问的时候,它会不会自己启动、自己检查并把真正值得管的问题送出来”。固定日报并不足以证明高质量A2。A3|系统执行|动作能出去文字建议不等于执行。真正的A3是把经过授权的动作送入真实业务系统,并正确处理确认、权限、失败恢复、A4|结果跟踪与闭环|结果会回来做完以后还要回来。关键分界是:2级——人把结果告诉它,它会重新判断;3级——Agent自己记得回来取得结果并发起复盘。基于截至2026年8月27日的六样本标准化直接测试,本轮没有取得足够R3|真实经营系统环境和R4|真实动作基于截至2026年8月27日的六样本标准化直接测试,本轮没有取得足够R3|真实经营系统环境和R4|真实动作与结果证据,因此六个样本的A1-A4运行能力统一保持“待验证”。这不是低分结论,而是证据边界。第8章|T1-T8:可信约束中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组16第二部分|一个餐饮经营Agent应该具备什么可信约束核心要求T1|证据分级不同强度的经营结论,需要不同强度的证据。T2|不确定性不知道或证据不足时,应明确表达不确定,而不是补出一个确定答案。T3|因果边界同时发生、统计相关、候选原因和已验证原因必须区分。T4|权限控制Agent只能在经营者授权范围内执行动作。T5|风险降级高风险、低置信度或异常情况下,应降低自动化程度并转人工确认。T6|可追溯重要判断和动作应能追溯到数据、口径、依据和执行过程。T7|人类最终控制重大经营风险动作应保留经营者最终决定权。T8|澄清确认数据缺失、口径冲突或目标不清楚时,应先确认,而不是自行补全关键前提。不知道,就说不知道。证据不够,就停在假设。不知道,就说不知道。证据不够,就停在假设。高风险动作,把最终决定交给人。USABILITY&TRUST我们怎样判断“能不能用”用等级、严重错误与可信传导,回答一项能力什么时候才可以进入真实经营辅助。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组18第9章|一个错误为什么会一路传下去中国餐饮经营Agent能力白皮书V0.2第三部分|我们怎样判断“能不能用”第9章|一个错误为什么会一路传下去真实经营是一条连续判断链:先把账算清楚,再分析结构,再判断问题和原因,再预测未来,最后决定动作。因此,上游错误可能向下游传导。一个利润计算错误,可能进一步污染经营状态判断、原因诊断和最终行动。结果可信传导:错误只污染它实际影响的部分,但任何下游结论都必须回看上游事实、计算和判断是否可靠。字段状态含义结果可信传导可用上游关键数据和判断基本可靠,可在限定任务中用于经营辅助结果可信传导条件性可用存在尚未确认的关键前提或受上游问题影响,需要限定使用或人工复核结果可信传导不可信严重错误足以改变最终经营方向,不应直接进入行动证据状态已验证本轮形成了满足协议条件的直接证据证据状态待验证本轮没有形成足够合规证据;不是0分,也不是“没有能力”第10章|0—5级与3级真实经营辅助可用线中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组19第三部分|我们怎样判断“能不能用”第10章|0—5级与3级真实经营辅助可用线经营使用理解经营使用理解能力含义等级未表现出该项能力在已经具备测试条件的情况下,没有形成有效能力行为出现部分相关行为,但核心任务明显失败不能用于真实经营辅助已有能力雏形,但关键结果或边界仍不稳定可以参考,但不能作为主要经营依据3级达到真实经营辅助可用线在限定任务和输入边界内可进入真实经营辅助;重要判断仍需人复核4级较稳定、较完整在明确边界内可以较放心使用,并明显减少人工重算重做5级高稳定、高完整复杂、多变量、不完整信息下仍高度可靠,并知道何时停止、降级或转人3级不是“AI已经可以独立经营”,而是“这项能力已经可以进入真实经营辅助”。3级首先要求核心任务完成、关键数字和方向没有被严重错误翻转;允许存在局部问题,但这些问题必须可识别、可限制或可通过经营者复核控制。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组20第11章|严重错误、综合定级、置信度与待验证中国餐饮经营Agent能力白皮书V0.2第三部分|我们怎样判断“能不能用”第11章|严重错误、综合定级、置信度与待验证定义定义名称代码SE1方向性错误盈利/亏损、正向/负向、改善/恶化等核心经营方向发生反转SE2决策翻转错误错误足以改变做/不做、继续/停止、选A还是选B等最终经营动作SE3关键经营量严重失真利润、成本、现金、保本点、目标缺口等关键经营量发生实质失真,并污染后续判断SE4一般局部错误存在错误或越界,但没有直接翻转核心经营方向;影响稳定性和高等级判断红灯规则|严重错误如何约束下游能力规则处理红灯1|本题核心结论出现SE1|方向性错误、SE2|决策翻转错误或SE3|关键经营量严重失真时,该题核心结论不得标记为“可用”。红灯2|下游传导如果严重错误的输出被实际作为后续分析、预测或决策输入,且下游没有独立纠正,则所有依赖该错误输入的下游结论不得达到3级可用线。红灯3|独立纠正如果下游任务重新取得正确数据,或独立重算并明确纠正上游错误,不机械继承封顶;但必须记录此前严重错误,并下调稳定性或证据置信度判断。红灯4|重复严重错误同一项能力在多个独立核心任务中重复出现SE1-SE3时,该能力原则上不得评为3级及以上,除非存在更强、更新且能够证明问题已修复的直接复测证据。能力综合定级不是题目简单平均。需要看核心直接证据、是否出现SE1-SE3、错误是否污染核心任务、同类行为是否重复,以及不同场景下是否稳定。一个单轮Q7得到4级,不代表C6|决策优化|动作定得好综合能力就一定是4级;如果Q8在新证据回流后持续决策失败,综合能力必须反映这种不稳定。正式能力输出应同时记录“能力等级+证据置信度+使用边界”。等级回答“能力到了哪里”,置信度回答“我们有多确定”。如果某项能力只有一道有限覆盖的直接题,即使表现很好,也可能只能形成中等置信度。EVALUATIONMETHOD我们是怎么测的统一题目、数据、顺序与评分规则,让不同产品的直接输出能够被复查和比较。第12章|统一标准化直接测评中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组22第四部分|我们是怎么测的第12章|统一标准化直接测评本轮不是开放式体验评价,也不是根据宣传材料推断能力。V0.1.1统一标准化直接测评采用同题、同数据、同顺序、同评分规则,原始回答先封存、后审计。首个正式样本开测后,本轮题目、数据、标准答案和评分门槛不得临场修改。·不同产品面对相同经营场景和关键数据。·除协议预设多轮题外,不给产品追加评分提示。·Q0产品自我定位与Q1-Q8能力实测分开。·产品错误、测试者错误和运行环境错误分开记录。·历史测试只用于纵向对照,不能反向修改本轮冻结结果。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组23第13章|Q0不评分与Q1-Q8测试任务设计中国餐饮经营Agent第四部分|我们是怎么测的Q0先问产品“你是谁、服务谁、需要什么数据、你说自己能做什么、不能做什么”,但Q0不评分。产品自我声明只能作为“声明—实证”对照,不能直接变成能力得分。题目主要测试内容主要能力Q0|产品定位与能力声明产品怎么定义自己、数据怎么进入、权限与边界不评分,只做声明—实证对照Q1|完整经营结果判断利润、成本率、保本等确定性经营测量C1|经营测量|账算得明白Q2|缺数与补数缺关键数据时是否停手;补数以后能否继承并重算C1+D3观察Q3|利润变化拆解能否形成闭合利润桥,识别主要变化来源C2|经营分析|关系看得懂Q4|无提示异常发现不给问题提示,从连续数据自己找主要异常C3|异常发现|问题找得到Q5|促销与因果判断多个同期变化时能否守住因果边界C4+T1-T3Q6|情景模拟价格、单量、平台费、阶梯人工联动C5|预测模拟|未来算得出Q7|多方案约束决策在利润目标、投入上限、服务红线下真正选方案C6|决策优化|动作定得好Q8|第60天新证据改判题面设定的第60天经营结果与原预测不同后,重新计算、反思和调整C4+C5+C6;仅形成A4前置认知证据特别说明:Q8使用的是题面设定的“第60天新证据”,不是六家产品分别真实运行60天后的真实门店结果。它测试新证据回流后的认知改判能力,不能直接证明A4|结果跟踪与闭环达到3级。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组24第14章|R0-R4:测试真实性层级中国餐饮经营Agent能力白皮书V0.2第四部分|我们是怎么测的含义层级中文名称R0|仿真经营题场景仿真人工设计经营情境和数据,验证基础能力R1|真实经营问题问题真实任务来自餐饮经营中真实存在的判断问题R2|真实经营数据数据真实使用真实门店、真实周期、真实经营数据R3|真实经营系统环境系统真实Agent进入POS、外卖、供应链、排班、财务等真实系统R4|真实动作与结果结果真实建议或动作真正进入经营,并观察后续真实结果本轮Q1-Q8主要位于R0|仿真经营题与R1|真实经营问题层。统一冻结数据保证了六样本可比较性,但不能被表述成六家分别在真实门店R2数据环境中的长期实战。更准确地说,本轮测试比较的是产品在结构化、统一输入条件下完成标准化经营任务的能力;它不能替代真实门店中对脏数据、模糊问题、数据冲突、持续运行和真实行动结果的验证。V0.1.1优先解决“可比较性”,不是一次性解决全部“真实性”。对C类能力的解释边界:本报告所有C1-C6等级,都以对C类能力的解释边界:本报告所有C1-C6等级,都以“规定经营数据和口径已经由测试者提供”为前提。实际经营中的数据获取、清洗、融合、语义对齐和持续状态维护属于另一组更难的系统能力,因此本报告对C类能力的评价不应被视为对同等水平A类运行能力或端到端Agent能力的评价。我们在市场上寻找什么产品点名样本保持透明,量化结果强调能力分布而不是产品排行榜。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组26第15章|市场扫描与样本选择原则中国餐饮经营Agent能力白皮书V0.2第五部分|我们在市场上寻找什么产品第15章|市场扫描与样本选择原则本项目不是先选6个产品再设计规则,而是先定义餐饮经营Agent,再寻找已经进入经营判断链的候选产品。市场扫描不等于市场穷举;截至研究冻结日期,我们只能说明“通过公开渠道已经发现并能够确认的一组候选产品”,不能声称已经找全中国全部餐饮AI。公开市场已经出现不同路线。例如,客如云官方AI产品体系中将“老板助手”定位为“数据驱动决策、一眼看透经营”,并公开经营日报,智能分析诊断等部分功能仍标注“后续上线”;银豹官方餐饮AI页面则公开“AI经营”,强调全渠道数据自动抓取、智能清洗、经营趋势和决策辅助。这些公开信息可以证明产品方向,但不能替代统一直接测试证据。正式进入本轮测试样本需要满足公开、可执行的纳入标准,而不是依据产品名气、企业规模或预期成绩临场选样本纳入标准·1.研究对象匹配:产品公开定位、实际功能或产品交互已经进入至少一项C类经营判断任务,而不只是营销、客服、SOP或单纯执行工具。·2.存在真实可访问产品入口:研究者可以实际进入产品并直接提交测试任务,而不仅依据宣传材料或演示视·3.可以取得原始输出:测试过程能够保存产品对统一题目的直接回答,形成可复核证据。·4.能够执行冻结协议的大部分核心任务:若单项因入口、长度、权限等客观条件无法完成,该项记录“待验证”,不能临时改题。·5.产品处于公开可使用,或研究者可以合法获得测试权限的状态。样本排除标准·只有媒体报道、宣传材料或演示,没有可实际交互入口。·主要功能不进入餐饮经营判断链。·无法形成可保存、可复核的原始回答。·测试环境受污染且无法重新建立有效测试。·产品长期不可用、明显故障,或无法完成冻结协议的最低核心要求。市场份额、品牌知名度、融资规模和企业大小不作为纳入的必要条件。上述标准降低了临场选择空间,但仍不能消除目的性取样和公开可访问性带来的选择偏差;市场上仍可能存在未公开、封闭部署或本研究尚未发现的更强因此,本轮6个样本属于按研究目的筛选形成的目的性测试样本,而非随机代表性抽样。未进入本轮测试,不代表产品能力较弱;没有形成直接测试证据,也不能解释为相关能力不存在。北京餐鸟科技有限公司|餐饮AI经营能力测评项目组27第16章|本轮6个点名样本:价值与下一步最值得增强中国餐饮经营Agent能力白皮书V0.2第五部分|我们在市场上寻找什么产品第16章|本轮6个点名样本:价值与下一步最值得增强 餐剑已经表现出的价值:在本轮标准化经营任务中,经营计算、结构拆解和单轮方案推演表现相对突出,呈现出经营参谋型AI特征。下一步最值得增强:优先增强C4|经营诊断|原因判得准,以及复杂多轮经营中的状态保持、新证据重算和持续改判能力。窄门餐谋已经表现出的价值:除行业数据库能力外,在本轮标准化经营任务中,异常发现和经营诊断表现相对突出,呈现出行业数据+经营诊断型助手特征。下一步最值得增强:优先增强C2|经营分析|关系看得懂中的利润结构拆解稳定性,以及复杂阈值和多变量模拟的准确性。已经表现出的价值:在本轮标准化经营任务中,基础经营测量和收到数据后的异常扫描表现出一定经营辅助潜力,具备从行业信息服务继续向经营分析辅助延伸的基础。下一步最值得增强:优先增强C2|经营分析|关系看得懂、C5|预测模拟|未来算得出和C6|决策优化|动作定得好,使行业信息能力进一步进入真实门店经营判断链。奥琦玮老板助手已经表现出的价值:在本轮标准化经营任务中,基础经营测量和异常发现表现较好;结合其餐饮数字化系统数据基础,呈现出依托系统数据向经营辅助延伸的产品特征。下一步最值得增强:优先增强C4|经营诊断|原因判得准、关键阈值执行和目标硬约束下的C6|决策优化|动作定得好,把系统数据优势进一步转化为经营判断优势。袋鼠参谋已经表现出的价值:除市场和行业数据能力外,在本轮标准化经营任务中还表现出较强的经营测量、利润结构拆解和方案推演能力,呈现出市场数据+经营分析型助手特征。下一步最值得增强:下一步应补充连续经营数据下异常发现能力的直接验证,同时增强C4|经营诊断|原因判得准中的证据边界。第16章|本轮6个点名样本:价值与下一步最值得增强中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组28已经表现出的价值:在本轮标准化经营任务中,经营测量、结构分析和明确规则下的模拟表现较好,呈现出经营参谋+餐饮知识应用型AI特征。下一步最值得增强:优先增强复杂因果判断、目标硬约束下的C6|决策优化|动作定得好,以及新证据回流后的动态重算稳定性。本章刻意不公布各产品的具体C1-C6等级。产品点名解决“到底测试过谁”的透明度问题;公开量化结果则只呈现各项能力的分布、样本均值和3级通过率,避免形成能够跨能力追溯到单一产品的完整“能力指纹”。第17章|从点名测试到分项统计中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组29第五部分|我们在市场上寻找什么产品第17章|从点名测试到分项统计进入量化能力比较后,公开版不再提供A—F跨能力单样本矩阵。六个产品仍公开点名,但量化章节只按每一项能力展示有效样本数、等级分布、达到3级比例和描述性均值。这样做不是回避测试责任,而是把讨论重心从“谁第一”转回“哪项能力发展到什么阶段”,同时降低小样本下通过能力指纹反向识别单一产品的可能。由于0—5级是有序能力等级、不同能力经营风险并不等权、严重错误不能被其他高分平均覆盖,本白皮书不生成单个产品简单总平均排名。六个统一样本告诉了我们什么六个统一样本提供的是阶段性证据,不是对整个市场的平均水平外推。第18章|能力分布与统计边界中国餐饮经营Agent能力白皮书V0.2北京餐鸟科技有限公司|餐饮AI经营能力测评项目组31第六部分|六个统一样本告诉了我们什么第18章|能力分布与统计边界公开版只展示每项能力的总体分布,不提供能够把同一产品六项能力串联起来的跨能力单样本矩阵。样本均值只用于描述本组六样本在某一项能力上的阶段性位置,不作为精确等距统计量,也不用于单个产品总分排名。达到3级“真实经营辅助可用线”的样本比例|本轮标准化直接测试C1|经营测量C2|经营分析50%C3|异常发现C4|经营诊断C5|预测模拟50%C6|决策优化33.3%经营能力有效样本数等

温馨提示

  • 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
  • 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
  • 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
  • 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
  • 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
  • 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
  • 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。

评论

0/150

提交评论