版权说明:本文档由用户提供并上传,收益归属内容提供方,若内容存在侵权,请进行举报或认领
文档简介
DECISIONS,NOTSTRINGSJev深度解析:当AI不再说话TypeSafe决策型模型新范式全解读从文本生成到直接决策·193倍速度与444倍成本的真相·Agent时代的模型分层CONTENTS·目录01事件概览Jev如何引爆硅谷开发者社区02模型解析不要文本,要决策03技术深潜它凭什么更快更便宜04团队资本RLHF之父的二次创业05性能审视193倍与444倍的真相06产业意义Agent时代的模型分层07争议展望噱头还是新范式0201事件概览Jev如何引爆硅谷开发者社区01·事件概览七天内从隐身到开放注册:Jev的爆发时间线9月15日·正式发布TypeSafeAI结束两年隐身模式,发布Jev模型与4000万美元种子轮融资信息,DCVC领投。9月16日·社区引爆LatentSpaceAINews报道;发布帖约420万次浏览、近2万点赞;长时间占据HackerNews前列。9月18日·媒体深度腾讯科技等媒体发布深度解读文章;开发者社区围绕"新范式还是分类器复活"展开激烈讨论。9月20-21日·全面开放取消候补名单,任何人可直接注册;36小时内约14万开发者注册使用。Forbes披露估值约2亿美元。来源:TypeSafeAI官方公告·LatentSpace·HackerNews·MITTechnologyReview·Forbes0401·事件概览四个核心数字读懂Jev的性能宣称193.6倍最高速度提升特定工作流评测中,Jev相较对照大模型的最高加速比444.6倍最高成本下降单个case成本可压至约0.0004美元,特定任务最大降幅70-500毫秒端到端延迟响应时间区间,部分场景低至70毫秒以内$0.042/百万Token输入输出不按Token收费,按次或按判断类型计费关键解读这些数字由TypeSafe官方公布,测试任务由其modelcapabilities团队设计。193.6倍与444.6倍是特定任务、特定模型比较中的最大值,不代表Jev处理任何任务都能获得同等提升。独立第三方评测尚待出现。来源:TypeSafeAI官方生产式工作流评测·数据口径为特定工作流下的最大比值0501·事件概览传播热度:从HackerNews到14万开发者涌入420万+创始人发布帖浏览量
近2万次点赞14万36小时内注册开发者数量
取消候补名单后涌入$2亿Forbes援引知情人士估值
4000万美元种子轮,DCVC领投为什么Jev能引发如此广泛关注?直击Agent落地的真实痛点开发者长期受困于Agent中大量"说了但没人看"的文本生成调用,Jev提供了一条不同的技术路线。创始人自带技术公信力DiogoAlmeida是InstructGPT主要作者和RLHF流程奠基人之一,其技术判断在社区有天然号召力。极端性能数字制造话题性193倍快、444倍便宜的说法天然具有传播力,无论最终是否成立,都成功抓住了注意力。"不说话"的反直觉定位在所有人都在比拼对话能力时,一个主动砍掉聊天功能的模型反而引发了强烈好奇。来源:LatentSpace·BornCity·Forbes·TypeSafeAI0602模型解析不要文本,要决策02·模型解析"Decisions,notstrings"——Jev的核心契约传统LLM的输出"根据当前页面分析,我认为用户应该点击右下角的Checkout按钮以完成购买流程。该按钮位于页面右下方,颜色为蓝色……"→Jev的输出{"choice":"checkout_button","confidence":0.97}软件真正需要的,只是"第三个按钮"给Jev一段信息和几个预定义问题,它直接返回选择、评分及相应概率。例如收到一封客服邮件,Jev可同时判断应分给哪个部门、紧急程度、退款风险以及是否需要人工介入。软件拿到结果后,通过普通代码即可决定下一步动作——不需要从一段自然语言中提取信息,不需要解析语义,更不会因为模型"多说了几句"而产生解析错误。来源:TypeSafeAI官方定义·"Decisions,notstrings"0802·模型解析SystemOneModel:卡尼曼理论在AI中的映射System1·快速直觉Jev对应位置快速、自动、直觉式判断低延迟·低成本·高吞吐用于路由、分类、评分、风险判断软件Harness直接调用,无需人工介入System2·缓慢思考FrontierLLM对应位置缓慢、审慎、深度推理高延迟·高成本·低吞吐用于复杂规划、长文生成、深度分析需要理解上下文并生成开放式文本TypeSafe的核心主张人类大脑用System1处理绝大多数日常判断,只在必要时才调用System2。AI系统也应如此:绝大多数Agent内部调用属于快速判断,不应每次都消耗FrontierModel级别的资源。Jev要做的,就是AI系统里的System1。来源:丹尼尔·卡尼曼《思考,快与慢》·TypeSafeAI定义0902·模型解析为什么叫"Jev":杰文斯悖论与智能民主化名字取自经济学家WilliamStanleyJevons及其提出的"杰文斯悖论"历史上的杰文斯悖论1865年,Jevons发现:蒸汽机效率提升后,煤炭消耗不降反升。效率提升→成本下降→使用场景爆发→总需求增加TypeSafe的AI版本智能判断成本足够低→被大规模嵌入软件每个按钮、每条消息、每笔交易都可以有"智能"总智能调用量将远高于今天这不仅是命名,更是商业愿景TypeSafe希望Jev成为AI时代的"蒸汽机"——当智能判断变得足够便宜、足够快,它不会被少用,反而会渗透到每一个软件环节。从客服工单分流到风控审核,从搜索排序到内容审核,决策型智能将无处不在。来源:WilliamStanleyJevons《煤炭问题》·TypeSafeAI命名说明1002·模型解析三种输出类型:软件可直接消费的决策原语类型功能示例典型场景Choice在预定义选项中选择refund_risk:high/medium/low工单路由·分类·选项决策Score等级或连续评分priority_score:0-100连续值排序·优先级·质量评估NoulYes/No判断+概率needs_human:true(0.85)风控·审核·开关判断每一次输出都附带校准概率。软件可据此设置自动执行阈值:高置信度任务直接处理,低置信度任务转交人工复核。例如Jev判断某用户退款风险为"高风险75%",系统即可直接进入人工审核队列,无需额外代码判断。这本质上是一个拥有通用语义理解能力的"智能if语句"。来源:TypeSafeAI官方文档·模型输出类型定义1102·模型解析Jevvs传统LLM:一次真实对比的画面关键差异左侧Jev一次查询同时回答12个问题全部返回结构化JSON耗时0.114秒成本$0.000081右侧传统LLM逐Token自回归生成只输出一个布尔值文本耗时8.566秒成本$0.013880上图为TypeSafe官方演示截图。同样的输入,Jev在0.114秒内并行返回12项结构化判断,而传统LLM耗时8.566秒仅输出一个文本值。这张图直观展示了"为软件设计"与"为人设计"的效率差距——但需注意,这是TypeSafe自选的演示案例,并非独立评测。1203技术深潜它凭什么更快更便宜03·技术深潜自回归生成的效率瓶颈:为什么"多说一个字"都贵传统LLM的生成过程:逐TokenDecode,顺序执行输入Token1Token2...TokenN完整文本Jev的做法:限制输出空间,直接返回概率分布输入一次前向传播→概率分布Choice/Score/Noul核心洞察:输出越长,Decode步骤越多,延迟和成本线性增长。Agent任务中90%的调用只需一个判断结果,不需要开放式文本。Jev主动把输出空间压缩为预定义选项的概率分布,从根本上消除了逐Token生成的成本。这不是"让Token生成更快"(Flash路线),而是"直接减少Token数量"。来源:TypeSafeAI技术说明·自回归生成机制分析1403·技术深潜ParallelSampler:一次查询,多题同答处理一张发票时,Jev可同时回答多个独立问题发票类型判断
→VAT/Service/Goods异常风险检测
→high/medium/low审批级别确定
→Level1/2/3是否需人工复核
→yes/no+概率为什么这很重要?传统方式:4个问题=4次API调用每次调用都要重新处理输入延迟叠加,成本翻倍网络往返消耗显著ParallelSampler:1次调用输入处理一次,并行输出多组判断延迟不随问题数量线性增长特别适合工单/发票/邮件等多维评估场景来源:TypeSafeAI技术文档·ParallelSampler说明1503·技术深潜RLCD:面向校准决策的强化学习方法优化目标解决什么问题RLHF人类偏好对齐让模型回答更符合人类期望RLVR可验证奖励提升数学、代码等可验证任务能力RLCD校准决策的强化学习模型说"90%确定"时,真的90%正确为什么校准对自动化决策至关重要?假设一个模型实际判断正确率只有80%,却经常给出99%的置信度——这个数字几乎无法用于自动化决策。企业无法据此建立分流机制:高置信度任务自动执行、中等置信度交更强模型复核、低置信度转人工。RLCD的目标就是让模型输出的概率真实反映其正确率。当模型对一批任务都给出90%置信度时,其中约90%应该判断正确。只有做到这一点,决策型模型才能真正进入生产环境。来源:TypeSafeAI文档·RLCD技术说明1603·技术深潜概率校准:让阈值决策成为可能软件如何利用校准概率高置信度(>90%)系统自动执行,无需人工介入中等置信度(70%-90%)转交更强模型复核或标记待审低置信度(<70%)直接转人工处理,避免错误自动化上图为TypeSafe官方演示的置信度阈值界面。只有当概率校准确实可信时,这套阈值分流机制才有意义。如果模型系统性高估或低估自己的判断能力,整个自动化决策体系就会建立在沙子上。这也是为什么RLCD能否被独立验证,是判断Jev技术含量的关键指标。来源:TypeSafeAI官方演示·置信度阈值与自动分流机制1703·技术深潜"ZeroHallucinations"宣传的真实含义它实际做到的输出不会超出预定义类型。规定只能在"猫、狗、鸟"中选,Jev不会返回"大象",也不会生成软件无法解析的文字。它并没有做到的输入明明是猫,模型却返回"狗:97%"——没有发生typeerror,但业务结果完全错误。事实和判断层面的错误并未消除。Typeerror≠判断正确TypeSafe宣称Jev的工具调用类型错误率为0%。这对生产系统确实重要——尤其是在Agent自动调用API、修改数据库和执行工作流时,结构化输出越稳定,系统越容易接入后续操作。但"ZeroHallucinations"更准确的说法是"ZeroTypeErrors"——它保证的是输出格式和类型约束,而非事实正确性。目前没有证据表明Jev消除了事实层面的幻觉。在解读这一宣传时,必须区分这两个完全不同的概念。来源:TypeSafeAI官方评测·ToolCallErrorRate数据1803·技术深潜未知黑箱:论文、参数与消融实验的缺失截至目前,TypeSafe尚未公开的关键技术信息完整论文没有公开技术论文,无法判断RLCD是否为真正新范式参数规模未披露参数量、网络结构和训练数据规模训练数据训练数据来源、标注方式、领域覆盖均不透明消融实验无法判断各组件贡献度,哪些是核心创新当前判断:工程组合vs基础突破在缺乏论文和消融实验的情况下,外界无法判断RLCD究竟代表一种明显不同的训练范式,还是对强化学习、概率校准等已有方法的工程化组合。同样,parallelsampler和SystemOneModel也缺少足够细节,很难据此认定Jev完成了类似Transformer、Attention或MoE级别的基础架构突破。目前最合理的态度是:承认其工程价值,但保留对"范式级创新"的判断。来源:基于公开信息整理·TypeSafeAI尚未发布完整技术报告1904团队资本RLHF之父的二次创业04·团队资本DiogoAlmeida:从InstructGPT到TypeSafe关键履历OpenAI前研究员,GoogleBrain经历2022年InstructGPT论文主要作者之一参与建立后来广泛采用的RLHF训练流程GPT-4贡献名单列入"FoundationalRLHFandInstructGPTwork"Co-inventorofRLHF,ChatGPT,GPT-42024年离开OpenAI,创立TypeSafeAI此后约两年隐身研发Jev他离开OpenAI后一直在思考的问题"如果大模型已经这么聪明,为什么世界上的大多数工作还没有被自动化?"Jev可以看作他给出的第一个答案——智能不一定需要通过语言生成来表达,它可以直接嵌入软件决策。来源:TypeSafeAI官网·Databricks演讲者介绍·AIWiki2104·团队资本创始团队:三人技术铁三角DiogoAlmeidaCEO·OpenAI/GoogleBrainCo-inventorofRLHFInstructGPT主要作者ChatGPT与GPT-4核心贡献者十年AI研究经验负责模型训练与技术方向ErikGafniRavel联合创始人·多模态AI连续创业者RavelAI联合创始人多模态AI方向专家负责工程架构与产品化连接模型能力与软件系统SashaShengMetaAI/FAIR前MetaAI研究员FAIR(基础AI研究院)背景负责模型对齐与评估校准与可靠性方向支撑RLCD技术路线三人组合覆盖了"模型训练—工程产品—对齐评估"全链路。Almeida的RLHF经验+Gafni的产品化能力+Sheng的对齐评估背景,构成了一个完整的"从研究到落地"团队配置。来源:TypeSafeAI官网·BusinessWire·TheRoboticsMedia2204·团队资本4000万美元种子轮:资本如何押注决策型AI$40M种子轮融资金额DCVC领投,2026年9月15日公布~$200M估值(Forbes报道)Forbes援引知情人士,TypeSafe未官方确认2年隐身研发周期从创立到2026年9月正式发布DCVC为什么投?DCVC普通合伙人JamesHardiman表示,TypeSafe正在攻克AI领域最大的挑战之一:如何把越来越强的模型变成真正可用的技术。4000万美元种子轮给了TypeSafe充足的资金,在收入里程碑之前训练、部署和测试新模型架构。这笔融资的信号意义大于金额本身:顶级VC正在押注"为软件而非为人类设计AI"这一方向,说明产业界已经意识到,纯对话模型并不是AI落地的唯一形态。来源:DCVC官方公告·Forbes·BusinessWire·Morningstar2305性能审视193倍与444倍的真相05·性能审视官方评测:Jev在工作流智能与成本曲线上的位置读图要点左图:X轴为单工作流成本,Y轴为准确率。Jev位于左下角低成本区域,准确率约67.8%,接近前沿模型的68%-74%。右图:Jev工具调用类型错误率为0%,对比GPT、Claude、Gemini等模型的0.3%-22%错误率。注意:数据来自TypeSafe官方评测,任务由其自有团队设计。来源:TypeSafeAI官方评测·ParetoCurve与ToolCallErrorRate数据2505·性能审视"193.6倍"不能简单理解为"接近GPT智能,快193倍"局限一:任务偏向测试任务本身就是Jev最擅长的SystemOne型任务——分类、选择、评分和判断。让专门为结构化决策设计的模型与通用生成模型比赛这类任务,本身就放大了Jev的优势。局限二:自评偏差最完整的评测主要由TypeSafe自己完成,测试任务由其modelcapabilities团队设计,公司也承认可能存在偏差。部分参考答案还来自强模型生成,而非全部使用人工标注的groundtruth。局限三:极端值"193.6倍"和"444.6倍"是特定任务、特定模型比较中的最大差距,不代表Jev处理任何任务都能获得这样的提升。平均表现远低于这些极端值。正确的理解方式这些数字真正证明的是一个常识:如果任务最终只需要一个选择或概率,专门为判断设计的模型确实有机会比完整的生成式LLM便宜很多。它不证明Jev拥有接近GPT的通用智能。来源:TypeSafeAI生产式工作流评测·评测方法论分析2605·性能审视真正的对手不只是GPT和Claude对手类型代表方案优势局限Flash小模型GeminiFlash/DeepSeekFlash通用能力+ConstrainedDecoding仍需逐Token生成结构化输出传统分类器BERT类微调/XGBoost分类成本极低·延迟极低每个任务需重新训练Embedding分类器Embedding+相似度匹配成本更低·无需训练语义理解深度有限一套真正有说服力的独立测试,应该把Jev、Flash模型+ConstrainedDecoding、传统分类器和Embedding分类器放进同一批真实生产任务,统一比较准确率、置信度校准、延迟、成本、分布外鲁棒性和批处理扩展能力。目前看来,还没有这类测试。来源:基于行业现有方案整理·独立第三方评测尚待出现2705·性能审视结论:Jev证明了方向,但未证明绝对领先它确实证明了的专用决策模型在特定任务上可以比通用LLM便宜两个数量级结构化输出+概率校准对生产系统有实际价值"为软件设计AI"不是伪需求它尚未证明的RLCD是否为真正新训练范式在通用基准上的准确率和校准是否可复现对比传统方案是否有成本之外的代差优势独立评测需要回答的六个问题1.准确率Accuracy2.校准Calibration3.延迟Latency4.成本Cost5.OOD鲁棒性6.批处理扩展能力在独立评测出现之前,最理性的态度是:承认Jev的工程价值和方向正确性,但对其"范式级创新"的宣传保持审慎。来源:基于公开信息综合判断2806产业意义Agent时代的模型分层06·产业意义Agent痛点:复杂任务中90%的调用只是"判断"假设一个Agent完成任务需要100次模型调用90次:路由、分类、验证、状态判断—只需一个选择或概率10次复杂规划、长文生成、深度推理—真正需要开放式文本生成问题所在如果这100次调用全部交给GPT、Claude或Gemini等完整生成式大模型:模型不仅要理解问题,还要花时间生成一段最后不会被人阅读的文字。从软件系统角度看,它真正需要的信息可能只是"第三个按钮"、"转给售后"或"风险高"。类似情况大量存在于Agent内部:这个工单应该交给销售还是售后?这笔交易风险高不高?搜索出来的十条结果哪个最相关?这些任务都需要模型具备语义理解和判断能力,却没有多少开放式文本生成的必要。来源:基于Agent工作流分析·TypeSafeAI场景说明3006·产业意义未来Agent系统的四层模型架构FrontierModel复杂任务规划·长文生成·深度推理·开放式创意—GPT-4o/Claude/GeminiFlashModel普通推理·轻量生成·平衡成本与能力—GeminiFlash/DeepSeekFlashDecisionModel路由·分类·评分·验证·高频判断—Jev所在层级确定性代码规则引擎·传统算法·数据库操作—不需要AI的部分继续由代码处理Harness(调度层)负责在这四层之间路由:简单判断走DecisionModel,普通推理走Flash,复杂任务才升级到FrontierModel。来源:基于TypeSafeAI架构愿景与行业趋势分析3106·产业意义成本经济学:当智能判断便宜到可以无处不在单case成本对比(TypeSafe官方数据)方案单case成本响应时间适用场景Jev~$0.0004~0.4秒高频结构化判断传统LLM最高$0.0138+数秒至数十秒开放式生成与推理当单次判断成本从美分级降到毫分级,企业可以在更多环节嵌入智能:每一封客服邮件自动分流、每一笔交易实时风控、每一条搜索结果智能排序、每一个用户行为实时评分。这正是"杰文斯悖论"在AI领域的翻版——效率提升不仅不会减少智能的使用,反而会因为成本下降而爆发更多应用场景。TypeSafe赌的就是这个:让智能判断足够便宜,然后它会像水电一样渗透到每个软件环节。来源:TypeSafeAI官方数据·成本对比为特定工作流下的估算值3206·产业意义Jev最值得关注的产业信号它挑战了一个默认假设:"一切需要智能的地方都需要调用生成式LLM"对开发者的信号审视你的Agent工作流中有多少调用只是"判断",这些调用是否真的需要生成式LLM?分层调用可能大幅降低成本。对AI厂商的信号纯对话模型不是AI落地的唯一形态。为软件系统设计专用模型,可能是比继续堆参数更大的机会。对企业的信号AI自动化落地不一定需要最强大的模型。找到任务与模型的最佳匹配,用对的模型做对的事,才是降本增效的关键。对行业的信号模型分层、专用化、为机器而非为人类设计——这些方向可能比"一个模型解决所有问题"更接近落地现实。来源:基于Jev产业影响的综合分析3307争议展望噱头还是新范式07·争议展望社区两极分化:"行业重新发现了分类器"两种声音怀疑派:"行业又重新发现了分类模型,这有什么新鲜的?"看好派:"更像是给分类器打了LLM级别的语义理解能力,不用为每个问题单独训练。如果成本和速度数据成立,意义不小。"有开发者直接对媒体说:"哪有这好事儿?"——既指对性能数字的怀疑,也暗指这种"便宜又好用"的承诺在AI领域反复出现。真正的判断需要等待独立评测和大规模生产环境验证。来源:Reddit开发者社区讨论·腾讯科技采访3507·争议展望正反方观点对照质疑:噱头大于实质本质就是带约束解码的分类器,并非新架构效率优势来自任务选择,而非模型创新没有公开论文和消融实验"零幻觉"只是零类型错误,非零事实错误概率校准是否真的可信尚待验证对比Flash+ConstrainedDecoding未必有代差数据全部来自官方自评看好:方向真实且有价值切中Agent高频判断的真实成本痛点保留LLM级零样本泛化,优于传统
温馨提示
- 1. 本站所有资源如无特殊说明,都需要本地电脑安装OFFICE2007和PDF阅读器。图纸软件为CAD,CAXA,PROE,UG,SolidWorks等.压缩文件请下载最新的WinRAR软件解压。
- 2. 本站的文档不包含任何第三方提供的附件图纸等,如果需要附件,请联系上传者。文件的所有权益归上传用户所有。
- 3. 本站RAR压缩包中若带图纸,网页内容里面会有图纸预览,若没有图纸预览就没有图纸。
- 4. 未经权益所有人同意不得将文件中的内容挪作商业或盈利用途。
- 5. 人人文库网仅提供信息存储空间,仅对用户上传内容的表现方式做保护处理,对用户上传分享的文档内容本身不做任何修改或编辑,并不能对任何下载内容负责。
- 6. 下载文件中如有侵权或不适当内容,请与我们联系,我们立即纠正。
- 7. 本站不保证下载资源的准确性、安全性和完整性, 同时也不承担用户因使用这些下载资源对自己和他人造成任何形式的伤害或损失。
最新文档
- 民航安全检查规则考核试题及答案
- 农村集体经营性建设用地入市真题及答案
- 人教版(五四制)2026-2027学年六年级上册中国历史(第一册)教学工作计划(及进度表)
- 2026年高考最有效的高考语文答题技巧新课标
- 六上《青山不老》课件
- 《SPSS基本操作》课件
- 动态的模版课件
- 六上《七律长征》课件
- 销售活动策划基本技巧与禁忌
- T/FJSP 0018-2022青梅配制酒
- 2.8 圆的面积(一) 课件(内嵌视频)2026-2027学年北师大版六年级数学上册
- 2026国中康健集团限公司社会招聘(15人)易考易错模拟试题(共500题)试卷后附参考答案
- 服务费用支付催缴函(7篇)范文
- 2026年危险化学品重点县专家指导服务自查表
- 第4课《科技力量大》(课件)
- 中科曙光入职在线测评题库
- 2025年9月20日云南省直机关遴选公务员笔试真题及答案解析
- 2025年山东初级注安师考试题库及答案
- (完整版)新视野大学英语1单词表
- T/CECS 10240-2022绿色建材评价组合式空调机组
- 中医健脑养生课件
评论
0/150
提交评论