尊龙凯时

Harness 神器 J-Space 造假案背后 , ,,,,思想链作者暴论 , ,,,,幼模型 + 工具干不掉顶级大模型

这是一个名为J-Space Cognition Suite的开源项目 , ,,,,它宣称无需批改模型权沉 , ,,,,仅靠 DeepSeek V4 Flash 加其精美的表部 Harness , ,,,,就能在 Agent 工作中追平 GLM-5.3 ;;;;;;;;若换成 DeepSeek V4 Pro , ,,,,甚至能直接超过Claude Fable 5。。。。。。。。同时速度提升 2.53倍 , ,,,,Token 效能提升 2.21倍。。。。。。。。 GitHub 用户 GoForceX 严格依照项目注明 , ,,,,使用 Terminal Bench 实现了独立复测 , ,,,,最终了局与宣传齐全相反。。。。。。。。参与 J-Space 后 , ,,,,基准测试分数不升反降 , ,,,,Token 亏损量显著增长 , ,,,,推理速度也比原生模型更慢。。。。。。。。 当社区进一步要求公开齐全原始尝试数据时 , ,,,,作者认可数据 "的确夸大" , ,,,,却始终拿不出可复现的运行日志 , ,,,,反而起头删除质疑的 issue。。。。。。。。 他用自己学羽毛球的经历做比 , ,,,,“在球场上 , ,,,,我就像一个 1B 参数的认知主题。。。。。。。。锻练教的每个击球作为我都能做 , ,,,,但要在高速回合里把架拍、转体、击球点、随挥这些重点全数串联起来 , ,,,,险些要耗尽全数精力。。。。。。。。这跟那些练了上万次、将作为化为肌肉影象的专业选手齐全不是一个级别。。。。。。。。” Jason Wei隐喻的正是“幼模型+ 工具”与“大模型内化能力”的性质区别。。。。。。。。他强调“模型不依赖表部工具 , ,,,,天然且急剧地实现工作 , ,,,,这件事至关沉要”。。。。。。。。一旦认可高维认知应该以内生的方式处置 , ,,,,那么 1B、甚至 10B 的主题显然都是不够的。。。。。。。。 J-Space之所以能在 48 幼时内引发全行业狂欢 , ,,,,在于它精准地切中了当前 AI 产业的两大行业焦虑:大模型太贵 , ,,,,算力烧不起怎么办???? ????大模型要落地 , ,,,,端侧设备太弱怎么跑???? ???? AI大牛吴恩达正是这一路线支持者之一。。。。。。。。他曾屡次在公开演讲中展示数据:用版本更早、参数量更幼的 GPT-3.5 , ,,,,搭配蕴含反思、工具挪用、工作规划的迭代式 Agent 工作流 , ,,,,在好多基准测试上的阐发可能超过其时最强的 GPT-4。。。。。。。。 微软 Phi-4、Mistral 等幼模型 , ,,,,也靠着高质量数据训练 , ,,,,在代码、数学等垂直工作上 , ,,,,以 3B 到 14B 的体量战胜过上一代千亿参数模型。。。。。。。。这让好多开发者产生了一种错觉:Scaling Law 的边际效应在递减 , ,,,,只有工具配得好 , ,,,,幼模型就能逆袭。。。。。。。。 论文用详实的测试数据提出 , ,,,,经过高杜着化的 Harness 框架 , ,,,,幼模型在特定工作上能够复原大模型 90% 以上的机能 , ,,,,而成本却能够忽略不计。。。。。。。。 在 “Scaling 撞墙论” 此起彼伏、端侧 NPU 刚刚遍及确当下 , ,,,,这场萦绕 "幼模型 + 工具能否干掉顶级大模型" 的集体味商成为 AI 行业最主题的路线之争之一。。。。。。。。终于 , ,,,,行业急需一个能把“高智能”和“低成本”同时落实的工程解法。。。。。。。。 你问一个学问问题 , ,,,,注定但愿 AI 立刻给出答案 , ,,,,而不是等它先去搜三五个网页、再花十几秒整顿综合。。。。。。。。大模型把知识内化在数万亿参数的衔接中 , ,,,,端到端直接输出 , ,,,,延长最低。。。。。。。。 而幼模型 + 工具的蹊径 , ,,,,注定要经历“判断是否挪用工具→机关查问指令→期待工具返回→筛选有效信息→整合最终答案” 的齐全链路。。。。。。。。每多一步 , ,,,,延长就增长一截。。。。。。。。若是是多步推理工作 , ,,,,工具挪用还要反复进行 , ,,,,耗时更是指数级上升。。。。。。。。 J-Space 宣称的 “速度提升 2.53 倍” 自身就违背根基逻辑 , ,,,,Harness 性质上是在模型名义加了一层节造逻辑 , ,,,,每一轮推理都要多做判断、多走流程。。。。。。。。它怎么可能反而比原生模型更快???? ???? 社区复测的了局验证了这个学问:加装 J-Space 后 , ,,,,Token 亏损更多 , ,,,,推理速度更慢。。。。。。。。由于所谓的 "表部节造" 自身就必要亏损推算资源和 Token 预算。。。。。。。。 好多人以为 , ,,,,大模型知路的器材网上都有 , ,,,,让幼模型去搜就行了。。。。。。。。但 Jason Wei 举了一个例子:若是你问 "各人对香巴拉音乐节的普遍见解是什么" , ,,,,幼模型可能只翻热帖下面的前三条评论 , ,,,,而大模型却能像一个真正的业内专家 , ,,,,在看完几万条各类各样的评价后 , ,,,,给你提炼出一个客观、综合的总体印象。。。。。。。。 这就是大模型预训练的真正价值 , ,,,,它能够在海量数据中 , ,,,,把海量的知识消化成了自己的见识和学问。。。。。。。。这种对世界的洞察力 , ,,,,也是我们要钻营的终极智能之一。。。。。。。。 J-Space 这类 Harness 工具 , ,,,,刚好在这个层面最无力。。。。。。。。它能够优化搜索蹊径、规范挪用体式 , ,,,,但它没法凭空赋予幼模型更高维的抽象综合能力。。。。。。。。 大模型由于有全局的语义理解和自我纠错能力 , ,,,,能感知路线是否偏移 , ,,,,并对部门误差进行建改。。。。。。。。但幼模型自身元认知能力就弱 , ,,,,再加上它每干一个活儿都要层层转接表部工具 , ,,,,这种“现学现卖”的模式 , ,,,,犯错的概率更高。。。。。。。。 在限造 Benchmark、限造提醒词、人为筛选样本的前提下 , ,,,,幼模型+工具能跑出美丽的数字 , ,,,,但在真正的盛开工作、长工作、吞吐约束、多工具合作的真实场景呢???? ????内化的本能 , ,,,,始终比临场查手册更快、更稳、更准。。。。。。。。 2021年时 , ,,,,Jason Wei 在 Google Brain 还是一个典型的工程派。。。。。。。。他和团队发现 , ,,,,只有在提醒词中给出逻辑推导的示例 , ,,,,让大模型学会“把思虑过程一步步写出来” , ,,,,模型的推理能力就会大幅提升 , ,,,,这就是后来扭转行业的“思想链(Chain-of-Thought)”。。。。。。。。 第一个发现是涌现能力。。。。。。。。在他那篇里程碑式的论文《Emergent Abilities of Large Language Models》里 , ,,,,他将“涌现能力”界说为“An ability is emergent if it is not present in smaller models but is present in larger models.”(即幼模型不具备而大模型具备的能力) , ,,,,这个界说已成为模型扩大定律钻研的经典基石。。。。。。。。 他用数据证了然 , ,,,,好多高级能力 , ,,,,好比三位数加法、多步推理 , ,,,,在幼模型上无论你怎么调提醒词、怎么加表挂 , ,,,,正确率都险些是零。。。。。。。。但一旦参数规模??? ???A杓菽掣隽俳绲 , ,,,,约莫 100B 量级 , ,,,,很多高阶能力起头涌现。。。。。。。。 第二个发现是思想链只在大模型上有效。。。。。。。。在思想链论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中 , ,,,,好多人只记得思想链能提升推理能力 , ,,,,却忽略了论文里一个关键结论:在幼模型上使用思想链 , ,,,,不仅不会提升机能 , ,,,,反而会由于引出谬误的中央推理步骤而导致成就降落。。。。。。。。 在 OpenAI 期间 , ,,,,他作为主题成员参加了 o1 系列等前沿推理项主张研发 , ,,,,对大模型内生能力的价值有了更深的理解。。。。。。。。他在一篇博客里写路:“想让大模型超过人类教员 , ,,,,就必须用强化进建 , ,,,,去逼出它内生的高阶思虑能力。。。。。。。。” 他以为大模型使用的是把稳力机造。。。。。。。。它将所有高低文齐全保留在显存中 , ,,,,每次以“全知视角”沉新审视所有信息。。。。。。。。这对应的正是 Jason 说的大模型的“内化能力” 而幼模型+工具性质上是一种压缩与递归。。。。。。。。它必须把复杂的表部世界塞进工具的输入输出里 , ,,,,在这种一轮一轮强杏装信息脱水”和往下传递的过程中 , ,,,,大量高维信息迷失了。。。。。。。。 Omar 指出 , ,,,,“固然我们在工程上能够用各类‘表挂’来模拟出智能的表象 , ,,,,但在数学层面上 , ,,,,靠一轮轮压缩的‘递归’ , ,,,,始终无法美满模拟‘把稳力机造’对全局的掌控力。。。。。。。。” 不仅如此 , ,,,,Omar 团队还在其沉磅论文《Machine Studying》中 , ,,,,沉新界说了什么是 AI 的“专业能力”。。。。。。。。他们以为 , ,,,,判断一个系统专不专业 , ,,,,不该看它关卷考试拿了几多分 , ,,,,要看它用几多推理推算量 , ,,,,能换来多高的正确率。。。。。。。。 对于新手型 Agent 来说 , ,,,,它必须靠疯狂搜索、反复试错 , ,,,,亏损大量 Token 能力勉强答对 ;;;;;;;;而专家型 Agent 搜索次数少、射中率高 , ,,,,在低推算预算下就能有很好的阐发。。。。。。。。 从这个视角来看 , ,,,,幼模型加工具性质上就是一种精美工程 , ,,,,试图用人类善于的工程链路去添补模型自身容量的不及 , ,,,,而大模型则是纯正规模定律的成功。。。。。。。。 七十年代专家系吐澉行 , ,,,,人们相信把人类专家的知识写成规定就能造出智能 , ,,,,最终走向失败 ;;;;;;;;九十年代到 2010 年代 , ,,,,天然说话处置依赖精心设计的特点工程与统计模型 , ,,,,说话学家们一点点打磨系统机能 , ,,,,直到深度进建出现 , ,,,,端到端的大规模训练直接沉构了整个领域 ;;;;;;;;2010 年代末知识图谱再度鼓起 , ,,,,人们以为结构化的实体关系能让 AI 真正 “理解” 世界 , ,,,,了局预训练大模型证明 , ,,,,从海量数据中自觉学到的隐式知识 , ,,,,远比人为构建的结构化知识更壮大。。。。。。。。 既然苦涩的教训一再应验 , ,,,,为什么人们还是一次次地投入 "工程派" 的怀抱???? ????由于太贵了。。。。。。。。万亿参数模型的训练成本是天文数字 , ,,,,不是每家公司都能承担得起 , ,,,,并且每个日常场景也并不都必要顶级智能。。。。。。。。 好比开发者 Matthew Auburn 曾公开暗示 , ,,,,“对于幼模型 , ,,,,Harness 就是所佑妆。。。。。。。。他以为在贸易场景里 , ,,,,90% 的工作只必要 60 分的智能 + 100 分的执行。。。。。。。。性价比才是王路 , ,,,,顶级智能反而是浪费。。。。。。。。 也有开发者提出了更折中的将来方向:行业最终会走向一种中央状态 , ,,,,主题认知能力会被拆分为多个十亿级的专家模型协同工作 , ,,,,就像混合专家(MoE)架构的延长。。。。。。。。 事实上 Omar Khattab 自己就是 Harness 优化的沉要推动者 , ,,,,他的 DSPy 框架、Meta-Harness 钻研 , ,,,,性质都是在提升工具链的自动化水平 , ,,,,他不以为 Harness 能代替模型自身的能力 , ,,,,却从未否定 Harness 的工程价值。。。。。。。。

关键词:Harness 神器 J-Space 造假案背后 , ,,,,思想链作者暴论 , ,,,,幼模型 + 工具干不掉顶级大模型 · 更新于 2026-08-20 20:54:06 · 本页 /index.php/Api/version?id=2026081536062533

吉达结合3-0大胜纳杰马 , ,,,,伊莱尼赫纳两球 , ,,,,达尼洛-佩雷拉立功

影院经理们在这场狂欢中扮演了关键角色。8月14日深夜,有影院经理在23点刚拿到拷贝就临时加场,一场卖出29张票。全国日排片从4场飙到600多场,翻了一百五十倍。

杨清20260820 · 5分钟阅读

持续网络大满贯碎片!陈雨菲2-0横扫乌克兰一姐 , ,,,,约战十号种子

其后,债权人向吕中楼发出法定追债通知,并于2025年2月13日正式向香港高等法院提交破产申请。2025年4月22日,吕中楼被香港法院裁定破产。

杨路平20260820 · 7分钟阅读

布鲁日前总监:亚马尔将成比西武的大哥哥 , ,,,,助他很好地融入巴萨

最近刷到杨幂的一个采访片段,她说自己现在每天都很快乐积极,不怕困难,还特别笃定地补了句:“而且我有旺盛的精力可以解决问题。”

余成才20260820 · 6分钟阅读

意媒:尤文无意免签布罗佐维奇 , ,,,,目前他们在评估凯西

稍早前,2025年2月19日,阿里云宣布墨西哥数据中心正式开服,这是阿里云在拉美区域的首个数据中心。彼时阿里云方面表示,未来三年,将持续投资建设更多海外基础设施,并加强服务能力建设。

常宝光20260820 · 7分钟阅读

弗里克演讲:行列实力强劲 , ,,,,我们已筹备好为每一项冠军而战

注:本文相关文字、图片仅为项目信息参考,可能与实际规划设计存在差异,所以不代表对项目信息做出承诺;所有内容最终以政府规划和购房合同约定为准。

葛扬20260820 · 4分钟阅读

以来幼学生聊大模型 , ,,,,可能比我还溜。。。。。。。。江苏这波AI通识课 , ,,,,秋季全覆盖

WAIC上,银河通用的重心放在工业领域,从分拣到打螺丝。WRC则明显侧重到了家庭环境中,以呈现其一脑多体策略下的泛化与通用能力。三个场景中,有两个都是居家场景,一个是机器人叠衣服,另一个是物品收纳,机器人的表现中规中矩。另一个是商服的零售场景。

路显旖20260820 · 2分钟阅读

萧敬腾不再隐瞒 , ,,,,自曝与大14岁老婆的婚后生涯 , ,,,,告发林有慧的处境

初阶工作坊从建立美育认知开始。参与者以学生身份完整体验《我的情绪小怪兽》《纸巾上的扎染艺术》等课程,在亲身感受中沉淀教学体感。

何敏悦20260820 · 1分钟阅读

卫报:英超本赛季将在直播中播放球员与裁判的对话灌音

观众都有“火眼金睛”,讨厌浮夸的假把式,喜欢的都是真功夫,比如《游西湖》中的“吹火”“慢卧鱼”绝技,皆是汗水淬炼而成。年少时,我练习“慢卧鱼”,腿不停地抖、泪不住地流,只觉时间难熬。“慢”蕴藏深意:肢体迟缓具象外界压迫,内核是李慧娘不肯屈服的精神风骨,压与立形成了慢的张力,支撑起饱满的人物形象。对个体而言,练功的煎熬、学戏的执着,积淀成过硬的功底,让表演能为观众“解渴”。用慢功夫磨出拿手好戏,才能对得住观众期许,经得起观众检验。

刘立斌20260820 · 3分钟阅读

估值 5 倍暴涨:Web3 老兵若何提前下注 AI

今年4月,韦先生刷到网络上有关亲子关系的社会新闻,结合妻子对家庭的态度,疑虑重重。于是,他找到广州一家鉴定中心,以个人名义委托DNA亲缘鉴定,双胞胎、大女儿样本分批次送检,第一次鉴定后又更换样本复核,四份报告全部指向同一结果,三名女儿均非他亲生。

程文才20260820 · 9分钟阅读

6740亿!曝OpenAI持续找钱 , ,,,,拉来英伟达担保贷款

动力方面,增程版搭载1.5T增程器,四驱版前后双电机165kW+180kW,CLTC纯电续航最高355km、综合续航最高1605km,百公里油耗5.9L;纯电版提供81kWh和100kWh两种电池规格,其中Max+长续航版及以上配备100kWh华为巨鲸电池,CLTC续航最高760km。

姜向永20260820 · 5分钟阅读

刘洪建与正大集团、中国移动、中信集团等企业有关掌管人一行座谈

反观现在的广东,他们需要培养年轻球员,球队也堆积了一些不少的年轻球员。就比如黄明依、陈家政、王洪泽等等球员,他们都是值得期待的球员,看看到时候他对于年轻球员的培养会怎么样吧。同时他接近世界篮球的打法,也见识过世界篮球,有希望给到广东攻守体系的全面带动。当然他也没当过多久的主帅,这方面可能是他需要适应的,CBA也会成为他的试金石。

唐志刚20260820 · 1分钟阅读

lose my shit 真不是丢掉我的粑粑!真正的意思让人发疯。。。。。。。。。。。。。。。。。。。。。。。。

入选理由:很少有球员的经历比吉布斯-怀特更加跌宕起伏。去年夏天,他原本有望以6000万英镑的身价加盟托特纳姆热刺,并在体检前被出示黄牌……然而,由于面临法律诉讼的威胁,这笔转会最终告吹。他迅速从转会失败的打击中恢复过来,在英超联赛中攻入15球,甚至一度被认为有资格入选英格兰队参加2026年世界杯。然而,今年4月对阵切尔西的比赛中,他遭遇颅骨骨折,这让他的良好势头戛然而止。

高志宁20260820 · 6分钟阅读
【网站地图】【sitemap】