Harness 神器 J-Space 造假案背后,,,,,思想链作者暴论,,,,,幼模型 + 工具干不掉顶级大模型
这是一个名为J-Space Cognition Suite的开源项目,,,,,它宣称无需批改模型权沉,,,,,仅靠 DeepSeek V4 Flash 加其精美的表部 Harness,,,,,就能在 Agent 工作中追平 GLM-5.3;;;;;;;;若换成 DeepSeek V4 Pro,,,,,甚至能直接超过Claude Fable 5。。。。。。。。同时速度提升 2.53倍,,,,,Token 效能提升 2.21倍。。。。。。。。 GitHub 用户 GoForceX 严格依照项目注明,,,,,使用 Terminal Bench 实现了独立复测,,,,,最终了局与宣传齐全相反。。。。。。。。参与 J-Space 后,,,,,基准测试分数不升反降,,,,,Token 亏损量显著增长,,,,,推理速度也比原生模型更慢。。。。。。。。 当社区进一步要求公开齐全原始尝试数据时,,,,,作者认可数据 "的确夸大",,,,,却始终拿不出可复现的运行日志,,,,,反而起头删除质疑的 issue。。。。。。。。 他用自己学羽毛球的经历做比,,,,,“在球场上,,,,,我就像一个 1B 参数的认知主题。。。。。。。。锻练教的每个击球作为我都能做,,,,,但要在高速回合里把架拍、转体、击球点、随挥这些重点全数串联起来,,,,,险些要耗尽全数精力。。。。。。。。这跟那些练了上万次、将作为化为肌肉影象的专业选手齐全不是一个级别。。。。。。。。” Jason Wei隐喻的正是“幼模型+ 工具”与“大模型内化能力”的性质区别。。。。。。。。他强调“模型不依赖表部工具,,,,,天然且急剧地实现工作,,,,,这件事至关沉要”。。。。。。。。一旦认可高维认知应该以内生的方式处置,,,,,那么 1B、甚至 10B 的主题显然都是不够的。。。。。。。。 J-Space之所以能在 48 幼时内引发全行业狂欢,,,,,在于它精准地切中了当前 AI 产业的两大行业焦虑:大模型太贵,,,,,算力烧不起怎么办????????大模型要落地,,,,,端侧设备太弱怎么跑???????? AI大牛吴恩达正是这一路线支持者之一。。。。。。。。他曾屡次在公开演讲中展示数据:用版本更早、参数量更幼的 GPT-3.5,,,,,搭配蕴含反思、工具挪用、工作规划的迭代式 Agent 工作流,,,,,在好多基准测试上的阐发可能超过其时最强的 GPT-4。。。。。。。。 微软 Phi-4、Mistral 等幼模型,,,,,也靠着高质量数据训练,,,,,在代码、数学等垂直工作上,,,,,以 3B 到 14B 的体量战胜过上一代千亿参数模型。。。。。。。。这让好多开发者产生了一种错觉:Scaling Law 的边际效应在递减,,,,,只有工具配得好,,,,,幼模型就能逆袭。。。。。。。。 论文用详实的测试数据提出,,,,,经过高杜着化的 Harness 框架,,,,,幼模型在特定工作上能够复原大模型 90% 以上的机能,,,,,而成本却能够忽略不计。。。。。。。。 在 “Scaling 撞墙论” 此起彼伏、端侧 NPU 刚刚遍及确当下,,,,,这场萦绕 "幼模型 + 工具能否干掉顶级大模型" 的集体味商成为 AI 行业最主题的路线之争之一。。。。。。。。终于,,,,,行业急需一个能把“高智能”和“低成本”同时落实的工程解法。。。。。。。。 你问一个学问问题,,,,,注定但愿 AI 立刻给出答案,,,,,而不是等它先去搜三五个网页、再花十几秒整顿综合。。。。。。。。大模型把知识内化在数万亿参数的衔接中,,,,,端到端直接输出,,,,,延长最低。。。。。。。。 而幼模型 + 工具的蹊径,,,,,注定要经历“判断是否挪用工具→机关查问指令→期待工具返回→筛选有效信息→整合最终答案” 的齐全链路。。。。。。。。每多一步,,,,,延长就增长一截。。。。。。。。若是是多步推理工作,,,,,工具挪用还要反复进行,,,,,耗时更是指数级上升。。。。。。。。 J-Space 宣称的 “速度提升 2.53 倍” 自身就违背根基逻辑,,,,,Harness 性质上是在模型名义加了一层节造逻辑,,,,,每一轮推理都要多做判断、多走流程。。。。。。。。它怎么可能反而比原生模型更快???????? 社区复测的了局验证了这个学问:加装 J-Space 后,,,,,Token 亏损更多,,,,,推理速度更慢。。。。。。。。由于所谓的 "表部节造" 自身就必要亏损推算资源和 Token 预算。。。。。。。。 好多人以为,,,,,大模型知路的器材网上都有,,,,,让幼模型去搜就行了。。。。。。。。但 Jason Wei 举了一个例子:若是你问 "各人对香巴拉音乐节的普遍见解是什么",,,,,幼模型可能只翻热帖下面的前三条评论,,,,,而大模型却能像一个真正的业内专家,,,,,在看完几万条各类各样的评价后,,,,,给你提炼出一个客观、综合的总体印象。。。。。。。。 这就是大模型预训练的真正价值,,,,,它能够在海量数据中,,,,,把海量的知识消化成了自己的见识和学问。。。。。。。。这种对世界的洞察力,,,,,也是我们要钻营的终极智能之一。。。。。。。。 J-Space 这类 Harness 工具,,,,,刚好在这个层面最无力。。。。。。。。它能够优化搜索蹊径、规范挪用体式,,,,,但它没法凭空赋予幼模型更高维的抽象综合能力。。。。。。。。 大模型由于有全局的语义理解和自我纠错能力,,,,,能感知路线是否偏移,,,,,并对部门误差进行建改。。。。。。。。但幼模型自身元认知能力就弱,,,,,再加上它每干一个活儿都要层层转接表部工具,,,,,这种“现学现卖”的模式,,,,,犯错的概率更高。。。。。。。。 在限造 Benchmark、限造提醒词、人为筛选样本的前提下,,,,,幼模型+工具能跑出美丽的数字,,,,,但在真正的盛开工作、长工作、吞吐约束、多工具合作的真实场景呢????????内化的本能,,,,,始终比临场查手册更快、更稳、更准。。。。。。。。 2021年时,,,,,Jason Wei 在 Google Brain 还是一个典型的工程派。。。。。。。。他和团队发现,,,,,只有在提醒词中给出逻辑推导的示例,,,,,让大模型学会“把思虑过程一步步写出来”,,,,,模型的推理能力就会大幅提升,,,,,这就是后来扭转行业的“思想链(Chain-of-Thought)”。。。。。。。。 第一个发现是涌现能力。。。。。。。。在他那篇里程碑式的论文《Emergent Abilities of Large Language Models》里,,,,,他将“涌现能力”界说为“An ability is emergent if it is not present in smaller models but is present in larger models.”(即幼模型不具备而大模型具备的能力),,,,,这个界说已成为模型扩大定律钻研的经典基石。。。。。。。。 他用数据证了然,,,,,好多高级能力,,,,,好比三位数加法、多步推理,,,,,在幼模型上无论你怎么调提醒词、怎么加表挂,,,,,正确率都险些是零。。。。。。。。但一旦参数规模??????A杓菽掣隽俳绲,,,,,约莫 100B 量级,,,,,很多高阶能力起头涌现。。。。。。。。 第二个发现是思想链只在大模型上有效。。。。。。。。在思想链论文《Chain-of-Thought Prompting Elicits Reasoning in Large Language Models》中,,,,,好多人只记得思想链能提升推理能力,,,,,却忽略了论文里一个关键结论:在幼模型上使用思想链,,,,,不仅不会提升机能,,,,,反而会由于引出谬误的中央推理步骤而导致成就降落。。。。。。。。 在 OpenAI 期间,,,,,他作为主题成员参加了 o1 系列等前沿推理项主张研发,,,,,对大模型内生能力的价值有了更深的理解。。。。。。。。他在一篇博客里写路:“想让大模型超过人类教员,,,,,就必须用强化进建,,,,,去逼出它内生的高阶思虑能力。。。。。。。。” 他以为大模型使用的是把稳力机造。。。。。。。。它将所有高低文齐全保留在显存中,,,,,每次以“全知视角”沉新审视所有信息。。。。。。。。这对应的正是 Jason 说的大模型的“内化能力” 而幼模型+工具性质上是一种压缩与递归。。。。。。。。它必须把复杂的表部世界塞进工具的输入输出里,,,,,在这种一轮一轮强杏装信息脱水”和往下传递的过程中,,,,,大量高维信息迷失了。。。。。。。。 Omar 指出,,,,,“固然我们在工程上能够用各类‘表挂’来模拟出智能的表象,,,,,但在数学层面上,,,,,靠一轮轮压缩的‘递归’,,,,,始终无法美满模拟‘把稳力机造’对全局的掌控力。。。。。。。。” 不仅如此,,,,,Omar 团队还在其沉磅论文《Machine Studying》中,,,,,沉新界说了什么是 AI 的“专业能力”。。。。。。。。他们以为,,,,,判断一个系统专不专业,,,,,不该看它关卷考试拿了几多分,,,,,要看它用几多推理推算量,,,,,能换来多高的正确率。。。。。。。。 对于新手型 Agent 来说,,,,,它必须靠疯狂搜索、反复试错,,,,,亏损大量 Token 能力勉强答对;;;;;;;;而专家型 Agent 搜索次数少、射中率高,,,,,在低推算预算下就能有很好的阐发。。。。。。。。 从这个视角来看,,,,,幼模型加工具性质上就是一种精美工程,,,,,试图用人类善于的工程链路去添补模型自身容量的不及,,,,,而大模型则是纯正规模定律的成功。。。。。。。。 七十年代专家系吐澉行,,,,,人们相信把人类专家的知识写成规定就能造出智能,,,,,最终走向失败;;;;;;;;九十年代到 2010 年代,,,,,天然说话处置依赖精心设计的特点工程与统计模型,,,,,说话学家们一点点打磨系统机能,,,,,直到深度进建出现,,,,,端到端的大规模训练直接沉构了整个领域;;;;;;;;2010 年代末知识图谱再度鼓起,,,,,人们以为结构化的实体关系能让 AI 真正 “理解” 世界,,,,,了局预训练大模型证明,,,,,从海量数据中自觉学到的隐式知识,,,,,远比人为构建的结构化知识更壮大。。。。。。。。 既然苦涩的教训一再应验,,,,,为什么人们还是一次次地投入 "工程派" 的怀抱????????由于太贵了。。。。。。。。万亿参数模型的训练成本是天文数字,,,,,不是每家公司都能承担得起,,,,,并且每个日常场景也并不都必要顶级智能。。。。。。。。 好比开发者 Matthew Auburn 曾公开暗示,,,,,“对于幼模型,,,,,Harness 就是所佑妆。。。。。。。。他以为在贸易场景里,,,,,90% 的工作只必要 60 分的智能 + 100 分的执行。。。。。。。。性价比才是王路,,,,,顶级智能反而是浪费。。。。。。。。 也有开发者提出了更折中的将来方向:行业最终会走向一种中央状态,,,,,主题认知能力会被拆分为多个十亿级的专家模型协同工作,,,,,就像混合专家(MoE)架构的延长。。。。。。。。 事实上 Omar Khattab 自己就是 Harness 优化的沉要推动者,,,,,他的 DSPy 框架、Meta-Harness 钻研,,,,,性质都是在提升工具链的自动化水平,,,,,他不以为 Harness 能代替模型自身的能力,,,,,却从未否定 Harness 的工程价值。。。。。。。。
吉达结合3-0大胜纳杰马,,,,,伊莱尼赫纳两球,,,,,达尼洛-佩雷拉立功
影院经理们在这场狂欢中扮演了关键角色。8月14日深夜,有影院经理在23点刚拿到拷贝就临时加场,一场卖出29张票。全国日排片从4场飙到600多场,翻了一百五十倍。
持续网络大满贯碎片!陈雨菲2-0横扫乌克兰一姐,,,,,约战十号种子
其后,债权人向吕中楼发出法定追债通知,并于2025年2月13日正式向香港高等法院提交破产申请。2025年4月22日,吕中楼被香港法院裁定破产。
布鲁日前总监:亚马尔将成比西武的大哥哥,,,,,助他很好地融入巴萨
最近刷到杨幂的一个采访片段,她说自己现在每天都很快乐积极,不怕困难,还特别笃定地补了句:“而且我有旺盛的精力可以解决问题。”
意媒:尤文无意免签布罗佐维奇,,,,,目前他们在评估凯西
稍早前,2025年2月19日,阿里云宣布墨西哥数据中心正式开服,这是阿里云在拉美区域的首个数据中心。彼时阿里云方面表示,未来三年,将持续投资建设更多海外基础设施,并加强服务能力建设。
弗里克演讲:行列实力强劲,,,,,我们已筹备好为每一项冠军而战
注:本文相关文字、图片仅为项目信息参考,可能与实际规划设计存在差异,所以不代表对项目信息做出承诺;所有内容最终以政府规划和购房合同约定为准。
以来幼学生聊大模型,,,,,可能比我还溜。。。。。。。。江苏这波AI通识课,,,,,秋季全覆盖
WAIC上,银河通用的重心放在工业领域,从分拣到打螺丝。WRC则明显侧重到了家庭环境中,以呈现其一脑多体策略下的泛化与通用能力。三个场景中,有两个都是居家场景,一个是机器人叠衣服,另一个是物品收纳,机器人的表现中规中矩。另一个是商服的零售场景。
萧敬腾不再隐瞒,,,,,自曝与大14岁老婆的婚后生涯,,,,,告发林有慧的处境
初阶工作坊从建立美育认知开始。参与者以学生身份完整体验《我的情绪小怪兽》《纸巾上的扎染艺术》等课程,在亲身感受中沉淀教学体感。
卫报:英超本赛季将在直播中播放球员与裁判的对话灌音
观众都有“火眼金睛”,讨厌浮夸的假把式,喜欢的都是真功夫,比如《游西湖》中的“吹火”“慢卧鱼”绝技,皆是汗水淬炼而成。年少时,我练习“慢卧鱼”,腿不停地抖、泪不住地流,只觉时间难熬。“慢”蕴藏深意:肢体迟缓具象外界压迫,内核是李慧娘不肯屈服的精神风骨,压与立形成了慢的张力,支撑起饱满的人物形象。对个体而言,练功的煎熬、学戏的执着,积淀成过硬的功底,让表演能为观众“解渴”。用慢功夫磨出拿手好戏,才能对得住观众期许,经得起观众检验。
估值 5 倍暴涨:Web3 老兵若何提前下注 AI
今年4月,韦先生刷到网络上有关亲子关系的社会新闻,结合妻子对家庭的态度,疑虑重重。于是,他找到广州一家鉴定中心,以个人名义委托DNA亲缘鉴定,双胞胎、大女儿样本分批次送检,第一次鉴定后又更换样本复核,四份报告全部指向同一结果,三名女儿均非他亲生。
6740亿!曝OpenAI持续找钱,,,,,拉来英伟达担保贷款
动力方面,增程版搭载1.5T增程器,四驱版前后双电机165kW+180kW,CLTC纯电续航最高355km、综合续航最高1605km,百公里油耗5.9L;纯电版提供81kWh和100kWh两种电池规格,其中Max+长续航版及以上配备100kWh华为巨鲸电池,CLTC续航最高760km。
刘洪建与正大集团、中国移动、中信集团等企业有关掌管人一行座谈
反观现在的广东,他们需要培养年轻球员,球队也堆积了一些不少的年轻球员。就比如黄明依、陈家政、王洪泽等等球员,他们都是值得期待的球员,看看到时候他对于年轻球员的培养会怎么样吧。同时他接近世界篮球的打法,也见识过世界篮球,有希望给到广东攻守体系的全面带动。当然他也没当过多久的主帅,这方面可能是他需要适应的,CBA也会成为他的试金石。
lose my shit 真不是丢掉我的粑粑!真正的意思让人发疯。。。。。。。。。。。。。。。。。。。。。。。。
入选理由:很少有球员的经历比吉布斯-怀特更加跌宕起伏。去年夏天,他原本有望以6000万英镑的身价加盟托特纳姆热刺,并在体检前被出示黄牌……然而,由于面临法律诉讼的威胁,这笔转会最终告吹。他迅速从转会失败的打击中恢复过来,在英超联赛中攻入15球,甚至一度被认为有资格入选英格兰队参加2026年世界杯。然而,今年4月对阵切尔西的比赛中,他遭遇颅骨骨折,这让他的良好势头戛然而止。