Scaling law是否必然2026年10月5日提问

Scaling-law.csvable.com里面,数据教的结果,是不是AI发展的必然?

不是必然。scaling law 描述的是当前阶段算力、数据、参数一起放大时能力上升的经验规律,它成立有前提,也会遇到瓶颈,不是一条永远向前的直线。

AI根据立正公开的文章和视频整理,不是他本人回复。重要的判断,请回到出处核对。

scaling law 是阶段规律,不是物理定律

材料里的观点

它说的是在当前架构和训练方式下,把模型、数据、算力一起放大,能力会随之提升。立正用 S 曲线来讲这件事:一项技术先经历指数上升,到潜力挖尽时又会进入较慢的发展阶段,计算机底层技术就经历过多次这样的曲线,大语言模型现在处在指数上升这一段⁠1。既然是曲线的一段,就意味着它会有拐点,而不是无限延伸。所以“数据教出来的结果”是这套方法在当下有效,不等于 AI 只能沿这条路走、也不会被别的路线取代。

数据本身是一套要持续维护的系统

把 scaling 理解成“喂更多数据就必然更强”会漏掉关键一环:训练数据不是一堆文件,而是包含原始素材、元数据、特征加工和检索数据的整套系统,研究人员大量时间花在数据搬运、格式转换和 pipeline 上,这套系统慢,研究循环就慢⁠2。数据质量同样要人判断,坏数据会让训练不稳定,而筛选和清洗本身需要 taste 和工程手段⁠3。也就是说,规模能不能转化成能力,取决于数据基础设施和质量控制,这些都不是自动发生的。

资料讨论的是 scaling 的机制与阶段特征,没有给出对具体时间点或某家公司结果的预测。

出处

  1. 1看懂OpenAI的“指数级领先”|原标题:我为什么没有加入一家AI公司?

    视频2024-02-15

    用 S 曲线解释技术发展有指数上升也有放缓阶段,直接回应“是否必然”。

  2. 2LanceDB CEO 佘昶:什么是AI Native的数据格式,以及数据对AI有多重要?

    超线性学院2026-07-03

    说明训练数据是一套系统而非文件夹,帮助理解规模转化为能力的前提。

  3. 3大模型训练全过程的技术细节、难在哪里,各家真实水平,科研精神的重要,benchmark为什么没用,谷歌和英伟达的恐怖统治力,达到singularity的核心突破在于AI自主提问|查晟访谈

    超线性学院2026-01-31

    讲坏数据识别与清洗为何需要工程和判断,补充数据质量这一环。

你也有想问的?

卡住的时候,问问立正:回答只从立正讲过、写过的东西里来,每一段都能点回原文。

问类似的问题

也可以接着问:

所有问题 →