Agent非文本表示2026年10月3日提问

技能之外,agent 还缺什么?如果不用文本,有没有更合适的表示方式?输出格式除了文本和 JSON 还有更好的吗?怎么让模型更好地理解信息?

技能之外真正缺的是结构:把判断、边界和“什么算好”显式写出来,比换输出格式更关键。非文本表示(数字、结构化字段、语音)可行,但都受限于模型对信息的组织方式。文本和 JSON 的差别不在格式,而在有没有把结构显式化。

AI根据立正公开的文章和视频整理,不是他本人回复。重要的判断,请回到出处核对。

技能之外,缺的是判断和边界

把 agent 的能力拆成技能(能做什么)之外,真正缺的是:问题怎么组织、判断发生在哪里、哪些可以优化哪些不能碰、以及对这个用户来说“好输出”是什么。这些通常被人类默认省略,模型只能用自己的默认假设填空,于是不同模型会在同一个地方误解你⁠2。所以“技能之外”不是更多技能,而是把隐含的判断显式化。一个具体做法:下次让模型做一件事时,先写清楚“什么算做对了”和“什么绝对不能动”,看它是否还跑偏。

非文本表示可行,但受理解方式限制

如果不用文本,数字、结构化字段、语音都是候选。有实验显示,低质量硬件加高质量模型,语音转文字的效果能超过人耳,把物理世界的噪声直接变成结构化信息⁠12。但另一条线索提醒:当前多模态并不是用本质方式做多模态,文字只是信息密度最高、最容易被学习的模态,图片等模态需要的计算量可能高十倍甚至百倍,而且文字和图片是否有本质区别仍是开放问题⁠5。所以换格式能解决一部分问题,但换不掉“模型如何理解”这个底层约束。

输出格式不是瓶颈,结构才是

文本和 JSON 的差别,本质是“有没有稳定参照点、硬边界、思考层和执行层的分离”。用段落时,模型每次都要重新推断你的结构,推断会漂移,小误解会累积⁠2。JSON 之所以有效,不是因为它是 JSON,而是因为它把结构显式化了。所以与其问“有没有比 text/json 更好的输出”,不如问“我有没有把判断和边界写进结构里”。如果只是把同样的模糊内容换成 JSON,误解不会减少。

关于“非文本表示”和“多模态本质”的讨论来自未逐段确认说话人的视频字幕,具体归属需核对原视频;语音实验来自第三方社区文章,不代表立正立场。

出处

  1. 2How I Learned to Make Different LLMs Understand How I Think — by Packaging My Thinking as JSON

    超线性学院2026-01-29

    解释为什么结构比格式更重要,以及判断和边界如何显式化

  2. 5生成式AI真正的机会怎么找?

    会员视频2023-12-15

    说明多模态理解的底层限制和文字与其他模态的关系

  3. 12The Real World as an AI-Callable API

    超线性学院2026-01-07

    提供非文本模态(语音)转结构化信息的实际案例

你也有想问的?

卡住的时候,问问立正:它会从立正六年、四百多期视频(一半是会员视频)、两百多篇文章和《真本事》整门课里找出相关内容,整理成回答,每段都标明出处。

问类似的问题

也可以接着问:

所有问题 →