AI测试与agent评测是正在变稀缺的方向,但它的价值不在“会跑测试”,而在能定义什么叫可用、判断质量取舍。适合深入,前提是你愿意练判断力,而不只是执行流程。
AI根据立正公开的文章和视频整理,不是他本人回复。重要的判断,请回到出处核对。
测试与评测正从边缘变成关键岗位
材料里的观点在FDE这类把模型能力落到真实业务的岗位里,test和eval被单独点出是一个方向,因为它直接决定产品能不能达到企业级可用,和普通AB测试相比水更深1。招聘时看重的是做过agent building甚至testing,而不只是会用AI工具1。这说明评测不是附属环节,而是把AI系统从玩具推到可依赖的关键一环。不过这段材料来自多人视频、说话人未逐段确认,只能当作方向性信号,不能当成某个人的确定结论。
评测难在判断质量,不在跑通流程
速度和成本容易测,质量最难判断,所以要用自己的业务任务持续建设测试集,先拿最好的模型看清这个任务能达到什么水平,再比较其他方案差多少、快多少、便宜多少2。这意味着评测岗位的核心能力是定义“什么叫好”、设计能反映真实业务的任务,而不是套用现成模板。如果只是照着教程跑一遍评测流程,建模、拆解、验收、诊断这些最要紧的部分都被替你做完了,能力不会真正留下3。
能不能深入,取决于你想练的是判断还是操作
AI推演检验自己是否真的在长能力,可以撤掉帮助、隔一段时间、换一道题再做一遍,看关键判断还在不在4。放到评测上:换一批数据、加一个约束、换一个业务场景,你还能不能重新定义什么叫可用、定位失败原因。如果卡住,说明练的是操作流程;如果还能做,说明判断力在积累。一个可以试的做法是,拿你手上真实的一个AI任务,先自己写下打算怎么评、哪里会出错,再对照实际结果,看你的预判和现实差在哪5。这个差距就是你要练的地方。
关于AI测试岗位的薪资、招聘量、具体公司需求,材料没有覆盖;FDE那期视频是多人对话、说话人未逐段确认,只能作为方向参考。
出处
- 1FDE(Forward Deployed Engineer)是眼下最火的岗位,请一位真正的内行人来全面讲解一下
多人视频里直接提到test和eval是一个方向、关乎产品能否企业级,适合核对评测岗位的定位
- 2从结果确定性到通用智能:和韦晓亮老师聊AI、产品与教育
讲评测为什么要先建测试集、先看质量上限再谈成本,适合理解评测工作的核心难点
- 3学AI的两大误区:找课本(只看不动手),抄作业(依赖tutorial)
说明照教程走流程为什么留不下能力,适合判断自己是在练判断还是练操作
- 4AI替你做出来以后,你还会什么?|哥大客座课程回放
给出撤掉帮助、换题检验是否真学会的方法,适合自测评测能力是否可迁移
- 5假学习的终结
可回到原文核对这部分判断
你也有想问的?
卡住的时候,问问立正:回答只从立正讲过、写过的东西里来,每一段都能点回原文。
问类似的问题也可以接着问:
别人还问了
- 怎么面向AI写文档?有没有具体案例解释一下?是不是写的越多越好?怎么让文档具备足够的泛用性?
面向 AI 写文档,关键不是写得多,而是把判断标准写成 AI 能读到的材料,并按当前任务只加载相关部分。
- 怎么高效爬career ladder?感觉有些比我年纪轻的的确能力比我强,感觉我的职业生涯到顶了怎么办?how to stay driven?
爬梯子快不快,多半不取决于你多努力,而取决于你选没选对赛道、老板和那块能出结果的事;觉得到顶,常常是当前环境的天花板,不是你的。
- 想从零到一成为你, 需要具备哪些核心认知, 执行哪些核心动作.
没有一条“成为某人”的固定路径;可迁移的是三层能力:自己出题、用效率而非忙碌判断方向、以及把想法快速做成可验证的东西。
- share your project 会不会有点子被别人复制的风险?我觉得是有的 所以现在论坛里share的project都是不痛不痒 甚至有点同质的 例如外语学习ai 工具等。真正有价值的project 似乎都没有被公开出来。
复制风险确实存在,但公开分享换来的反馈和连接,往往比被抄走的点子更值钱;真正难复制的不是点子,是你在构建中形成的判断和体感。
- 数据科学、数据分析在AI时代的价值是什么
数据科学的价值不在写模型或做报表,而在把数据变成更好的决策;AI压缩了执行环节,反而放大了判断、归因和把问题翻译成可执行方案的能力。
- 现在在美国做电商的基础设施,仓储和物流给国内的opc提供基础设施,有机会吗?
有机会,但机会不在“美国物流差”本身,而在把国内供应链的灵活性和美国本地履约的碎片化需求接起来;能不能成立取决于你服务的客户是否真愿意为省事付费。