我在互联网大厂做的data agent到底是什么 #ai #青年创作者成长计划

已完成

任务ID: 1799

30秒速读

核心摘要

预计 90 秒读完

本期结合大厂实践,科普Data Agent的定义、分级标准与行业落地现状。

清大、人大、港科大联合发布的相关论文给出Data Agent统一行业分级标准,参考自动驾驶划分为L0到L5共6个层级
当前市面多数Data Agent产品仅达L1水平,少数团队做到L2,L3尚处前沿探索阶段,L4、L5暂无落地产品
该论文团队已在GitHub开源可本地部署的L3级Data Agent及配套小模型,相关资料可在博主粉丝圈获取

可执行建议

  • 相关从业者可参照论文分级标准,准确判断各类Data Agent产品的实际能力层级
  • 感兴趣的用户可前往GitHub或博主粉丝圈,获取对应开源项目与论文配套资源

高价值评论洞察

  • 多位用户明确表达对视频配套干货资源的获取诉求,精准受众匹配度高
  • 有行业相关用户提出对L4/L5级Data Agent落地形态的不同观点,补充了大模型自研迭代的新视角
  • 有用户直接指出视频收音存在问题,属于可快速优化的制作瑕疵

用户关注点

  • Data Agent相关论文、开源项目、PPT等配套资料的获取渠道
  • 高等级(L4/L5)Data Agent的实际落地可能性与形态
  • 知识类视频的音画观看体验

可复用选题/回应建议

  • 置顶评论统一说明粉丝群加入方式、资源获取路径,同步PPT给有需求的用户
  • 后续可产出专门探讨L4/L5级Data Agent落地路径的内容,回应用户提出的GPT、Claude自研迭代相关观点
  • 调试收音设备,优化后续视频的音频体验

代表性评论

  1. 两条高重合度评论询问“怎么加粉丝群,获取论文和github链接”,直接反映精准受众对干货资源的强需求,可引导私域沉淀
  2. 用户评论“绝对干货,只是,我在想,您这个麦克风是不是没收到音?”,直观指出视频制作的硬件问题,可快速优化提升内容观感

基本信息

2026/7/28 16:50:00

标签与备注

标签

Data Agent科普AI数据分析AI分级标准大厂AI实践开源AI项目大模型落地

备注

暂无备注

转录文本

好的,朋友们,本期视频讲的是目前企业AI落地的一个最常用的场景:数据分析Agent,也是我目前在互联网大厂正在做的项目。 今天我会稍微结合我的项目,来好好讲一下这一篇由清华大学、人民大学和港科大一起完成的论文,叫做《Data Agents: Levels, State of the Art, and Open Problems》。 目前市面上有非常多的宣传词来形容分析AI,比如智能问数、AI分析师、AI数据科学家。 然后这些东西被统一称之为Data Agent,但是这个事情比较tricky的地方就在于,你可以想象它把自行车、摩托车、燃油车、新能源车都统一称之为车。 那所以你在这些宣传的背后,就没有办法看清它们之间的区别在哪。 所以Data Agent之间的区别,在这篇论文里面给出了一个明确的标准,我认为也是目前Data Agent的唯一的一个行业标准。 大致就是什么“一句话生成洞察”,一句话完成分析,是什么全自动的数据科学家,然后需要人的监管。 但实际上呢,可能它和你现在用豆包去帮你做一些数据分析其实是一样的。 你把问题给它,它给你一个答案,你把表名称、字段名称给它,然后它把SQL给你,你自己去跑,自己去看数据。 这篇论文像汽车自动驾驶一样,把当前的data agent进行分类,从L0到L5。 简单来说,data agent一共分为三类:第一类把AI当参谋,第二类AI是熟练的工人,第三类AI成为了项目经理。 首先我们要说的是什么是data agent?简单来说,data agent就是用大模型去编排数据,然后配合AI完成配置、规约、清洗、集成、探索、分析等数据任务。 这个系统就叫做data agent。论文当中也给出了一个公式:在环境里对原始数据用对应的模型、面向对应的任务,最终产出对应的结果,这条完整的链路就叫做data agent。 那data agent和我们平时使用的Codex、Cloud Code这些agent的区别在哪呢?大家可以看一下这张表,里面介绍得也比较清晰。 简单来说,我们日常使用的这些通用agent,像Codex、Cloud Code这类,都需要人去串联所有的节点、所有的模块,但是对于data agent来说,它可以自主串联数据分析当中的重要模块。 人只需要在关键的节点去做出审核检查,所以Data Agent的难点就在于,它必须在真实的环境里面可以长期干活,经得起质疑,可以复现,可以追责。 接下来讲一下这篇文章的讨论重点,就是Data Agent的分类,首先就是L0。L0其实就是我们可能两三年前的那种数据分析方式:数据自己获取,自己清洗,自己分析,结论自己给出,方向自己找。 L1其实也是目前大部分人的一种使用方式,你可以理解为就是你目前使用豆包或者DeepSeek的那种交互方式。 比方说在数据获取的时候,你把表名、字段名给它,然后让它帮你写code,你拿到数据之后把数据给它,让它帮你去看趋势,做一些简单的分析。 接下来就是L2。L2相比L1其实是有一个比较大的跃迁,因为在L1的时候AI就只是动动嘴, 但是到了L2,它可以连上知识库,连上你的数据库,然后帮你去跑查询,去看报错,然后帮你改code。 最终帮你完成分析,但是整条链路先干什么、后干什么、怎么干,这些都是由人来决定的。 打个比方,就好像做饭,你定好了先洗菜,再下锅,再放调料,最后装盘。 L3相比L2,就相当于从一个熟练的数据分析师变成了一个真正的项目经理。你把目标告诉他,他帮你去进行拆分,第一步怎么干,第二步怎么干,他去决定数据是否可信,是否需要清洗,是否需要从别的地方获取数据才能完成你的目标,而你只负责审批和验收。 所以L2到L3其实是目前DataAgent面临的真正最难的地方,因为这里面难点有四个。第一,模型自己排顺序会很难,因为真实世界的任务是千变万化的,有时候可能你是需要去先拆分城市,那可能对于另一个任务来说,可能就先去拆分渠道。 第二个难点,错误会连锁传染,你前一步洗数据的时候发生的错误,可能到了你做数据分析的时候,这个错误它会显现。 那么这个时候Agent它不一定能够发现真正的错误原因在哪,它不一定知道真正的原因就是数据质量。 第三个难点就是世界一直在变,在真实的环境当中表结构可能会变,字段也有可能会变,甚至业务口径都可能会变,你昨天能跑得通的流程,今天可能就突然失效了。 第四个难点,就是安全护栏,其实人目前对于AI给出的结论是没有办法做到无条件相信的,因为在真实的场景当中,任何的结论、决策都是需要负责的。 Agent它只是一个工具,如果出了任何问题,这一部分责任还是要由人来承担的。 L4和L5就属于目前市面上完全没有见过的状态了。L4属于高度自主,它就像是一个自己值班的数据管家,你不需要每次下命令,它自己盯着,数据哪有问题,结论是不是偏移,分析是不是到位,你可以把它想象成就是你们小区的物业,它自己巡查,发现了问题,它自己去修、自己整改。L5就是完全自主,这个就属于比较美好的愿景,它不只是会用现场的工具,它还能想出一些新的方法,它自己去迭代升级,设计新的实验,甚至能够做到反哺数据库。 目前其实市面上大多数的产品都还停留在L1的阶段,只有少数的团队能够凭借比较扎实的基础做到L2的水平。 然后当前的L3也还是属于比较前沿的探索阶段,大部分的人和公司也只能做到L2.5,还是达不到标准的L3水平。 所以看到这里,不管你是一个企业主,还是你将来要做任何Data Agent相关的东西,你都可以最起码先判断出,OK,我面对的这个东西是达到了一个什么样的水平,是L2还是L3。 同时写这篇论文的团队,他们也在GitHub开源了一个L3水平的Data Agent,它不仅仅是一个Agent,里边也内置了一个非常小的、可以本地部署的模型。 他们开源的这个模型,我觉得对于大家有非常大的参考意义,所以大家如果感兴趣,可以到GitHub上面去看一下这个Agent。 同时它附带的那个模型,我觉得也非常有参考价值,需要论文、原文或者相关配套资源的朋友可以到粉丝圈获取。本期视频到此结束,谢谢大家。

任务状态

当前状态 已完成
重试次数0
创建时间2026/7/29 08:32:07
更新时间2026/7/29 08:39:46
完成时间2026/7/29 08:39:46

技术信息

任务IDtask_1785285127861150648_46KkEqcU
字幕文件已生成
重新分析

想分析自己的视频?

注册即送 100 积分,可用于视频总结、字幕提取和内容洞察。

免费注册
返回任务列表
我在互联网大厂做的data agent到底是什么 #ai #青年创作者成长计划 - AI视频分析案例