视频生成正在变成短视频理解的新入口 #人工智能 #视频生成 #视频理解模型 #大模型 #姜学长
✅ 已完成任务ID: 1843
30秒速读
核心摘要
可执行建议
- 开发视频理解应用可采用三层架构:底层用通用视觉模型,中层设轻量任务接口,上层搭建可靠性校验体系
- 当前生成类视频模型仅深度、分割、位姿等能力成熟,暂不适合落地事件因果、人类意图类复杂任务
高价值评论洞察
- 受众对AI视频理解类内容的需求已经从纯技术科普转向实用落地方向,出现了明确的细分场景诉求
- 本次内容覆盖的前沿生成式视频理解技术点,刚好可以匹配用户提出的视频内容高效处理类的实际需求,存在充足的内容延伸空间
用户关注点
- AI视频理解技术的民用落地场景,尤其是能提升内容处理效率的工具类应用
- 普通用户可直接上手操作的相关AI功能的实现路径
可复用选题/回应建议
- 后续针对性产出AI视频转结构化笔记的相关内容,结合本次介绍的生成式视频理解技术逻辑做拆解
- 后续技术科普内容适当降低纯理论占比,增加普通用户可直接复用的实操类内容比重
代表性评论
- 用户提问能否出一期可将视频提取成笔记文本、便于快速理解内容的AI相关内容,价值是直接反馈了普通用户对前沿视频理解技术的真实使用诉求,为后续内容选题提供了明确的用户导向参考。
标签与备注
标签
备注
暂无备注
转录文本
如果让你开发一个视频理解应用,你会怎么去做?比如说做一套健身动作的分析系统,怎么确定今天丢掉的这个信息,明天会不会突然变得重要?传统方案通常是先去检测人体,再去提取我们的关键点,然后把连续的动作去切成片段,再判断这是深蹲、跳跃还是俯卧撑。整个过程本质上是在不断的去做减法:背景没用,把它丢掉;纹理没用,把它丢掉。最后一段真实的视频被压缩成了几十个关键点和几条的运动轨迹。这套方法固然很高效,但有一个问题:一个人动作变慢,可能是疲劳,也可能是受伤。同样的整体姿态,如果手里多了一件工具,含义可能就完全不一样。而且传统系统通常是一条很长很长的流水线,整体检测错一点,关键点也跟着错,关键点再去错一点,动作判断可能就会彻底的跑偏。所以理解世界一定要从做减法开始吗?Google DeepMind最近提出了叫做GenCapture的方案,给出了一条相反的路线:先让一个视频生成模型尽可能去完整的学习世界,再把它内部已经拥有的知识给读取出来。这篇论文叫做《Generative Models as General Purpose Visual Learners》,研究团队把预训练的文生视频模型改造成了一个通用的视频的理解系统。过去我们总以为训练是在向模型去灌输知识,但基础模型时代的训练越来越像是在安装一个知识的读取器。未来的视频理解可能不再是为每个问题单独的去制造一件工具,而是先建立一个理解世界的底座,再去为不同的问题去设计接口。输入同样的视频,告诉他输出深度,他就生成逐帧的深度图。告诉他分割正在移动的人,他就输出了分割结果。然后告诉他预测三维的关键点,它又能还原人体姿态。为什么说视频生成模型能够去做理解任务?因为想生成一段连续的可信的视频,模型不能只会去画画。他必须知道物体的三维结构,知道相机移动之后画面会怎么去变化,也要知道下一个动作发生以后,下一秒大概率会出现什么。换句话说,生成视频本身就是一道高度压缩的世界建模题。语言模型通过预测下一个词,学会了语言知识,甚至推理。视频生成模型则是通过预测画面如何的去变化,学会了空间,学会了运动,学会了物理规律。关键点任务则通过额外的token输出坐标。这背后有一个很重要的变化,就是过去定义新任务,往往要修改网络结构和损失函数。未来定义新任务可能真的更多的是在设计提示词、数据格式和输出接口。论文中更有意思的是模型的泛化能力。它的后训练数据主要来自于合成的人体视频,却能处理真实世界里的多人的场景,甚至把能力迁移到了动物和机器人的身上。这些知识或许很早就在大规模的视频生成预训练中形成了,后续人做的只是去教模型,用深度图、分割图或者关键点,把已有的知识给它表达出来。如果今天让我再去开发视频理解应用,我不会去立刻搭建十几个串联模块,也不会从头去训练一个百亿的参数的模型。我会把系统分成三层:第一层是尽可能的去保留原始信息的通用视觉模型,负责理解人物和物体、空间和运动。第二层是轻量级的任务接口,用少量的行业数据教模型输出我们需要的格式。比如说工厂的缺陷、运动姿态或者机器人可操作的区域。第三层就是可靠性的系统,包括执行度评估、持续的一致性校验、业务规则和人工的复核。因为通用不等于可靠,会生成,也不代表真正理解。目前验证最充分的仍然是深度、分割、位姿和关键点等结构感知的能力。至于事件为什么会发生、人的意图是什么,他还没有去给出完整答案。所以生成即理解并不是一个已经成立的等式。更准确的说,生成式预训练让模型拥有一套高密度的世界知识。理解是我们能不能把这些知识稳定准确的读取出来。到那个时候,真正稀缺的不是模型了,而是另一种能力。就是你能不能向这个世界模型提出一个足够好的问题。 抖音