谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1,打破计算机视觉桎梏
最新 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。
最新援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。

但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。
谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。
GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。
GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。

训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。
泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。

性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。

参考
Video Generation Models are General-Purpose Vision Learners
《谷歌 DeepMind 发布 GenCeption:基于阿里 Wan2.1,打破计算机视觉桎梏》转载自互联网,如有侵权,联系我们删除,QQ:369-8522。
相关图文
-
上任仅 3 个月,美国 AI 测试机构负责人克里斯 · 福尔宣布辞职
据路透社 21 日(今天)报道,美国商务部下属 AI 测试机构美国人工智能标准与创新中心再次出现人事变动,中心主任克里斯 · 福尔上任仅 3 个月便宣布辞职。... -
消息称智谱建成大型 AI 数据中心:全部采用国产芯片
据知情人士透露,智谱已开始部分运营这座 1 吉瓦的数据中心。按照这一规模,智谱的数据中心将成为中国 AI 公司所建设的最大规模服务器枢纽之一。... -
国内首款,脑虎科技硬膜下植入式柔性脑机接口进入“绿色通道”
脑虎科技今天(21 日)上午宣布,其自主研发的“植入式脑机接口手部运动功能代偿系统”通过公示,正式进入国家药品监督管理局医疗器械技术审评中心(CMDE)的创新医疗器械特别审查程序。... -
导演陆川称 AI 生成像预制菜,自己正利用 AI 同时推进五部电影筹备
他认为做电影最美妙的部分实际上是“错误”。人类在现场的失控、演员最棒的表演往往来源于失控,这些无法复制的瑕疵才是艺术创作最迷人的地方,而 AI 恰恰可能会抹杀这些错误。#导演陆川称AI生成像预制菜#... -
三体宇宙展望“智子”智能体:有共识、有记忆、有人格,持续陪伴
面对 Agentic AI 时代,三体宇宙分享了关于“智子”智能体的最新设想:一个有共识、有记忆、有人格的智能体形象,让用户面对的不只是技术能力,更是一个能够长期互动、持续陪伴的智能伙伴。...












