谷歌DeepMind新突破:AI视频生成器变身全能视觉分析引擎
创始人
2026-07-21 16:20:05
0

近日,谷歌DeepMind发布了一款名为GenCeption的新型模型,该模型能够将预训练的视频生成器重新用于执行深度估计和分割等经典计算机视觉任务。GenCeption模型的创新之处在于,它打破了传统计算机视觉领域“一个任务一个专用模型”的局限,通过单一模型即可同时完成深度估计、图像分割、3D姿态估计、表面法线预测和相机姿态估计等多项核心视觉任务。

GenCeption模型基于阿里巴巴开源的视频模型Wan2.1系列进行训练,与传统扩散模型相比,它能够在一次前向传播中完成预测,显著提升了视觉任务的处理速度。该模型通过文本提示来指定任务,并能输出深度图、表面法线图、分割掩码等,同时处理相机运动表示。训练数据主要为合成数据,由800个数字人体模型与200段动作捕捉序列组合生成,并在不同背景和镜头角度下通过Blender渲染。

在泛化能力方面,GenCeption虽然主要在单人合成视频上进行训练,但其表现出了处理真实多人视频的能力,并可迁移至动物和类人机器人类别。性能方面,小模型处理81帧视频约需6秒,而参数量为140亿的大模型处理同样长度视频约需10秒。这表明GenCeption在保持高效率的同时,也具备了处理复杂视觉任务的能力。

相关内容

热门资讯

深圳地铁安检登上热搜榜首,记者... 7月20日起,深圳地铁开始实施“进站安检全覆盖”,所有乘客无论是否携带包裹,均须接受过机查验与手持安...
今夏火热出圈!广州塔机器人巡游... 文、图/羊城晚报全媒体记者 李焕坤7月21日,广州塔以一场科技感拉满的“未来舞蹈秀”智能机器人巡游表...
三十载躬耕田野守初心!广州从化... 近日,农业农村部公布2022—2024年度全国农牧渔业丰收奖获奖名单,广州市从化区农业技术推广中心副...
广州→吴川,志愿者们为受助学生... “最近在读什么书、学校里有没有好玩的事、暑假作业写得怎么样……”7月17日至18日,广东公益恤孤助学...
全球媒体聚焦 | 关于中国AI... 美国《商业内幕》网站近日刊文称,中国人工智能企业最新发布的一款开源模型,在多项测试中展现出较强竞争力...
视频丨坚决反对、严正交涉!外交... 7月21日,外交部发言人林剑主持例行记者会。发布会上,中方三次回应中菲有关事宜。菲律宾在仁爱礁蓄意挑...
【理响中国·经济画重点】从“新... 【编者按】从“老三样”到“新三样”,再到“新新三样”,中国外贸正上演一场跨越四十余年的“三级跳”。2...
交通运输部:“十五五”时期我国... 今天,国务院新闻办公室举行“开局起步‘十五五’”系列主题新闻发布会,交通运输部副部长徐成光表示,“十...
【好评中国】硬核新动能遍地开花... 7月20日国新办发布会亮出2026上半年工业经济半年报,一个“新”字贯穿全场。从长征十号乙可控回收火...
青春在理想中闪光丨库尔班大叔后... 天山网-新疆日报记者 张艳芳“70多年前,我的曾外祖父库尔班·吐鲁木怀揣赤诚,一心想骑毛驴上北京看望...