破产姐妹
谷歌 DeepMind 发布 GenCeption:打破计算机视觉桎梏_我的网站

一 | IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。

二 |
[ 海外谍照] 近日,我们从相关渠道获取到了纯电动版宝马M3(参数|询价)的内饰谍照。
IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。
但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。
谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。新车作为纯电版本车型,其量产车型预计将被命名为iM3,会搭载双电机,最大功率预计可达700马力。据悉,新车将于2027年3月份正式推出。
友情提示:如果您有新车谍照/新车爆料,请点击编辑头像(仅限App)私信给我们,期待您的来信。
从此次曝光的谍照来看,新车内饰看上去依旧是处于原型车状态,但不难发现,新车依旧配备了一个中控多媒体悬浮屏,宝马的贯穿式视域桥也将会配备,新车方向盘也采用了最新研发的悬浮设计,非常具有特色。
GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。根据最新谍照来看,新车的前后轮眉采用了宽体设计,整体前脸样貌依旧是NK时代的全新造型,有意思的是,根据相关消息,新车的整体车重将会达到2675公斤。
三 |
GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。
细节上,新的测试车采用了米其林PSS5轮胎,是一款全新型号的运动型轮胎,后轮尺寸为295/35 R20,相当夸张。
四 | 此外,新车的充电口采用了上翻设计,具有电动开关功能。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。
训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。

五 |
泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。(文/ 毕业)
。
性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。

六 |
参考。
Current article:http://t4sj.linlangdouwaqiexusan.bond/b27/yd0dz.html
Published on:02:24:42