城市猎人英特尔牵头GPU互联新标准!DRM Fabric提案亮相:厂商中立、告别各自为政_我的网站
A | IT之家 7 月 21 日消息,科技媒体 The Decoder 昨日(7 月 20 日)发布博文,报道称谷歌 DeepMind 发布 GenCeption 模型,将预训练的视频生成器重新用于深度估计和分割等经典计算机视觉任务。 
B |
IT之家援引博文介绍,大语言模型在学习预测下一个 Token 的时候,在训练过程中往往需要吸收语法、世界知识和上下文关系等内容。
但是在计算机视觉领域,视觉模型缺少等效的训练方法,主要由专业模型主导,包括用于分割的“Segment Anything”和用于深度估计的“Depth Anything”,每个模型都使用其特定的架构。
谷歌 DeepMind 团队为此提出 GenCeption 模型方案,尝试将一个“生成视频”的 AI 模型逆向改造成一个能“理解世界”的视觉分析引擎。 8月25日消息,英特尔工程师Konstantin Sinyuk近日向Linux内核dri-devel邮件列表提交了一份名为DRM Fabric的RFC(征求意见稿)技术提案。 该提案旨在为Linux内核建立一套厂商中立、协议无关的拓扑基础设施,专门面向GPU与AI加速器的纵向扩展互联场景。
GenCeption 打破了传统计算机视觉“一个任务一个专用模型”的格局,仅凭单一模型就能同时做好深度估计、图像分割、3D 姿态估计、表面法线预测和相机姿态估计等核心视觉任务。
现代GPU和AI加速器越来越多地通过高速互连结构连接在一起。但Linux内核目前缺乏通用的基础设施来报告哪些加速器相互连接、通过哪些端口连接、处于何种状态。 
C | 各家厂商通过各自的驱动接口呈现连接信息,导致拓扑语义由厂商私有驱动定义。
DRM Fabric正是为解决这一问题而生。 
D | 该提案定义了一个清晰的层级模型:结构域→端点→端口→对等节点。各厂商的专属驱动仍保留硬件发现、固件交互的完整控制权,DRM Fabric仅负责呈现加速器的拓扑与控制状态。 在接口选择上,英特尔工程师采用了通用网络链接而非sysfs或Devlink。 
E | 通用网络链接更适配这种多对象、事件驱动的模型,并能复用DRM RAS模块引入的YAML描述式用户态API规范。 此次提交的补丁系列共12个,其中第1至6号补丁构成了完整的只读功能里程碑。 
F |
GenCeption 基于阿里巴巴开源视频模型通义万相 Wan2.1 系列训练,与传统扩散模型需多步去噪不同,GenCeption 在一次前向传播中完成预测,从而提升视觉任务处理速度。即使后续的资源配置功能仍在评审,这部分补丁也可以先行合入主线内核。模型通过文本提示指定任务,可输出深度图、表面法线图、分割掩码,并可处理相机运动表示。第7至12号补丁则新增了面向软件定义结构域的特权级配置能力。 
G |
训练数据以合成为主。论文称,数据集仅包含 7500 段视频,由 800 个数字人体模型与 200 段动作捕捉序列组合生成,再通过 Blender 在不同背景和镜头角度下渲染。 值得一提的是,英特尔工程师在设计DRM Fabric的硬件提供商API时,参考了AMD公开的AMDGPU xGMI实现方案。 尽管目前仅由英特尔工程师完成初始开发,DRM Fabric的设计目标仍是实现厂商中立。
泛化方面,GenCeption 几乎只在单人合成视频上训练,但可处理真实多人视频,也可迁移到动物和类人机器人类别。 
H | 论文称,部分输出细节甚至超过训练时 Blender 渲染结果,可保留猫胡须和单根发丝边缘。此举很可能是在为英特尔即将推出的Crescent Island AI加速器做准备。
【本文结束】如需转载请务必注明出处:
责任编辑:红茶
文章内容举报
。
性能方面,论文给出两组处理时间数据:小模型处理 81 帧视频约需 6 秒;大模型参数量为 140 亿,处理同样长度视频约需 10 秒。
参考。 Current article:http://becyj.xiaqingzhuangdaminnan.cyou/9sr/2hb0c.html Published on:10:51:26
|