返回报告库

AI / Technology

Shap‑E生成条件三维隐式函数

关于这篇论文的三个关键问题

Shap‑E:生成条件三维隐式函数 解决了什么问题?

图片天然是像素网格,音频天然是采样序列;三维资产没有同样统一的固定数组。点云比较好生成,但点数固定,薄缝和细表面也可能丢失。网格适合进入常见三维工具,却很难直接让生成模型稳定地产出拓扑。NeRF 可以从任意视角渲染,却不能直接当普通网格使用。Shap‑E 要解决的正是这个表示选择,而不是单纯提高渲染分辨率。(来源:§1;§2.1–2.2;§3)

Shap‑E:生成条件三维隐式函数 的核心结论有哪些证据?

只做 NeRF 预训练 60 万步时,NeRF PSNR 为 34.5 dB。加入 STF 蒸馏后,NeRF 暂降至 32.9 dB,STF 为 23.9 dB;联合微调后,两者分别升至 35.4 dB 和 31.3 dB。这个过程支持作者的训练顺序,却也暴露出编码器本身会成为细节瓶颈。(来源:§5.1;表 1;图 3)

阅读 Shap‑E:生成条件三维隐式函数 时最需要注意什么局限?

作者让 Shap‑E 与 Point‑E 共享数据、条件方式和基础扩散架构,并比较同为 3 亿参数的模型。文字条件下,Shap‑E 在两种 CLIP R‑Precision 上都更高,延迟约为 13 V100 秒;Point‑E 约为 25 V100 秒。使用完整条件设置时,两者质量接近,Shap‑E 的延迟为 1.0 V100 分钟,Point‑E 为 1.2 分钟。后者还需要额外的上采样扩散模型。(来源:§5.2–5.3;表 2)

今天还可免费读 2 篇新报告订阅 Pro 后无限阅读,并获得每月 10 篇新论文生成额度。升级 Pro