资讯中心

4DAnyone模型仓库逐文件拆解:model.safetensors、Wan2.2 VAE与UMT5-XXL如何协同工作

📅 2026/8/26 15:46:21
4DAnyone模型仓库逐文件拆解:model.safetensors、Wan2.2 VAE与UMT5-XXL如何协同工作
4DAnyone模型仓库逐文件拆解model.safetensors、Wan2.2 VAE与UMT5-XXL如何协同工作【免费下载链接】4DAnyone项目地址: https://ai.gitcode.com/hf_mirrors/AntResearch/4DAnyone4DAnyone 模型仓库是一套单目视频 → 多视角视频 → 4D 人体重建的完整权重集合核心生成模型model.safetensors负责多视角视频生成Wan2.2 VAE 承担视频潜空间压缩UMT5-XXL 编码器把语义信息注入生成过程。本文逐文件拆解 4DAnyone 仓库中每个权重文件的用途与协同关系帮你快速看懂这个 4D 人体重建工具包。 先看清家底4DAnyone 模型仓库目录结构在深入每个文件之前先看一眼仓库全貌4danyone/ # 核心生成权重 ├── model.safetensors # 4DAnyone 主生成模型 ├── smplx_to_goliath70.pt # SMPL-X → Goliath70 关键点回归器 ├── Wan2.2_VAE.pth # Wan2.2 视频 VAE ├── models_t5_umt5-xxl-enc-bf16.pth # UMT5-XXL 文本编码器 └── umt5-xxl/ # UMT5-XXL 分词器4 个配置文件 gvhmr/ # 人体姿态重建四件套 ├── gvhmr_siga24_release.ckpt ├── epoch10-step25000.ckpt ├── vitpose-h-multi-coco.pth └── yolov8x.pt perceptual/ └── imagenet-vgg-verydeep-19-conv.safetensors # VGG-19 感知损失 data/source/pexels/ # 8 个 121 帧示例视频25/30 FPS4K/1080P licenses/ # 各资产对应的许可文本一句话概括分工4danyone/管生成gvhmr/管看懂人perceptual/管质量把关。 model.safetensors整个系统的发动机4danyone/model.safetensors是 4DAnyone 的主生成 checkpoint也是仓库中唯一的一方核心资产Apache-2.0 许可。它的工作是接收人体姿态、外观与语义条件生成环绕人物的多视角视频序列这些多视角结果正是下游 4DGS4D 高斯泼溅重建的输入。选择safetensors格式还有一个实际好处它不做任意代码反序列化加载更安全、更快。 smplx_to_goliath70.pt骨架翻译官4danyone/smplx_to_goliath70.pt是一个稀疏关键点回归器把 SMPL-X 人体骨架的参数映射到 Goliath70MHR70关键点集合相当于在不同人体模型之间做坐标翻译。⚠️ 注意它的混合许可详见仓库LICENSE稀疏支持与回归权重张量Apache-2.0MHR70/Goliath 关键点的名称、顺序与结构 schema源自 Meta Sapiens2遵循 Sapiens2 许可同一文件内两种许可并存再分发时需要分别保留对应声明。 Wan2.2 VAE视频的压缩编解码器4danyone/Wan2.2_VAE.pth来自 Wan2.2-TI2V-5B 的视频 VAE变分自编码器Apache-2.0。它的作用类似视频世界的ZIP 压缩编码把输入视频帧压缩进低维潜空间latent大幅降低计算量生成model.safetensors在这个潜空间里画出新的多视角视频解码再把潜空间结果还原成像素帧没有它直接在像素空间做视频生成会慢得多、显存也扛不住。 UMT5-XXL 编码器 分词器让模型读懂语义UMT5-XXL 这一对文件负责把文本/语义条件转成模型能理解的特征向量文件作用4danyone/models_t5_umt5-xxl-enc-bf16.pthUMT5-XXL 编码器权重bf16 精度源自 Wan2.1-T2V-1.3B4danyone/umt5-xxl/tokenizer.json分词器主配置4danyone/umt5-xxl/spiece.modelSentencePiece 分词表4danyone/umt5-xxl/tokenizer_config.json特殊 token 与分词参数4danyone/umt5-xxl/special_tokens_map.json特殊 token 映射pad、unk 等流水线是文本 → 分词器切 token → 编码器编码成向量 → 作为条件送入生成模型。它和生成模型model.safetensors是上下手关系编码器供料生成模型出活。 gvhmr/ 四件套单目视频的人体姿态重建要生成多视角人物第一步得先把单目视频里的人看懂。gvhmr/目录提供了完整的姿态重建流水线文件上游来源流水线角色许可yolov8x.ptUltralytics YOLOv8① 检测人物位置AGPL-3.0vitpose-h-multi-coco.pthViTPose② 提取 2D 关键点Apache-2.0gvhmr_siga24_release.ckptGVHMR③ 单目视频人体重建研究/非营利epoch10-step25000.ckpt4DHumansHMR2.0a③ 人体重建备选/配合MIT数据流向YOLOv8 框出人 → ViTPose 打关键点 → GVHMR / HMR2.0a 恢复 3D 姿态姿态结果再交给核心生成模型。️ perceptual/VGG-19 感知损失perceptual/imagenet-vgg-verydeep-19-conv.safetensors是 Oxford VGG-19 的卷积层权重CC BY 4.0。它在训练阶段充当审美裁判用真实图像网络提取的特征来衡量生成帧的感知质量比单纯对比像素差值更能反映人眼观感是生成画面更自然的关键一环。⚙️ 协同全景一个视频如何变成4D 任何人把上面的零件串起来端到端流程是这样的输入一段单目视频可用data/source/pexels/里 8 个 121 帧示例视频直接验证gvhmr/四件套提取人物检测、2D 关键点与 3D 姿态smplx_to_goliath70.pt将 SMPL-X 骨架翻译为 Goliath70 关键点UMT5-XXL 分词器 编码器生成语义条件向量model.safetensors在 Wan2.2 VAE 潜空间中生成多视角视频VGG-19 感知损失保障质量多视角视频送入下游 4DGS完成 4D 人体重建⚖️ 许可速查别拿错文件用错场景这是一个多许可仓库没有单一许可覆盖所有文件。快速判断标准一方核心资产model.safetensors、回归张量Apache-2.0gvhmr/gvhmr_siga24_release.ckptGVHMR 研究/非营利许可gvhmr/yolov8x.ptAGPL-3.0商用集成需谨慎评估VGG-19 感知权重CC BY 4.0示例视频Pexels 许可免费使用、无需署名保留来源信息即可完整映射表见仓库根目录的LICENSE各许可全文在licenses/目录下。 如何下载 4DAnyone 模型仓库克隆仓库即可获得全部权重与示例数据git clone https://gitcode.com/hf_mirrors/AntResearch/4DAnyone克隆完成后按本文的分工对照表检查4danyone/、gvhmr/、perceptual/三个目录是否齐全即可开始单目视频 → 4D 人物的完整流程。【免费下载链接】4DAnyone项目地址: https://ai.gitcode.com/hf_mirrors/AntResearch/4DAnyone创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考