Posts by Tags

3d-gaussian-splatting

4d-reconstruction

SD3

agentic-ai

algorithm

audio-driven-video

audio-video

audio-visual

autoregressive-generation

autoregressive-video

avatar

Stable Video-Driven Portraits

发布时间:

[Paper Reading]:Stable Video-Driven Portraits — 基于 DiT 的高保真视频驱动人像生成

camera-control

code-agent

computer-vision

controllable-generation

cvpr-2026

deeplearning

moco 论文摘要

发布时间:

MoCo: Momentum Contrast for Unsupervised Visual Representation Learning

diffusion

Stable Video-Driven Portraits

发布时间:

[Paper Reading]:Stable Video-Driven Portraits — 基于 DiT 的高保真视频驱动人像生成

diffusion-language-models

diffusion-transformer

Stable Video-Driven Portraits

发布时间:

[Paper Reading]:Stable Video-Driven Portraits — 基于 DiT 的高保真视频驱动人像生成

digital-human

GaussianEmoTalker 深读:用 3D Gaussian 做实时情绪说话头像

发布时间:

Recommended citation: Yang et al., GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting. arXiv:2607.00959v1, 2026.
Download Paper

Project

AvatarForcing 精读:一步流式 diffusion 如何稳住分钟级 talking avatar

发布时间:

Recommended citation: Cui et al., AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising. arXiv:2603.14331, 2026.
Download Paper

Project | Code

dpo

emotional-avatar

GaussianEmoTalker 深读:用 3D Gaussian 做实时情绪说话头像

发布时间:

Recommended citation: Yang et al., GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting. arXiv:2607.00959v1, 2026.
Download Paper

Project

facial-animation

flow-matching

flux

gaussian-splatting

GaussianEmoTalker 深读:用 3D Gaussian 做实时情绪说话头像

发布时间:

Recommended citation: Yang et al., GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting. arXiv:2607.00959v1, 2026.
Download Paper

Project

generation-acceleration

generative-ai

generative-modeling

grpo

image-editing

image-fusion

image-generation

image-restoration

language-modeling

latent-decoding

latent-diffusion

llm

math

model-card

model-scaling

multimodal

on-policy-distillation

paper-close-reading

GaussianEmoTalker 深读:用 3D Gaussian 做实时情绪说话头像

发布时间:

Recommended citation: Yang et al., GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting. arXiv:2607.00959v1, 2026.
Download Paper

Project

AvatarForcing 精读:一步流式 diffusion 如何稳住分钟级 talking avatar

发布时间:

Recommended citation: Cui et al., AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising. arXiv:2603.14331, 2026.
Download Paper

Project | Code

paper-reading

pixel-generation

point-tracking

reference-guidance

reinforcement-learning

representation-autoencoder

representation-learning

moco 论文摘要

发布时间:

MoCo: Momentum Contrast for Unsupervised Visual Representation Learning

robotics

semantic-first-diffusion

software-engineering

streaming

streaming-diffusion

AvatarForcing 精读:一步流式 diffusion 如何稳住分钟级 talking avatar

发布时间:

Recommended citation: Cui et al., AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising. arXiv:2603.14331, 2026.
Download Paper

Project | Code

style-transfer

super-resolution

talking-avatar

AvatarForcing 精读:一步流式 diffusion 如何稳住分钟级 talking avatar

发布时间:

Recommended citation: Cui et al., AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising. arXiv:2603.14331, 2026.
Download Paper

Project | Code

talking-head

GaussianEmoTalker 深读:用 3D Gaussian 做实时情绪说话头像

发布时间:

Recommended citation: Yang et al., GaussianEmoTalker: Real-Time Emotional Talking Head Synthesis with Audio-Driven and Blendshape-Based 3D Gaussian Splatting. arXiv:2607.00959v1, 2026.
Download Paper

Project

text-to-image

training-stability

video-generation

AvatarForcing 精读:一步流式 diffusion 如何稳住分钟级 talking avatar

发布时间:

Recommended citation: Cui et al., AvatarForcing: One-Step Streaming Talking Avatars via Local-Future Sliding-Window Denoising. arXiv:2603.14331, 2026.
Download Paper

Project | Code

Stable Video-Driven Portraits

发布时间:

[Paper Reading]:Stable Video-Driven Portraits — 基于 DiT 的高保真视频驱动人像生成

video-geometry

view-synthesis

vision-language

visual-intelligence

wan-streamer

world-model

随笔