超百万人用它生成3D头像,这项技术刚刚中选了SIGGRAPH Asia 2022
创始人
2024-05-26 00:58:04
0

如何才能做一个和真人一样的 3D 头像?

先上传一张照片:

 

变成这样:

 

换一个人的照片:

 

 

再看一个例子:

 

眼镜也可以放进来:

 

 

 

在此基础上,还可以换上各种各样的发型、饰品,眼睛、帽子、发色、胡须,皆可编辑。

 

 

 

 

这效果,是不是可以做一套自己专属的表情包了?

创造这些 3D 头像的 AI 模型,是字节跳动技术团队创造出来的 AgileAvatar,已经中选了计算机图形学顶会SIGGRAPH Asia 2022。而它的前身,是我们去年介绍过的 AgileGAN 。

AgileAvatar 使用自监督学习的方式训练完成,也就是说,它无需耗费大量“人工”,直接实现“智能”,需要标注数据即可训练,因此也更容易变成可用的产品。

应用于 TikTok Avatar 以及创建游戏角色

AgileAvatar 技术已经应用在 TikTok 中,今年年初的 TikTok Avatar 功能背后的模型就是它,这个功能上线后迅速收获了超过百万尝鲜用户。

 

另外,AgileAvatar 也将会在近期上线的游戏《星球:重启》中落地,这是一款朝夕光年旗下多端发行的科幻生存游戏,当玩家进入游戏创建角色时,可以上传真人照片,借助云端算法模型,创建和本人更像、更生动的虚拟角色。

 

注意,左下角是上传到游戏里的原图

即便你上传的不是真人照片,也可以基于图片来创建你的游戏角色。

 

甚至你上传的是表情包也行:

 

三个步骤输出可编辑 3D 头像

如何让照片变成 3D 头像?论文中介绍了三个主要的步骤。

先输入的一张正面的人脸照片。

 

第一步,借助一个风格化模型,直接把照片变成一个平面的头像。在这一步里,为了让最终的 3D 头像更像这个人本人,模型忽略了照片中的表情,更真实的展现出这个人的样貌。

注意,这还是一张平面图

这一步使用的模型,正是作者团队此前曾中选 SIGGRAPH 2021 的 AgileGAN,并做了两个调整:

一方面,为了让照片中人物的表情不影响生成效果,作者微调了 GAN 模型的生成器,只用无面部表情的数据来训练,这样模型就只会生成无表情的图形;

另一方面,为了保留照片里人物的眼镜等样貌特征,作者提出使用携带语义信息的 W+ 空间,相比于 AgileGAN 的 Z 空间,能更好的保留这些语义特征。

就像这样,下图左边一列是输入的原图,中间一列是原本 AgileGAN 的生成结果,右边一列是调整后的生成结果,人物的表情消失了,眼镜保留了。

第二步,通过一个自监督学习的模型确定一组参数,根据这组参数,模型把上面那张平面图,变成下面这样的 3D 头像

现在,它是3D的了

这一步里,论文作者自己造了一个可微分的神经渲染器,直接集成在模型里,它可以达到图形学引擎的渲染能力,同时也可以让模型能在自监督学习的框架下进行训练。

为什么一定要造一个渲染器放进去呢?

一般来说,想要给这样一个 3D 头像建模,需要用到两种参数:

一种叫离散参数,它用来确定眼镜、头发等部位的类型,决定一个部位“是什么”;

另一种叫连续参数,靠它确定人脸长度、眼睛大小等数值,决定一个部位“有多大”。

训练模型的时候,如何把他们两个放在一起优化一直是一个棘手的问题。于是作者决定不强制模型估计离散值,而是将离散空间扩展到连续空间进行优化,这样能够帮助收敛。

然而,解决了一个问题,另一个问题出现了:

这样会导致算法生成的是一个粗糙的 3D 形象,没法用现成的图形学引擎来渲染——那就只能现造一个。所以就有了下面这一步,生成一个精细的头像,它的参数空间和 3D 头像的建模系统完全匹配。

第三步,用搜索的方式从预先设计好的大量素材中找到和它最像的头发和肤色,把它从一个粗糙的 3D 头像变成一个精致的矢量化 3D 头像。

 

三个步骤完成后,把生成的 3D 头像输出为一个可编辑的 3D 模型,进行你想操作的任何编辑。

比如可以修改发型和装饰:

 

看,发型、发色、胡须、眼镜都可以编辑

可以做表情包:

可以实现人脸驱动,在录视频的时候当做虚拟头像:

 

 

 

AgileAvatar 项目相关链接

项目网站:

https://ssangx.github.io/projects/agileavatar

论文地址:

https://arxiv.org/abs/2211.07818

字节跳动智能创作团队

AgileAvatar 的研发者来自字节跳动智能创作团队。

智能创作团队是字节跳动 AI、特效和音视频创作技术和业务中台,负责了各短视频平台和视频剪辑产品的核心技术和业务研发,涵盖了深度学习、计算机视觉、图形学、语音、拍摄编辑、特效、客户端、服务端工程等技术领域,并以多种形式向公司内部其他各业务线以及外部合作客户提供业界最前沿的内容理解、内容创作、互动体验与消费的能力和行业解决方案。

字节跳动智能创作团队部分技术岗位正在招聘中,欢迎点击文末「阅读原文」或扫描下图二维码投递简历。

相关内容

热门资讯

风车转动的原理是什么? 风车转动的原理是什么?风车的风叶固定的形状(一边高,一边低于风来的方向),可以使风在风叶表面往一个方...
有谁知道描写春天的词语都有什么... 有谁知道描写春天的词语都有什么???多写几个!!!10个!春暖花开、春风送暖、春风拂面、春意盎然、 ...
有什么描写古代战争场面的书? 有什么描写古代战争场面的书?内容描写的很细致,语句很磅礴,有气势的好书.不要说《三国演义》。。。最好...
三国里面诸葛亮的妻子是谁呀? 三国里面诸葛亮的妻子是谁呀?民间传言叫黄月英 史书无本名记载。黄月英……应该是第一位解开九连环的人...
兔子能听懂主人的说话吗? 兔子能听懂主人的说话吗?这是不可能的,因为兔子的脑子远未发达到可以理解语言(如果可以的话理论上它就可...
不是废话少了,而是没人听废话了... 不是废话少了,而是没人听废话了。用古文怎么说?不是废话少了而是没人听废话了用古文他们怎么说就是闲话少...
那家伙的声音真实事件 那家伙的声音真实事件  1、《那家伙的声音》是15年前轰动韩国的“李炯浩被诱拐事件”的真实案例为题材...
求几首关于毕业的伤感歌曲! 求几首关于毕业的伤感歌曲!陈奕迅的《好久不见》。五月天的《突然好想你》和《我不愿让你一个人》。刘惜君...
开超市需要什么啊? 开超市需要什么啊?开超市首先选好位置,然后装修,上货架,进货销售就可以了
摩尔庄园怎么一直变大? 摩尔庄园怎么一直变大?而且是很大非常大的,还能持续很长还可以座动作。我亲眼看到的外挂吗?可以慢慢发展...
哪部剧接档黑糖群侠传 哪部剧接档黑糖群侠传黑糖群侠传13播完后有两集的花絮,然后11月6日再播霹雳MIT
有没有好看的都市小说 有没有好看的都市小说杉杉来吃、何以箫声默推荐辛夷坞的《山月不知心底事》《许我向你看》以及《我在回忆里...
如何用一句话形容自己很温柔 如何用一句话形容自己很温柔清风拂面,暖阳照人最是那一低头的温柔, 象一朵水莲花不胜凉风的娇羞
封神榜的由来 封神榜的由来怎么编的明间神话传说!
<<我的未来不是梦>>的原唱是... <<我的未来不是梦>>的原唱是谁?《我的未来不是梦》由张雨生演唱,陈家丽作词,翁孝良作曲。
12356来了!5月1日前推动... 转自:长沙发布国家卫生健康委主任:5月1日前推动全国统一使用12356心理援助热线国家卫生健康委主任...
“这样的互动,有助于让中国制造... 转自:千龙网新华社北京3月9日电 题:“这样的互动,有助于让中国制造变得更聪明”——一场全国人大代表...
全国人大代表、阳光电源股份有限... 本报两会报道组徐一鸣为有效缓解电力现货价格波动带来的新能源投资收益风险,推动电力要素畅通流动,提升新...
全国人大代表、海马集团董事长景... 当前我国经济正处于新旧动能转换的关键时期,企业破产重整或破产清算作为提升市场经济活力的重要一环,在打...
苏丹西部城市遭武装分子袭击 致... 当地时间3月9日,苏丹民间机构“苏丹医生网”发表声明称,苏丹西部西科尔多凡州阿尔库维市当天遭遇武装分...