ArcFace
PulseAugur coverage of ArcFace — every cluster mentioning ArcFace across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
人形机器人头部集成AI,实现自然接待交互
研究人员开发了一款用于接待员角色的人形机器人头部,旨在改善自然人机交互。该头部具有21个自由度,可实现逼真的表情,并采用硅胶皮肤,外观酷似真人。该系统集成了多种AI模型,用于面部识别(SCRFD、ArcFace、ByteTrack)和自然语言处理(Llama、Whisper),可实现实时操作和人脸重识别。用户研究表明,其拟人化得分高达4.13分(满分5分)。
-
MGFace 管道提高了带口罩人脸识别的准确性
研究人员开发了 MGFace,这是一种新颖的人脸识别管道,可提高人脸被口罩部分遮挡时的准确性。MGFace 通过首先检测是否存在口罩来智能地路由相似性计算。对于未遮挡的人脸,它使用全局嵌入匹配;对于遮挡的人脸,它激活一个感知掩码的补丁级重新排序机制。这种方法提高了识别准确性,特别是对于带口罩的人脸,同时与现有方法相比显著降低了计算开销。
-
MGFace 管道提高了带口罩人脸识别的准确性
研究人员开发了 MGFace,一种新的人脸识别管道,可提高带口罩人脸的准确性。该系统根据人脸是否戴有口罩来有条件地路由相似性计算,仅在必要时应用感知掩码的重新排序方法。这种方法保持了高识别准确性,在 LFW-Mask 数据集上使用 ArcFace 主干实现了超过 90% 的准确率,同时与现有方法相比显著减少了查询时间。
-
LILAC框架实现扩散模型的多概念定制
研究人员推出了一种新颖的文本到图像扩散模型个性化框架LILAC。LILAC通过在推理时组合独立训练的低秩适配器来解决渲染多个特定主体的连贯性挑战,避免了参数级别的干扰和联合再训练。该方法随概念数量线性扩展,并且与骨干网络无关。在实验中,LILAC应用于Qwen-Image-Edit,在正交适配协议下,其ArcFace检测率显著高于原始正交适配器,达到了0.861,而原始方法为0.745。
-
新的 LoRA 模型在参考到视频生成中保留身份
一个名为 Alissonerdx/LTX-Best-Face-ID 的新 LoRA 模型已发布,适用于 LTX-2.3,支持身份保留的参考到视频生成。该模型允许用户输入一个人的参考照片和文本提示,以创建保持该个体身份的视频。它在训练过程中利用了重叠参考条件、TASS-RoPE 和 ArcFace 身份损失等技术来实现准确的身份迁移。
-
新的Q-Margin损失通过概率边距增强生物识别
研究人员推出了一种新颖的$\alpha$-散度损失函数Q-Margin,旨在改进生物识别系统。与将几何惩罚应用于logits的传统方法不同,这种新损失函数将一个原则性的概率边距直接编码到先验概率中。Q-Margin旨在鼓励区分性嵌入同时保持稀疏性,从而在人脸和说话人识别基准测试的低错误接受率下提高性能。
-
新AI工具Envisage通过新颖的评估指标可视化鼻整形效果
研究人员开发了Envisage,一个使用基于扩散模型的生成编辑来可视化鼻整形手术预期结果的新流程。该系统旨在提供局部编辑,并包含一个新颖的评估协议SurgicalScore,该协议将评估分解为编辑方向、幅度、掩码LPIPS、真实性和掩码外像素的保留。Envisage在关键指标上展示了优于现有方法(如ICEdit和InstructPix2Pix)的性能,表明局部编辑保真度比全脸身份分数更适合此类应用。
-
新的合成数据集评估人脸识别系统
研究人员推出 CounterFace,这是一个新颖的合成数据集,用于对人脸识别系统进行细粒度评估。该数据集包含 11,821 对反事实人脸,涵盖 20 个人脸属性和 8 个人口统计因素,显著扩展了先前合成数据集的规模。CounterFace 使用全自动化流程生成,无需人工验证合成过程。该数据集被用于评估六个商业和开源人脸识别系统,结果显示性能下降因属性和人口统计因素而异,其中面部遮挡(如口罩和胡须)持续导致性能下降。
-
新框架和基准推动视听生成发展
研究人员推出了OmniCustom,一个可以同时从参考图像和音频定制视频身份和音频音色的框架。这个基于DiT的模型使用独立的LoRA模块进行身份和音色控制,并通过对比学习目标进行增强。此外,NAVA框架为联合生成提供了原生的视听对齐,使用一个6.3B参数的模型提高了同步性和音色可控性。另外,LongAV-Compass已被开发为一个基准,用于评估跨越各种条件模态的分钟级视听生成,评估长时间内的连贯性和对齐性。