当前位置 > 散户吧 > 财经要闻 > 经营管理 > 持续打造AGI新范式,云知声-中国科学技术大学3篇论文入选国际顶会ACM MM 2023

持续打造AGI新范式,云知声-中国科学技术大学3篇论文入选国际顶会ACM MM 2023

发布时间:2023-08-25 11:26来源:全球财经散户吧字号:

  近日,国际顶会ACM MM 2023正式放榜,云知声与中国科学技术大学於俊老师团队共同完成的3篇论文入选,成果覆盖人类对话参与度估计、VTQA挑战、幽默检测等研究方向;其基于3篇论文所构建的3个系统也在Grand Challenge中获得1个冠、2个季,充分展现了云知声在多模态拓展领域的技术能力和学术成果的同时,也为夯实云知声AGI技术基座再添助力。

本文来自散户吧WWW.SANHUBA.COM

  ACM MM(ACM International Conference on Multimedia)始于1993年,是计算机图形学与多媒体领域的顶级国际,也是中国计算机学会的多媒体领域A类国际学术。本届ACM MM有效投稿量达3072篇,接收论文902篇,接收率约为29.3%。 本文来自散户吧WWW.SANHUBA.COM

  此次获得国际顶会认可,既是云知声与中国科学技术大学通力合作、持续探索多模态拓展技术的结果,也离不开云知声AGI技术架构的有力支撑。

本文来自散户吧WWW.SANHUBA.COM

  云知声:通过通用人工智能(AGI)创建互联直觉的世界

本文来自散户吧WWW.SANHUBA.COM

持续打造AGI新范式,云知声-中国科学技术大学3篇论文入选国际顶会ACM MM 2023 本文来自散户吧WWW.SANHUBA.COM

  云知声AI技术体系及U+X 本文来自散户吧WWW.SANHUBA.COM

  作为中国AGI技术产业化的先驱之一,云知声于2016年打造Atlas人工智能基础设施,并构建公司云知大脑(UniBrain)技术中台,以山海(UniGPT)通用认知大模型为,包括多模态感知与生成、知识图谱、物联平台等智能组件,并通过领域增强能力,为云知声智慧物联、智慧医疗等业务提供高效的产品化支撑,推动“U(云知大脑)+X(应用场景)”,践行公司“通过通用人工智能(AGI)创建互联直觉的世界”的使命。

本文来自散户吧WWW.SANHUBA.COM

  作为云知大脑(UniBrain)的重要组件,多模态拓展技术目前已广泛应用于智能家居、车载、客服等领域,包括多模态感知、多模态生成等。此次论文收录,充分印证了云知声在多模态拓展领域的技术创新实力,也将进一步夯实其AGI技术底座,推动山海大模型在各领域的广泛应用。 本文来自散户吧WWW.SANHUBA.COM

  接下来,云知声将继续携手中国科学技术大学,加强基础理论和关键技术的研发,并以此为支撑,持续“U+X”,不断拓展AGI应用场景,加速千行百业的智慧化升级,为人们的生活带来更多便利和智能体验。

本文来自散户吧WWW.SANHUBA.COM

  以下为入选论文及参赛系统概览:

本文来自散户吧WWW.SANHUBA.COM

  人类对话参与度估计

本文来自散户吧WWW.SANHUBA.COM

持续打造AGI新范式,云知声-中国科学技术大学3篇论文入选国际顶会ACM MM 2023

本文来自散户吧WWW.SANHUBA.COM

  人类对话中的参与度估计一直是人与机器交互中最重要的研究课题之一。然而,以往的数据集和研究主要集中在video-wise level的参与度估计,因此难以反映人类不断变化的参与度。在ACM MM上举办的MultiMediate ‘23 挑战赛提供了frame-wise level参与度估计的。这个的输入和输出序列非常长(至少 10,938 帧或更多),而 RNN 难以处理这种超长输入序列。Baseline使用多层感知器网络 (MLP),为每一帧输入的特征输出相应的参与度,即Point2Point(),但这通常会导致大量视频上下文语义信息的丢失。 本文来自散户吧WWW.SANHUBA.COM

  在本文中,我们利用Bi-LSTM和Transformer强大的序列建模能力,提出了Sliding Window Seq2seq Modeling for Engagement Estimation。该方法充分利用了参与者视频中的全和部多模态特征信息,并能准确表达参与者在每个时刻的参与情况。具体来说,我们从参与者的视频中使用OpenFace2.0、OpenPose、Microsoft Kinect sensor、Soundnet、Geneva Minimum Acoustic Parameter Set (eGeMAPS)提取了多模态特征,包括视觉特征和音频特征。然后,通过”Sliding Window”获取子序列,初始视频序列的窗口化保证了利用当前时刻周围的信息(部信息),而 “Sliding window”则将每个子序列连接起来,利用整个视频序列的信息来估计当前时刻的参与度(全信息)。最后,输入基于双向长短期记忆网络(Bi-LSTM)和Transformer的encoder部分分别设计的两个Seq2seq Model,通过Seq2seq Modeling来获得的参与度序列。我们验证了该方法明显优于之前的 基线,取得了SOTA 的水准,并在本次MultiMediate ’23参与度估计比赛中取得了第一名的成绩。

本文来自散户吧WWW.SANHUBA.COM

持续打造AGI新范式,云知声-中国科学技术大学3篇论文入选国际顶会ACM MM 2023 本文来自散户吧WWW.SANHUBA.COM

  VTQA挑战

持续打造AGI新范式,云知声-中国科学技术大学3篇论文入选国际顶会ACM MM 2023

本文来自散户吧WWW.SANHUBA.COM

  Grand Challenge是ACM MM的重要组成部分,每年均会承办多项比赛并在主会上公开其技术方案,VTQA则是今年的十项比赛之一。在VTQA挑战中,模型需要根据给定的图像-对来回答问题。为了正确回答问题,提出的模型需要: 本文来自散户吧WWW.SANHUBA.COM

  (1) 学识别图像和中与问题相关的实体; 本文来自散户吧WWW.SANHUBA.COM

  (2) 对相同实体的多媒体表示进行对齐;

本文来自散户吧WWW.SANHUBA.COM

(小编:财神)

专家一览机构一览行业一览