Insider Insider

Nweon

nweon 文章

Meta提出一种全新的环境感知音频生成模型AV-LDM

美国得克萨斯大学奥斯汀分校和Meta提出了一种新的环境感知音频生成模型AV-LDM,用于将动作声音从背景环境声音中分离出来。他们通过训练模型使用检索增强生成,在无声视频中生成与视觉内容匹配的音频。研究人员使用自中心视频数据集Ego4D和EPIC-KITCHENS进行训练和评估,并引入了Ego4D-Sounds。实验结果表明,该模型优于现有方法,并能够控制环境声音的产生。 该研究还指出,现有的动作声音生成方法无法区分动作声音和环境声音,导致在测试时无法控制地产生环境声音或幻觉。为了解决这个问题,研究团队通过在训练期间使用来自不同时间戳的音频片段,将模型的注意力集中在从视觉框架中学习动作线索并生成动作声音上。 虽然该模型的训练数据并非为自中心视频量身定制,但使用自中心视频数据集有提供近距离视图和带有时间戳的叙述的优势。 总的来说,该研究拓宽了有关训练来源的范围,并在生成人类行为声音方面取得了较好的效果。在未来的研究中,团队计划探索将音频生成模型转用于合成图像输入,并应用于VR游戏等领域。
Meta提出一种全新的环境感知音频生成模型AV-LDM

研究员提出无监督黑盒测试框架检测VR立体视觉不一致问题

映维网Nweon于2024年12月11日报道称,VR体验中渲染质量对于用户体验非常重要,特别是图形用户界面(GUI)。VR需要为用户的左眼和右眼分别渲染两个不同的2D图像,但立体视觉不一致(SVI)问题会破坏用户的呈现过程,导致用户不适甚至对健康产生不利影响。香港中文大学、哈尔滨工业大学和南方科技大学的研究团队使用282份来自15个VR平台的SVI Bug报告进行实证分析,发现自动检测SVI问题具有一定挑战性,因为缺乏训练数据,SVI问题的表现形式多样且往往具有应用特殊性。为了应对这些挑战,研究团队提出了一个无监督黑盒测试框架称为StereoID来识别立体视觉不一致。StereoID基于呈现的GUI状态来识别SVI问题,并使用深度感知条件立体图像转换器Painter来生成合成右眼图像。通过大量实验,StereoID在检测SVI问题方面表现出卓越的性能。这项研究对提高VR应用的质量保证、增强用户体验和安全性具有重要意义。
研究员提出无监督黑盒测试框架检测VR立体视觉不一致问题

免费VR游戏《Gorilla Tag》为何能成功:营收超1亿美元,用户超千万

来自Another Axiom的《Gorilla Tag》是一款在Meta Quest上推出的VR游戏,自2021年推出以来已积累了超过1200万用户,并创造了超过1亿美元的营收。该游戏的成功经验在于将社交与仅适用于VR的移动系统结合在一起,通过培育社区驱动的生态系统创造了属于自己的空间,并吸引了超过100万名玩家每天回到游戏中。其中,对于吸引青少年玩家的成功,与现实生活社会规范的自然遵守有关。此外,游戏中的皮肤销售作为主要的收入来源,通过创造独特的个性化角色以反映玩家个性和成就,在社区中创造了认同感和社会威望。此外,通过简化玩家的启动过程并强调沉浸式的体验,游戏成功地减少了用户体验摩擦,并提高了玩家的留存率。《Gorilla Tag》的成功为未来的VR游戏开辟了新的道路,同时也表明虚拟现实有潜力通过提供更真实、社交化和难忘的体验来改变游戏。
免费VR游戏《Gorilla Tag》为何能成功:营收超1亿美元,用户超千万

Quest v72系统更新开始推送,增加Windows虚拟桌面、键盘追踪以及全新手势追踪等

Meta Quest v72已经开始推送固件升级,带来了一些新的功能和改进。首先是Windows 11的虚拟桌面显示支持,用户可以通过头显镜像Windows 11桌面。其次是更通用的键盘追踪系统,通过自动检测和追踪附近的键盘,在沉浸式环境中创造一个动态的Passthrough透视窗口。另外,Hand Tracking 2.3增强了稳定性、准确性和易用性,并针对手部追踪进行了一系列改进,包括提高手部光标稳定性、光标稳定性和抓取交互的响应性等。此外,Meta Quest还加入了对Instagram Direct Messenger的支持,用户可以在Quest的Instagram应用中与朋友分享照片、故事和贴文,Media Gallery应用程序则可帮助用户管理屏幕截图和视频捕获等内容。此外,Meta Horizon Worlds和Pep0le应用程序也添加了实时字幕功能,方便听力障碍用户。
Quest v72系统更新开始推送,增加Windows虚拟桌面、键盘追踪以及全新手势追踪等

马里兰大学团队为XR研发利用水压的触觉反馈系统

马里兰大学的团队开发了一种新的触觉系统,用水压而不是机械装置提供力反馈。这个系统名为JetUnit,在虚拟现实环境中创造了多样化的触觉体验。这个装置可以模拟从轻柔触摸到尖锐刺感的不同感觉。与其他触觉技术相比,JetUnit系统能够产生更大范围的力。系统由一个由腈制成的薄水密膜和一个独立的腔室组成,可以将水与用户隔离。研究团队解释说,他们选择使用水射流是因为水作为不可压缩流体能量传递效率高。然而,保持用户干燥是一个挑战,团队在系统设计中采取了一些措施来解决这个问题。目前的原型可以实现皮肤接触压力范围为16至442 kPa和10 FPS的最大频率。未来,研究人员计划将JetUnit扩展成一个全身触觉系统,并整合热反馈。
马里兰大学团队为XR研发利用水压的触觉反馈系统

研究分享:室内手持式AR的阻碍因素以及解决方案

根据映维网Nweon于2024年12月10日的报道,日本大阪大学的研究人员通过对智能手机和用户进行实验,发现了增强现实(AR)在建筑物内的应用中存在的问题,并找到了潜在的解决方案。他们指出,AR应用需要智能手机知道两个关键信息:定位和追踪。为了实现这一点,智能手机使用了视觉传感器(摄像头和激光雷达)和惯性测量单元(IMU)。研究小组进行了一系列案例研究,探讨了AR的故障问题,通过禁用特定传感器和改变环境来隔离问题。研究发现,虚拟元素常常会在场景中出现"漂移",导致晕动症和降低真实感。他们发现在远处、极端角度或黑暗房间中很难找到视觉地标,激光雷达效果不佳,IMU在不同速度下误差较大。为解决这些问题,研究团队建议采用基于无线电频率的定位,比如超宽带(UWB),作为潜在的解决方案。他们认为,将超宽带或其他传感模式与基于视觉的技术集成,将极大地改善增强现实应用。
研究分享:室内手持式AR的阻碍因素以及解决方案

加州大学研究驾乘VR体验的晕动症因素:速度和坐姿

苹果、索尼、奥迪、丰田、宝马和大众等汽车制造商都在探索在汽车领域中应用XR技术。然而,晕动症是一个问题。加州大学的研究人员进行了一项研究,探讨了乘坐汽车时使用VR对晕动症的影响因素。实验结果显示,较快的驾驶速度会显著增加晕动症评分,而扩大的前向视觉线索会导致更高的晕动症评分。此外,倾斜姿势并没有显著减轻症状的作用。感觉冲突理论是解释晕动症的主要理论,但视觉诱发的晕动症与vection和晕动症之间的关系复杂且存在争议。性别和暴露是影响晕动症易感性的重要因素。此外,研究人员观察到姿势和对齐之间的相互作用,较高的驾驶速度和正向自运动会增加vection感和晕动症评分。然而,姿势对于晕动症的影响结果不明确。这项研究的结果强调了速度和视觉线索对vection和晕动症的重要影响,并进一步研究了头部运动和视觉线索的关联。
加州大学研究驾乘VR体验的晕动症因素:速度和坐姿

Meta在测试允许用户通过手机创建自己房间的3D扫描

Meta最近发布了一款名为Horizon Hyperscape的演示应用,专为Quest 3和Quest 3S设计。与谷歌街景中的360度照片不同,Horizon Hyperscape采用了高斯飞溅技术,可以让用户在一个逼真的场景空间中自由穿行。 知名XR社区成员Luna在代码串中发现了有关Hyperscape下一步计划的线索。很明显,Meta目前正在测试一项功能,允许用户通过智能手机直接创建自己的房间扫描。 此外,Meta还在测试空间扫描的协同定位功能,使得多人可以共同访问相同的Hyperscape空间。此外,代码还表明用户可以将Hyperscape作为Horizon Worlds的起始环境。 需要注意的是,这项技术似乎还不成熟,因为代码显示相关扫描可能需要长达8小时的处理时间。 Meta的Reality Labs产品经理Marcello Typrin在采访中提到了相关计划。他希望用户能够扫描自己的家,并邀请朋友过来,而不用住在附近,朋友可以位于地球的另一端。他认为这是创造有意义的体验和与有意义的人在一起的强大概念。他们希望将数字世界中的奇幻之地与现实世界地点结合起来,以一种舒适和自然的方式在不同地方之间移动。
Meta在测试允许用户通过手机创建自己房间的3D扫描

美国加州大学利用VR训练机器狗执行任务

中国兵装集团研制的“机器狼”在中国航展上引起了广泛关注,这种四足机器人被认为是一个重要的发展方向。加州大学圣地亚哥分校正在利用VR来训练四足机器人,以提升其任务执行能力。英伟达、特斯拉和小鹏等公司也在探索通过XR来训练人形机器人。集成操纵器的四足机器人的任务是在周围环境中快速移动的同时操纵物体,例如收集物品并将其带给人类,或者将目标物品放在特定位置。目前训练四足机器人完成任务的主要方法是模仿学习,通过处理演示数据来学习机器人完成任务的策略。然而,现有的方法在实际环境中的表现不尽如人意,无法支持四足机器人泛化到各种复杂的任务。为了解决这个问题,加州大学圣地亚哥分校的研究人员提出了一个名为WildLMa的新框架,以提高四足机器人在实际环境中的技能。该框架通过使用视觉语言模型训练机器人获得通用技能,并将这些技能链接到序列中,使机器人能够处理复杂任务。团队表示已经在一系列实验中展示了该框架的潜力,并成功地训练了一个四足机器人完成各种任务。
美国加州大学利用VR训练机器狗执行任务

苹果推送visionOS 2.2的第二个RC版本

苹果最近发布了visionOS 2的第二个RC版本,并推送给开发者进行测试。开发者可以通过设备端的设置应用开启“开发者测试版”开关并进行下载,但需要注册苹果开发者账号,并在安装新软件前进行备份。对于Apple Vision Pro用户,安装visionOS测试版的具体过程是:打开设置,选择通用,启用测试版更新,然后选择visionOS Developer Beta。此外,开发者还可以通过Xcode的visionOS模拟器尝试新版本的visionOS系统。
苹果推送visionOS 2.2的第二个RC版本