Chiral Phonons Enable Ultrafast Magnetization Switching via Magnetoelastic Coupling
手性声子通过磁弹性耦合实现超快磁化翻转
专题命中 机器人操作 :manipulation(abstract)
AI总结 研究利用太赫兹驱动的手性声子通过磁弹性耦合实现比线性声子更快的磁化翻转,揭示了手性在自旋-晶格动力学中的关键作用。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
手性声子通过磁弹性耦合实现超快磁化翻转
专题命中 机器人操作 :manipulation(abstract)
AI总结 研究利用太赫兹驱动的手性声子通过磁弹性耦合实现比线性声子更快的磁化翻转,揭示了手性在自旋-晶格动力学中的关键作用。
磁性半导体范德瓦尔斯异质结中自旋依赖隧道效应和谷散射对激子和三重态极化的影响
专题命中 机器人操作 :manipulation(abstract)
AI总结 本文研究了磁性半导体范德瓦尔斯异质结中自旋依赖隧道效应和谷散射对激子和三重态极化的影响,通过分析光致发光极化特性,揭示了自旋依赖的层间电荷转移和激子、三重态谷散射之间的相互作用,为远距离操控激子和三重态行为提供了新方法。
Comments 12 pages, 6 figures
Journal ref Physica B: Condensed Matter, V. 738, p. 418823 (2026)
室温下van der Waals铁磁体Fe3GaTe2中的激光诱导拓扑切换开关
专题命中 机器人操作 :manipulation(abstract)
AI总结 研究通过激光脉冲在Fe3GaTe2中实现室温拓扑自旋纹理切换,揭示激光加热冷却机制,为非易失性存储应用提供新途径。
EvolveNav: 用于零样本目标导航的主动预反思与自进化记忆
机构 * HKUST(GZ)(香港科技大学(广州)) ; Nanyang Technological University(南洋理工大学) ; Xi’an Jiaotong University(西安交通大学) ; XGRIDS(深圳格物智联)
专题命中 具身导航 :navigation(title,abstract);embodied agent(abstract);分类 cs.AI
AI总结 提出自进化零样本目标导航框架,通过从历史轨迹提取规则并基于置信上界检索,结合记忆引导预反思模块,减少无效探索,成功率提升10.1%。
几何一致的内窥镜表示用于图像引导导航:基于结构化基础模型适配
机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) ; Semaphor Surgical ; Johnson & Johnson MedTech(强生医疗科技)
专题命中 具身导航 :navigation(title,abstract);分类 cs.AI、cs.CV
AI总结 提出统一框架,结合合成数据管道与层级感知几何语义适配,学习几何一致且领域鲁棒的图像表示,提升单目内窥镜中的位姿估计与深度预测性能。
VISTA:通过动作历史条件实现尺度感知的视觉导航
机构 * Polytechnique Montreal(蒙特利尔理工学院) ; MILA(MILA研究所) ; Institute of Science Tokyo(东京科学大学) ; CoRA Lab(CoRA实验室) ; Mist Lab(Mist实验室)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO、cs.LG
AI总结 针对视觉导航基础模型因动作归一化导致的尺度脆弱性,提出通过动作历史条件化提供物理位移上下文,并集成DINOv3编码器增强重复环境中的特征表示,实现零样本跨环境部署。
StepGuard: 通过单步校准保护网页导航
机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) ; Xiamen University(厦门大学) ; Zhejiang Lab(之江实验室) ; CSIRO(澳大利亚联邦科学与工业研究组织)
专题命中 具身导航 :navigation(title,abstract);分类 cs.AI
AI总结 针对网页导航中单步脆弱性问题,提出StepGuard框架,通过动态双策略优化(DDPO)解决奖励冲突,并利用置信度引导的自适应导航反射(CANR)校准单步误差,显著提升导航与答案准确率。
VL-MemKnG:结合时空知识图谱的混合记忆用于长程自我中心导航轨迹问答
机构 * Mobile Robotics Laboratory, Artificial Intelligence Center(移动机器人实验室,人工智能中心) ; Skoltech(斯科尔科沃科学技术学院) ; Intelligent Multimodal Vision Analysis Group, Department of Engineering, Universitat Pompeu Fabra(智能多模态视觉分析组,工程系,庞培法布拉大学) ; Independent Researcher(独立研究员)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO
AI总结 提出VL-MemKnG混合记忆框架,结合时空知识图谱与片段级上下文记忆,通过混合检索推理模块提升长程自我中心视频导航问答的准确性和效率。
惯性导航中用于截断误差降低的规范自由度优化
专题命中 具身导航 :navigation(title,abstract)
AI总结 提出u-space方法,将规范自由度推广到未知强迫函数系统,通过闭式或经验形式优化规范,在多种仿真和实测惯性导航数据中一致降低截断误差。
FLAP: 面向无先验地图3D导航的视场约束主动感知规划
机构 * The State Key Laboratory of Industrial Control Technology, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院工业控制技术国家重点实验室) ; Huzhou Institute, Zhejiang University(浙江大学湖州研究院) ; Huzhou Key Laboratory of Autonomous System(湖州市自动驾驶系统重点实验室) ; Shanghai Institute of Special Equipment Inspection and Technical Research Co., Ltd(上海市特种设备监督检验技术研究院有限公司)
专题命中 具身导航 :navigation(title);分类 cs.RO
AI总结 提出一种将主动感知直接融入轨迹优化的规划框架,通过传感器坐标系下的视场几何约束和速度触发机制,在保证安全的同时提升效率,并支持任意3D机动。
Comments 18 pages, 19 figures
TriBand-BEV:基于高度感知的鸟瞰图与高分辨率特征融合的实时仅LiDAR三维行人检测
机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)
专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出TriBand-BEV方法,通过高度感知的鸟瞰图与高分辨率特征融合实现实时LiDAR-only三维行人检测,采用轻量级鸟瞰图张量映射,单网络一次通过检测车辆、行人和自行车,提升检测精度与速度。
Comments Accepted for publication in the Proceedings of the 2026 International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
Journal ref Proceedings of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026)
本体神经网络与ORTSF:一种用于拓扑推理和延迟鲁棒控制的框架
机构 * Department of Mechanical Engineering Soongsil University, Seoul, Korea Email
专题命中 具身导航 :robotics(abstract);robotic(abstract);分类 cs.RO
AI总结 本文提出Ontology Neural Network和ORTSF框架,解决现有方法在关系语义表示和动态环境中协作所需认知透明度的不足,通过统一架构实现语义认知与鲁棒控制的统一。
Comments 12 pages, 5 figures, includes theoretical proofs and simulation results
异构移动机器人上的非接触式呼吸监测:一种多模态边缘计算框架
机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 具身导航 :robotic(abstract);分类 cs.RO、cs.CV
AI总结 提出一种适用于异构移动机器人的多模态非接触式呼吸率监测框架,通过自适应传感器选择、关键点引导的ROI提取和信号质量过滤,在多种平台和光照条件下实现鲁棒监测,无需平台特定调参。
Comments 8 pages, 6 figures. To appear in Proceedings of the 8th International Workshop on IoT Applications and Industry 5.0 (IoTI5 2026), co-located with IEEE DCOSS-IoT 2026, Reykjavik, Iceland, June 2026
SCC-Loc: 无人机热红外地理定位的统一语义级联共识框架
机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学)
专题命中 具身导航 :navigation(abstract);分类 cs.RO、cs.CV
AI总结 提出SCC-Loc框架,通过共享DINOv2骨干网络、语义引导视口对齐、级联空间自适应纹理结构滤波和共识驱动可靠性感知位置选择,解决热红外-可见光模态差异导致的特征模糊问题,实现零样本高精度绝对位置估计,平均定位误差9.37米。
Comments 17 pages, 5 figures. Submitted to IEEE J-STARS
MapAgent: 一个工业级的城市规模车道级地图生成智能框架
机构 * Tsinghua University(清华大学) ; Baidu(百度) ; University of Macau(澳门大学) ; Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
专题命中 具身导航 :navigation(abstract);分类 cs.AI
AI总结 提出MapAgent框架,通过结合视觉语言模型和约束感知推理,在验证驱动的Judge-Planner-Worker循环中修正车道地图生成中的规范违规问题,实现城市规模的高自动化生产。
Comments Accepted by KDD 2026
用于丰富多类医学图像分割的标签树语义损失
机构 * School of Biomedical Engineering & Imaging Sciences(生物医学工程与成像科学学院) ; Department of Neurosurgery(神经外科部门)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 提出两种基于标签层次结构的树状语义损失函数,在脑MRI全监督分割和神经外科高光谱成像稀疏标注场景理解中取得一致改进。
这是真的吗?利用混合现实中的虚实辨别漏洞
专题命中 具身导航 :navigation(abstract)
AI总结 研究混合现实头显中用户无法区分虚拟与真实物体的漏洞,通过专家研讨和四项概念验证攻击(成功率85%-100%),揭示了攻击如何改变用户行为,并提出平台级溯源、交互门控和用户教育等防御措施。
Comments Accepted at the 2026 USENIX Symposium on Usable Privacy and Security (SOUPS 2026)
3D 等视域世界模型——揭示城市不可见几何及其涌现的跨城市特征
机构 * The Bartlett School of Sustainable Construction University College London, UK(可持续建设学院伦敦大学学院,英国) ; Department of Geography University College London, UK(地理系伦敦大学学院,英国) ; School of Project Management, Faculty of Engineering The University of Sydney, AU(工程学院项目管理学院悉尼大学,澳大利亚) ; School of Engineering Cardiff University, UK(工程学院卡迪夫大学,英国) ; School of Architecture Tsinghua University, Beijing, CN(建筑学院清华大学,北京,中国)
专题命中 具身推理 :world model(title,abstract);robotics(abstract);embodied AI(abstract);embodied agent(abstract)
AI总结 提出一种预测3D等视域(球形可见性深度图)的具身世界模型,通过深度残差和自滚动调度采样训练,发现跨城市空间特征可从时间潜变量中线性解码。
ThinkJEPA:赋予潜在世界模型大型视觉-语言推理能力
机构 * Northeastern University(东北大学) ; University of California San Diego(加州大学圣地亚哥分校) ; University of Maryland(马里兰大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Washington(华盛顿大学)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出ThinkJEPA框架,结合密集JEPA分支与稀疏VLM思考者分支,通过分层金字塔表示提取模块,实现细粒度运动建模与长程语义引导,在手部操作轨迹预测任务上超越基线。
Comments 10 pages, 5 figures
ActWorld: 从可探索到可交互的世界模型——基于动作感知记忆
机构 * Washington University in St. Louis(圣路易斯华盛顿大学) ; Intelligent Creation, ByteDance(字节跳动智能创作)
专题命中 具身推理 :world model(title,abstract);navigation(abstract);分类 cs.CV
AI总结 提出ActWorld,通过构建10万交互视频数据集和分层动作感知记忆机制,在块自回归框架中扩展导航模型以支持对象交互,解决数据稀缺和记忆瓶颈问题。
Comments Project page: https://interactwm.github.io/ActWorld
循环世界模型
机构 * FaceMind Research Asia
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 提出循环世界模型(LoopWM),通过参数共享的Transformer块迭代细化潜在环境状态,实现高达100倍参数效率,并建立迭代潜在深度作为世界模拟的新缩放轴。
Comments Technical Report
OmniDrive: 一种由LLM编排的多智能体世界模型,用于多视角驾驶视频生成的统一潜在协同压缩
机构 * Peking University(北京大学) ; Xiamen University(厦门大学) ; Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) ; National Taiwan University(国立台湾大学) ; Wuhan University(武汉大学) ; Wuhan University of Technology(武汉理工大学) ; Tsinghua University(清华大学) ; Jimei University(集美大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 提出DRIVE-CHOREO,一种由LLM编排的多智能体世界模型,通过三个Qwen2.5-VL智能体协同生成位置感知的潜在序列,并利用视图-时间置换与3D VAE协同压缩,实现可控多视角视频生成,在nuScenes上达到SOTA多视角一致性和BEV mAP 21.6。
Comments 24 pages, 10 figures
Curiosity-Critic:累积预测误差改进作为世界模型训练的可处理内在奖励
机构 * Department of Computer Science, University of Toronto, Toronto, Canada(多伦多大学计算机科学系)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出Curiosity-Critic方法,通过可处理的每步替代项(当前预测误差与渐近误差基线的差值)作为内在奖励,利用共训练的评论家在线估计误差基线,有效分离可约与不可约预测误差,在随机网格世界实验中优于现有方法。
Comments Accepted to ICML 2026 Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026). Code: https://github.com/vinbhaskara/Curiosity-Critic
未来动态3D重建:一种具有解耦自运动的3D世界模型
机构 * Technical University of Munich (TUM)(慕尼黑技术大学) ; Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 提出FR3D世界模型,通过解耦场景3D演化与智能体轨迹,利用教师-学生蒸馏策略实现从单目观测到未来动态3D重建的几何一致性和零样本泛化。
Comments ICML 2026. Project page: https://fr3d-wm.github.io
MaineCoon: 追求实时音视频社交世界模型
机构 * Catnip AI Team(Catnip AI团队)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 提出MaineCoon,首个22B参数的实时音视频自回归模型,支持单GPU上高达47.5 FPS的流式生成和亚秒级交互,专为社交互动应用优化,引入自重采样、跨模态对齐、领域偏好优化和强化在线策略蒸馏等技术。
Comments 32 pages, 13 figures, 3 tables
Mind-Studio: 针对部分可观测游戏的可执行世界模型与前向评估
机构 * Hong Kong University of Science and Technology(香港科技大学) ; City University of Hong Kong(香港城市大学) ; University of Edinburgh(爱丁堡大学) ; Hong Kong Baptist University(香港浸会大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 提出Mind-Studio框架,利用大语言模型从轨迹合成可执行的pygame风格世界模型,通过K步前向保真度协议评估,在Montezuma's Revenge等游戏中显著提升预测准确性和子目标验证。
Comments 12 pages, 2 figures
代理世界建模:基础、能力、定律及更远
机构 * Hong Kong University of Science and Technology(香港科学与技术大学) ; National University of Singapore(新加坡国立大学) ; University of Oxford(牛津大学) ; Nanyang Technological University(南洋理工大学) ; Chinese University of Hong Kong(香港中文大学) ; University of Hong Kong(香港大学) ; University of Washington(华盛顿大学) ; University of Tokyo(东京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of California, Berkeley(加州大学伯克利分校) ; University of Cambridge(剑桥大学) ; Singapore University of Technology and Design(新加坡科技设计大学) ; Singapore Management University(新加坡管理学院) ; XGEN Labs(XGEN实验室)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。
TORL-VLA:触觉引导的在线强化学习用于接触丰富操作
机构 * Meituan(美团) ; Beijing Institute of Technology(北京理工大学) ; Beihang University(北京航空航天大学) ; State Key Lab of Multimodal Artificial Intelligence Systems, Institute of Automation, CAS(中国科学院自动化研究所多模态人工智能系统国家重点实验室) ; China University of Mining and Technology (Beijing)(中国矿业大学(北京))
专题命中 机器人基础模型 :manipulation(title,abstract);robotic(abstract);分类 cs.RO
AI总结 提出TORL-VLA框架,结合触觉反馈与在线强化学习,通过触觉导出的力矩感知VLA预测参考动作,并利用轻量在线RL模块优化动作,解决接触条件变化时的策略适应问题,在长时接触任务中提升成功率和执行效率。
Comments Project page: https://torl-vla.github.io/
ACE-Ego-0:统一第一人称人类与机器人数据用于VLA预训练
机构 * ACE Robotics ; CUHK MMLab(香港中文大学多媒体实验室) ; CUHK, Shenzhen(香港中文大学(深圳)) ; SJTU(上海交通大学) ; THU(清华大学)
专题命中 机器人基础模型 :robotic(title);manipulation(abstract);分类 cs.RO
AI总结 提出ACE-EGO-0框架,通过可扩展的第一人称视频到动作管道和可靠性感知训练目标,统一人类与机器人数据用于VLA预训练,在多个基准上达到最优性能。
基于流的视觉-语言-动作模型的不确定性量化
机构 * TU Munich(慕尼黑工业大学) ; ETH Zurich(苏黎世联邦理工学院) ; MPI IS Tübingen(马克斯·普朗克智能系统研究所)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.LG
AI总结 提出利用速度场差异(VFD)量化流匹配模型中的认知不确定性,用于故障检测和主动微调,在LIBERO基准上实现高效任务适应。
Comments Project page: tum-lsy.github.io/uq_vla/. 28 pages, 12 figures