Neural Networks for Inverse Design of Cascaded-Mode Near-Field Landscapes
用于级联模式近场景观逆向设计的神经网络
专题命中 机器人操作 :manipulation(abstract)
AI总结 提出使用人工神经网络解决多模波导中级联模式干涉的近场逆向设计问题,通过梯度优化重构目标近场分布,实现了纵向和横向场设计,展示了深度学习的有效性和可扩展性。
Comments 15 pages, 5 figures
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
用于级联模式近场景观逆向设计的神经网络
专题命中 机器人操作 :manipulation(abstract)
AI总结 提出使用人工神经网络解决多模波导中级联模式干涉的近场逆向设计问题,通过梯度优化重构目标近场分布,实现了纵向和横向场设计,展示了深度学习的有效性和可扩展性。
Comments 15 pages, 5 figures
动态泵浦脉冲的时间波捕获
专题命中 机器人操作 :manipulation(abstract)
AI总结 利用非线性光纤中高阶孤子脉冲的动态演化,理论并实验证明了时间波捕获机制,实现了单脉冲动态时间波导,为全光控制超快信号开辟新途径。
Comments 5 pages, 4 figures
面内自旋旋转驱动的拓扑相变
专题命中 机器人操作 :manipulation(abstract)
AI总结 提出通过连续面内自旋旋转可逆切换拓扑态,基于磁点群对称性约束贝里曲率分布,在二维kagome铁磁陈绝缘体中实现60°旋转翻转陈数符号,并验证超低场超快操作。
Comments 12 pages, 4 figures
利用核心张量稀疏性的超对角可重构智能表面信道估计
专题命中 机器人操作 :manipulation(abstract)
AI总结 针对超对角可重构智能表面(BD-RIS)的信道估计难题,提出利用测量张量的稀疏Tucker分解和信道分量的Kronecker秩一结构的压缩感知框架,开发了STORM和STAR两种算法,实现联合稀疏支撑识别和Kronecker秩一分解,显著降低测量开销。
Rabi轮廓框架:一个简单的分析和图形工具包用于量子控制
专题命中 机器人操作 :manipulation(abstract)
AI总结 本文提出Rabi轮廓、Rabi谱和Rabi泄漏三者构成的量子控制工具,提供评估多能级量子系统相干态控制可行性与选择性的框架,无需数值模拟,并通过超导transmon量子比特设计展示其实用性。
Comments Accepted for publication in American Journal of Physics. 14 pages, 7 figures
通过同时带倒置产生拓扑光学和声学界面模式
专题命中 机器人操作 :manipulation(abstract)
AI总结 本研究通过GaAs/AlAs多层结构实现光和声的同时带倒置,产生共定位的界面模式,验证了其在光学反射率和相干声子生成中的应用,并提出工程规则。
Comments 11 pages, 5 figures, 34 references
Journal ref Optica 8, 598-605 (2021)
基于历史条件的时空视觉令牌剪枝用于高效视觉-语言导航
机构 * Department of Computer and Information Sciences at the University of Delaware(德克萨斯大学达勒姆分校计算机与信息科学系) ; University of Maryland’s Department of Computer Science(马里兰大学计算机科学系) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 具身导航 :navigation(title,abstract);robotic(abstract);分类 cs.RO
AI总结 提出一种无需训练的时空视觉令牌剪枝框架,通过空间令牌选择和时空压缩减少冗余计算,在保持导航精度的同时显著提升推理效率,并在真实机器人上验证了低延迟指令跟随导航。
Comments International Conference on Intelligent Robots and Systems (IROS) 2026
MORN: 为资源理性长周期导航的元认知目标-目标调节
机构 * LCSR Lab, Johns Hopkins University(约翰霍普金斯大学LCSR实验室) ; Xi’an Jiaotong University(西安交通大学) ; JD Explore Academy, Beijing, China(京东探索研究院,北京,中国)
专题命中 具身导航 :navigation(title,abstract);分类 cs.RO
AI总结 本文提出MORN,一种基于双过程理论的元认知导航架构,通过引入资源理性机制,解决传统导航系统在长周期任务中因缺乏全局资源意识导致的资源浪费问题,提升了目标完成率和任务效率。
UltraStar: 面向超声心动图导航的语义感知星图建模
机构 * Department of Automation, BNRist, Tsinghua University, Beijing, China(自动化系、BNRist、清华大学、北京、中国) ; School of Automation, Beijing Institute of Technology, Beijing, China(自动化学院、北京理工大学、北京、中国) ; Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院、北京、中国) ; Chinese PLA General Hospital, Beijing, China(中国人民解放军总医院、北京、中国)
专题命中 具身导航 :navigation(title,abstract);分类 cs.CV
AI总结 提出UltraStar方法,通过星图将探头导航从路径回归重构为基于锚点的全局定位,并采用语义感知采样策略选择代表性关键帧,有效处理噪声轨迹,在131万样本数据集上优于基线方法。
Comments Accepted to MICCAI 2026
SOLAR: AI驱动的光速性能分析
机构 * NVIDIA(英伟达)
专题命中 具身导航 :robotics(abstract);分类 cs.AI、cs.LG
AI总结 提出SOLAR框架,自动从PyTorch和JAX代码推导理论最小执行时间(光速界限),通过LLM前端和确定性分析实现无违反界限的多保真度性能分析。
UAV-MapFusion: RTK对齐的不确定性感知粗到细多会话无人机建图
机构 * College of Automation, Harbin Engineering University(哈尔滨工程大学自动化学院) ; Department of Mechanical Engineering, University of Hong Kong(香港大学机械工程系) ; College of Mechatronics and Control Engineering, Shenzhen University(深圳大学机电与控制工程学院)
专题命中 具身导航 :robotics(abstract,comments);分类 cs.RO
AI总结 提出一种不确定性感知的多会话点云地图合并与粗到细优化系统,通过RTK时空对齐和迭代平面因子优化,在抑制长距离漂移的同时保持局部几何精度。
Comments 8 pages, 5 figures, accepted by IEEE Robotics and Automation Letters (RA-L)
LayersReg:一种用于可靠术中3D/2D配准的逐层渐进回归器
机构 * School of Biological Science and Medical Engineering(生物科学与医学工程学院) ; Southeast University(东南大学) ; School of Engineering, College of Engineering and Physical Sciences(工程学院,工程与物理科学学院) ; University of Birmingham(伯明翰大学) ; State Key Laboratory of Digital Medical Engineering(数字医学工程国家重点实验室)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 提出LayersReg,一种逐层渐进回归范式,通过特征空间搜索像素流趋势迭代收敛到正确空间位姿,在X射线/CT配准和切片定位任务上达到高精度,满足术中实时需求。
强化学习在化学反应网络中的实现:以好奇心驱动的探索为例的趋光性
专题命中 具身导航 :navigation(abstract);分类 cs.LG
AI总结 将趋光性建模为部分可观测马尔可夫决策过程,通过化学反应网络常微分方程实现内部状态更新,利用逆强化学习从实验轨迹推断行为目标,揭示游动-翻滚交替作为信息获取策略。
Comments This paper is accepted as talk at ALIFE 2026 (Waterloo, Canada)
提示工程(道德)哲学杂志或:为何AI辅助伦理研究需要过程透明
机构 * University of Milan(米兰大学)
专题命中 具身导航 :navigation(abstract);分类 cs.AI
AI总结 本文探讨了AI辅助伦理研究中过程透明的必要性,提出透明义务应基于主体完整性,通过五个透明元素构建文档充分性框架,以实现未来规范性判断的可能。
Comments 21 pages Transparency material documenting LLM usage available at: https://github.com/MicheleLoi/JPEP.git
AIDEN:面向视障人士的AI助手设计与初步研究
机构 * Institute for Computer Research, University of Alicante(计算机研究所,阿利坎特大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 提出AIDEN系统,结合YOLO实时目标检测、LLaVA场景描述与OCR,以及基于盖革计数器隐喻的连续触觉引导,避免听觉过载并保护隐私,实验表明用户满意度高。
Journal ref IEEE Access 14 (2026) 80406-80420
EndoUFM:利用基础模型进行内窥镜图像的单目深度估计
机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) ; State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)
专题命中 具身导航 :navigation(abstract);分类 cs.CV
AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。
Comments 12 pages
ATGBuilder: 基于特征辅助图学习的活动转换图构建与种子监督
专题命中 具身导航 :navigation(abstract)
AI总结 提出ATGBuilder,利用大语言模型总结UI布局元数据,并将控件触发信息建模为边属性,通过辅助重构目标进行图学习,在种子监督下构建高质量活动转换图,显著优于现有方法。
一种用于人形机器人快速、鲁棒且可适应的移动操作行为的系统
专题命中 具身推理 :manipulation(title,abstract);robotics(abstract,abstract_cn);分类 cs.RO
AI总结 提出一种机器人本地、运行时可编辑的行为编写与运行系统,结合Coactive Design原则、对象中心Affordance模板、行为树逻辑和运行时场景感知,支持双臂行走、并发动作分层,已部署于多种人形机器人,实现20多种任务变体,可在数分钟或数小时内创建新行为。
Comments PhD dissertation, University of West Florida, Department of Intelligent Systems and Robotics, June 2026. 331 pages
PhysEditWorld: 一个面向物理可编辑世界模型的大规模数据集
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Beihang University(北京航空航天大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; Independent Researcher(独立研究者) ; Shanghai Jiao Tong University(上海交通大学) ; Sun Yat-sen University(中山大学) ; The Chinese University of Hong Kong(香港中文大学) ; Tencent(腾讯)
专题命中 具身推理 :world model(title,abstract);manipulation(abstract);分类 cs.CV
AI总结 提出PhysEditWorld数据集,通过UE5重放渲染管线生成多重力配置下的动作条件视频,支持可控物理编辑,用于改进世界模型的动力学建模和一致性。
Comments Project page: https://yizhiqianbi.github.io/physeditworld/
世界模型中的幻觉是可预测且可预防的
机构 * UC San Diego(加州大学圣迭戈分校)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文发现世界模型中的幻觉源于状态-动作空间的低覆盖区域,提出三种可预测幻觉的信号,并开发覆盖感知采样和好奇心奖励方法,仅需50条真实轨迹即可微调模型适应新环境。
Comments Interactive paper, live demo, code, dataset, and models: https://www.nicklashansen.com/mmbench2
EO-WM: 一种用于概率性地球观测预测的物理信息世界模型
机构 * The University of Hong Kong(香港大学) ; Wuhan University(武汉大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 提出EO-WM,一种视频扩散变换器,通过物理信息条件框架(气候基线、天气异常和累积应力)实现多光谱地球观测的概率性预测,在极端天气和季节匹配基准上优于现有方法。
Comments 28 pages, 5 figures, 11 tables
爱因斯坦世界模型
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; RIKEN AIP, Japan(日本理化学研究所革新智能综合研究中心) ; Tohoku University(东北大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV
AI总结 提出爱因斯坦世界模型(EWM),通过将视觉时间展开嵌入推理轨迹,使LLM能利用视觉化反事实事件增强复杂推理能力。
Comments 12 pages (9 without references), 2 figures, 1 algorithm
风险感知的选择性多模态驾驶员监控与驾驶员状态世界建模
机构 * Hubei University(湖北大学) ; Nanyang Technological University(南洋理工大学) ; Osaka University(大阪大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.AI
AI总结 提出成本感知的选择性推理框架,结合轻量级RGB-生理学生网络和门控机制,在低延迟下减少不安全决策,实现可部署的多模态驾驶员监控。
基于JEPA的世界模型的泛化理论
机构 * State Key Lab of General AI, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) ; University of Sydney(悉尼大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.LG
AI总结 本文首次为JEPA世界模型建立泛化理论,将其预训练表述为条件谱图学习问题,并证明JEPA目标等价于动作条件共现矩阵的低秩分解,进而推导出有限样本泛化界,揭示了潜在维度在近似误差与样本误差之间的权衡。
LithoDreamer: 一种用于多阶段计算光刻的物理信息世界模型
机构 * Zhejiang University(浙江大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 提出首个物理信息世界模型LithoDreamer,将光刻流程建模为决策驱动的多步演化系统,通过对比变分优化实现可解释干预,在正向演化和逆向规划中达到最优性能。
Comments Correspondence to: Qi Sun <qisunchn \at zju \dot edu \dot cn>
Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML), Jul. 6-11, 2026
观察、推断、干预:面向目标导向社交智能的主动世界建模
机构 * Mita Technology(Mita技术公司) ; University of Bristol(布里斯托大学) ; University of Toronto(多伦多大学) ; McGill University(麦吉尔大学)
专题命中 具身推理 :world model(title,abstract)
AI总结 提出 See-Infer-Intervene (SII) 框架和主动意图世界模型 (PIWM),通过观察顾客行为、推断潜在意图并选择干预动作,实现零售场景中的主动辅助,在 GuidanceSalesBench 基准上达到 0.641 macro F1。
Comments 16 pages, 3 figures, 9 tables. Preprint
PhysiFormer: 在世界空间中学习模拟力学
专题命中 具身推理 :robotics(abstract);world model(abstract);分类 cs.CV
AI总结 提出PhysiFormer,一种直接在世界坐标下通过去噪扩散过程预测3D物体顶点轨迹的扩散Transformer,无需归纳偏置即可生成物理合理的刚性和弹性运动,并泛化到混合材料、未见几何和更多物体。
Comments Project page: https://yimingc9.github.io/physiformer
快速LeWorldModel
机构 * Xi’an Jiaotong University(西安交通大学)
专题命中 具身推理 :world model(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 提出Fast-LeWM,通过动作前缀并行预测未来潜在状态,替代LeWM的自回归滚动,降低规划时间并减少潜在误差累积。
神经体素动力学:通过体素特征平流学习隐式3D物理
机构 * University College London(伦敦大学学院) ; Adobe Research(Adobe研究院)
专题命中 具身推理 :world model(abstract);分类 cs.CV
AI总结 提出自监督框架,将视频预测瓶颈从2D提升到3D体素潜在空间,通过体素特征平流学习隐式3D物理,无需显式物理引擎,实现异构现象的统一模拟。
推进全模态具身智能体:从孤立技能到日常物理自主
专题命中 机器人基础模型 :embodied agent(title,abstract);manipulation(abstract);navigation(abstract);robotic(abstract)
AI总结 提出OmniAct框架,通过分层异步架构统一规划、记忆和验证,实现机器人在非结构化环境中的持久自主,在40项真实任务中提升成功率并降低token消耗。