arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 2777 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 2777 篇

2606.19897 2026-06-19 cs.RO 新提交 50%

One-to-Two Acting: A Novel Framework for Single-arm Agent Action Expansion to Dual Arms

一对二执行:一种面向单臂智能体动作扩展至双臂的新框架

Youbin Yao, Nieqin Cao, Mingyan Li, Yan Ding, Fuqiang Gu, Chao Chen

机构 * Chongqing University(重庆大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学) Lumos Robotics

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出ExS2D层次化动作扩展框架,利用单臂监督实现双臂操作,通过时间优先关系提取、子任务引导动作映射和碰撞避免协调规划,在仿真中减少54.4%执行步骤并保持成功率。

Comments 6 pages, 5 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19267 2026-06-18 cs.RO cs.SY eess.SY 新提交 50%

A Mixed-Reality Testbed for Autonomous Vehicles

自动驾驶汽车的混合现实测试平台

H. M. Sabbir Ahmad, Ehsan Sabouni, Emrullah Celik, Zean Wan, Damola Ajeyemi, Christos G. Cassandras, Wenchao Li

机构 * Division of Systems Engineering(系统工程系) Boston University(波士顿大学) Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种混合现实硬件在环测试平台,集成物理移动机器人与高保真仿真环境,用于验证感知、规划和控制算法,并支持多智能体系统研究。

Comments 9 pages, 7 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17937 2026-06-17 cs.RO 新提交 50%

ThinkingVLA: Interleaved Vision and Language Reasoning for Robotic Manipulation

ThinkingVLA:用于机器人操作的交叉视觉与语言推理

Tianyi Lu, Hui Zhang, Zijie Diao, Junke Wang, Shengqi Xu, Xingyao Lin, Guojin Zhong, Ziyi Ye, Peng Wang, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学)

专题命中 多模态Agent :cross-modal(abstract)

AI总结 提出ThinkingVLA,通过统一的多Transformer架构实现前向与逆向推理交织,显著提升长时域操作任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15898 2026-06-16 cs.RO 新提交 50%

VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI

VL2Spike:面向具身AI低功耗视觉感知的VLM脉冲驱动蒸馏

Zinan Liu, Eric Zheng, Soumyaratna Debnath, Hao Shi, Ling Xiao, Lin Wang

机构 * School of EEE, Nanyang Technological University (NTU)(南洋理工大学电气与电子工程学院) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Advanced Micro Devices, Inc.(超威半导体公司) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光子学与仪器国家重点实验室) Faculty of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术学院)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出VL2Spike框架,通过时空视觉脉冲蒸馏和脉冲原型引导语言蒸馏,将VLM多模态知识迁移至Spikformer,在静态数据集上提升6.81%性能且能耗仅15.7%,并显著增强机器人视觉地点识别能力。

Comments 9 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12542 2026-06-12 astro-ph.IM astro-ph.EP cs.LG 版本更新 50%

Earth Science Foundation Models: From Perception to Reasoning and Discovery

地球科学基础模型:从感知到推理与发现

Xiangyu Zhao, Bo Liu, Yuehan Zhang, Zelin Song, Wanghan Xu, Feng Liu, Fengxiang Wang, Ben Fei, Fenghua Ling, Wangxu Wei, Wenlong Zhang, Xiao-Ming Wu

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文综述了地球科学基础模型,探讨了其从感知到多模态推理及科学发现的能力演进,并总结了其在大气、水圈、岩石圈等领域的广泛应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11618 2026-06-11 cs.IT math.IT 新提交 50%

Vision-Language-Action Models Meet World Models: Embodied Agentic AI for Low-Altitude Wireless Networks

视觉-语言-动作模型遇见世界模型:面向低空无线网络的具身智能体AI

Feibo Jiang, Li Dong, Lei Mao, Kezhi Wang, Cunhua Pan, Dong In Kim, Naofal Al-Dhahir

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出具身智能体无人机框架,以VLA模型为核心实现端到端决策,引入世界模型建模环境动态,通过记忆与反射机制形成闭环优化,实现低空无线网络的鲁棒自主控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18343 2026-06-10 physics.optics 版本更新 50%

Super-Resolution Structured-Illumination X-Ray Microscopy based on Fourier Decomposition

基于傅里叶分解的超分辨结构照明X射线显微镜

Stefan Schwaiger, Lennart Forster, Martin Dierolf, Franz Pfeiffer, Benedikt Günther

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种超分辨X射线显微镜方法,通过结构照明编码高频信息,利用傅里叶分解解码,实现2.2倍分辨率提升,并扩展至显微断层成像,同时获取相位衬度和暗场图像。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08470 2026-06-09 cs.RO 新提交 50%

LUNA-AD: Lightweight Uncertainty-Aware Language Model with Lifelong Learning for Autonomous Driving

LUNA-AD: 面向自动驾驶的轻量级不确定性感知语言模型与终身学习

Ruoyu Yao, Pei Liu, Ruiguo Zhong, Mingxing Peng, Rui Yang, Jun Ma

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出LUNA-AD,一种结合三系统架构、多智能体分析、双头轻量模型和反思驱动终身学习的轻量级不确定性感知语言模型,在nuPlan上实现高成功率与低推理延迟。

Comments 16 pages,9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04266 2026-06-09 cs.CR cs.LG 版本更新 50%

State Backdoor: Towards Stealthy Real-world Poisoning Attack on Vision-Language-Action Model in State Space

状态后门:针对状态空间中视觉-语言-动作模型的隐蔽现实世界投毒攻击

Ji Guo, Wenbo Jiang, Yansong Lin, Yijing Liu, Ruichen Zhang, Guomin Lu, Aiguo Chen, Xinshuo Han, Hongwei Li

机构 * Laboratory Of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(智能协同计算实验室,电子科学与技术大学) National Key Laboratory of Wireless Communications, University of Electronic Science and Technology of China(无线通信国家重点实验室,电子科学与技术大学) School of Computer Science and Engineering, University of Electronic Science and Technology of China(计算机科学与工程学院,电子科学与技术大学) College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(计算机科学与技术学院,南京航空航天大学) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出状态后门攻击,利用机器人手臂初始状态作为触发器,通过偏好引导遗传算法优化触发器的隐蔽性和有效性,在五个VLA模型和五个真实任务中实现超过90%的攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05960 2026-06-05 cs.RO 50%

Towards a Data Flywheel for Embodied Intelligence in Logistics

面向物流具身智能的数据飞轮

Anlan Yu, Zaishu Chen, Zhiqing Hong, Daqing Zhang

机构 * Peking University(北京大学) JD Logistics(京东物流) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种数据驱动的物流具身智能框架,通过构建数据飞轮将日常操作转化为可复用数据资产,利用世界模型生成长尾包裹操作的可靠监督,并整合多模态数据实现策略持续改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04799 2026-06-04 cs.SE 50%

UModel: An Agent-Ready Observability Data Modeling Method at Scale

UModel: 一种面向智能体的可观测性数据规模化建模方法

Changhua Pei, Zheyuan Li, Zexin Wang, Hang Cui, Xiaohui Nie, Qi Zhou, Fang Situ, Cheng Zhang, Xin Zhang, Xidao Wen, Gaogang Xie, Jingjing Li, Dan Pei

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对现有可观测性框架数据孤岛、模式不兼容及语义元数据不足导致根因分析困难的问题,提出UModel统一本体框架,通过对象中心化建模和语义图连接异构数据,并引入U-SPL管道查询接口,使智能体自主探索系统拓扑并关联多模态数据,在AIOps 2025挑战赛数据集上根因定位精度提升8%,已在阿里云部署超一年,服务数万用户,支撑每秒数百万操作和亚秒级查询延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12215 2026-06-04 cs.RO 50%

LDA-1B: Scaling Latent Dynamics Action Model via Universal Embodied Data Ingestion

LDA-1B:通过通用具身数据摄取扩展潜动力学动作模型

Jiangran Lyu, Kai Liu, Xuheng Zhang, Haoran Liao, Yusen Feng, Wenxuan Zhu, Tingrui Shen, Jiayi Chen, Jiazhao Zhang, Yifei Dong, Wenbo Cui, Senmao Qi, Shuo Wang, Yixin Zheng, Mi Yan, Xuesong Shi, Haoran Li, Dongbin Zhao, Ming-Yu Liu, Zhizheng Zhang, Li Yi, Yizhou Wang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化研究所) BAAI(北京人工智能研究院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) NVIDIA

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出LDA-1B机器人基础模型,通过统一格式的具身交互数据集EI-30k和结构化DINO潜空间中的动力学学习,联合建模动力学、策略和视觉预测,在接触丰富、灵巧和长时任务上分别提升高达21%、48%和23%。

Comments Accepted at RSS 2026, Project Page:https://pku-epic.github.io/LDA

详情

展开后加载摘要…

URL PDF HTML 收藏
1606.03641 2026-06-04 math.OC cs.SY eess.SY 50%

Role of Iso-connectivity Topologies in Multi-agent Interactions

等连通拓扑在多智能体交互中的作用

Rajdeep Dutta, Daniel Pack

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文探讨了等连通拓扑在多智能体系统动态中的作用,通过分析不同拓扑结构对信息共享能力的影响,提出了解决多智能体图结构确定问题的方法。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1511.04634 2026-06-04 cs.RO cs.SY eess.SY 50%

Motion Planning for Global Localization in Non-Gaussian Belief Spaces

非高斯信念空间中的全局定位运动规划

Saurav Agarwal, Amirhossein Tamjidi, Suman Chakravorty

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出了一种在不确定环境下进行运动规划的方法,用于处理模糊数据关联导致的多模态假设。通过递推方法逐步消除多模态信念,实现有限时间内精确定位。

Comments extends previous submission with updated figures, analysis and justifications. arXiv admin note: text overlap with arXiv:1506.01780

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03392 2026-06-03 cs.RO 50%

OpenEAI-Platform: An Open-source Embodied Artificial Intelligence Hardware-Software Unified Platform

OpenEAI-Platform: 一个开源具身人工智能硬件-软件统一平台

Jinyuan Zhang, Luoyi Fan, Leiyu Wang, Yeqiang Wang, Yicheng Zhu, Cewu Lu, Nanyang Ye

机构 * Shanghai Innovation Institute(上海创新研究院) Huazhong University of Science and Technology(华中科技大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出OpenEAI-Platform,集成低成本6+1自由度机械臂和可复现VLA模型,通过开源设计和两阶段训练在真实操作任务中超越商业臂,性能媲美大规模预训练基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
1302.7096 2026-06-03 cs.NE cs.SY eess.SY 50%

Using Artificial Intelligence Models in System Identification

使用人工智能模型进行系统辨识

Wesam Elshamy

专题命中 多模态Agent :multimodal(abstract)

AI总结 本研究修改遗传算法和粒子群优化算法以适应系统辨识的多模态问题,并应用于感应电机参数辨识,结果表明粒子群优化算法在多模态问题上优于遗传算法。

Comments MSc. Thesis, Electrical Power and Machines Dept. Cairo University, Egypt, May 2007

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01667 2026-06-02 cs.LG 50%

ATLAS: Agentic Test-time Learning-to-Allocate Scaling

ATLAS: 智能体测试时学习分配缩放

Peijia Qin, Qi Cao, Pengtao Xie

机构 * University of California, San Diego(加州大学圣迭戈分校)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出ATLAS框架,让LLM编排器通过单一

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30877 2026-06-02 cs.RO 50%

Wall-OSS-0.5 Technical Report

Wall-OSS-0.5 技术报告

Ryan Yu, Pushi Zhang, Starrick Liu, Brae Liu, Miracle Kang, Shalfun Li, Lights Shi, Ellie Ma, Ping Yang, Chris Pan, Jerry Chen, Dongxiu Liu, Rain Sun, Miles Guo, Byron Zhang, Hugo Zhou, Zach Xu, Vincent Chen, Harrison Huang, James Wang, Dance Kuzi, Andy Zhai, Hang Su, Roy Gan, Lucy Liang, Hao Wang, Qian Wang

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出Wall-OSS-0.5,一个基于3B VLM骨干网络并增强动作生成组件的4B开源VLA模型,通过梯度桥接联合训练策略,在超过20个实体上预训练,实现零样本真实机器人行为,并在微调后超越π_0.5,证明VLA预训练本身即可产生可执行的机器人能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27095 2026-06-02 cs.LG 50%

Adversarial Dual On-Policy Distillation from Expressive Teacher

来自表达性教师的对抗性双在线策略蒸馏

Zhenglin Wan, Jingxuan Wu, Xingrui Yu, Chubin Zhang, Mingcong Lei, Bo An, Ivor W. Tsang, Yang You

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼大学) University of Science and Technology of China(中国科学技术大学)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 提出FA-OPD方法,通过对抗性双在线策略蒸馏,结合流匹配教师和轻量MLP学生,利用奖励和动作双通道信号,在机器人导航、操作和运动任务中优于强基线,且对噪声和有限演示鲁棒。

Comments arXiv admin note: substantial text overlap with arXiv:2510.09222

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24881 2026-06-02 cs.RO 50%

Learning Transferable Motor Skills for Geometry-Aware Robotic Surface Tasks

面向几何感知的机器人表面任务的可迁移运动技能学习

Miroslav David, Karla Stepanova, Robert Babuska

机构 * Czech Institute of Informatics, Robotics, and Cybernetics(捷克信息学、机器人学与自动化研究所) Czech Technical University in Prague(布拉格捷克技术大学) Delft University of Technology(代尔夫特理工大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出一种模块化框架,将几何运动规划与执行级专家行为解耦,通过可解释的原子运动规则和神经网络推断,实现跨几何形状的迁移学习。

Comments In: Workshop on Geometry in the Age of Data-Driven Robotics, ICRA 2026, Vienna, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30539 2026-06-01 cs.MA 50%

A Theory-Guided LLM Pedagogical Agent for STEM+C Scaffolding Without Over-Reliance

理论引导的LLM教学代理:用于STEM+C支架式教学,避免过度依赖

Clayton Cohn, Surya Rayala, Siyuan Guo, Hanchen David Wang, Naveeduddin Mohammed, Umesh Timalsina, Shruti Jain, Ryan Li, Angela Eeds, Menton Deweese, Pamela J. Osborn Popp, Rebekah Stanton, Shakeera Walker, Ashwin T S, Meiyi Ma, Gautam Biswas

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出基于证据-决策-反馈框架的多智能体协作代理Copa,结合社会认知理论与社会建构主义,通过自适应对话支持促进STEM+C学习,实验证明其能增强学生信心和概念表达能力而不导致依赖。

Comments Submitted to Computers & Education. Currently under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14324 2026-06-01 stat.ML cs.LG 50%

Learning-to-Defer with Expert-Conditional Advice

基于专家条件建议的学习-延迟决策

Yannis Montreuil, Leïna Montreuil, Axel Carlier, Lai Xing Ng, Wei Tsang Ooi

机构 * School of Computing(计算学院) Département de Mathématiques(数学系) National University of Singapore(新加坡国立大学) Sorbonne University(索邦大学) Fédération ENAC(ENAC联合会) ISAE-SUPAERO ONERA Agency for Science, Technology and Research(科技研究局) Université de Toulouse(图卢兹大学) Institute for Infocomm Research(信息与通信研究所)

专题命中 多模态Agent :multi-modal(abstract)

AI总结 研究在决策时可为专家提供额外信息(建议)的延迟学习问题,提出一种在复合专家-建议动作空间上的增广替代损失,并证明其一致性保证和最优策略恢复能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22743 2026-05-29 physics.med-ph cond-mat.mtrl-sci physics.bio-ph 50%

Combining quasi-static and high frequency experiments for the viscoelastic characterization of brain tissue

结合准静态和高频实验对脑组织进行粘弹性表征

Laura Ruhland, Nina Reiter, Silvia Budday, Kai Willner

专题命中 多模态Agent :multi-modal(abstract)

AI总结 通过准静态大应变流变仪和高频磁共振弹性成像实验,校准分数阶Kelvin-Voigt模型,统一不同时间尺度的脑组织力学行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05968 2026-05-29 cs.LG cs.MA 50%

Offline Multi-agent Reinforcement Learning via Sequential Score Decomposition

离线多智能体强化学习通过序列得分分解

Dan Qiao, Wenhao Li, Shanchao Yang, Hongyuan Zha, Baoxiang Wang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)数据科学学院) School of Computer Science, Tongji University, Shanghai, China(同济大学计算机科学学院) Vector Institute(向量研究所)

专题命中 多模态Agent :multimodal(abstract)

AI总结 针对离线合作多智能体强化学习中联合动作空间高维和异质行为数据导致的策略分布偏移问题,提出序列得分函数分解方法,利用扩散模型从多模态离线数据中学习每个智能体的正则化信号,指导策略更新至高分、分布内区域,在多个粒子环境和多智能体MuJoCo基准上实现最先进性能。

Comments ICML 2026 Accepted

Journal ref Forty-Third International Conference on Machine Learning, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25007 2026-05-26 cs.IR 50%

Meta-Modal Agent: Sequential Evidence Routing for Missing-Modality Candidate Reranking

元模态智能体:面向缺失模态候选重排序的序列证据路由

Jinze Wang, Yangchen Zeng, Tiehua Zhang, Lu Zhang, Yuze Liu, Zhishu Shen, Jiong Jin, Zhu Sun

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出元模态智能体(MMA),将缺失模态问题转化为序列证据路由任务,通过基于大语言模型的候选池重排序器,结合平衡缺失任务强化学习,在冷启动场景下显著提升推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24203 2026-05-26 cs.RO 50%

Afford-VLA: Action-Aligned Visual Planning via Internalized Affordance

Afford-VLA:通过内化可操作性实现动作对齐的视觉规划

Runze Wang, Yuqian Fu, Yu Li, Tao Lin, Tianwen Qian, Mohamed Elhoseiny, Bo Zhao, Yanwei Fu, Yu-Gang Jiang, Xiangyang Xue

机构 * Fudan University(复旦大学) KAUST(康斯坦丁·亚历山大科研大学) SJTU(上海交通大学) East China Normal University(华东师范大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 提出Afford-VLA框架,通过内化任务条件可操作性作为显式视觉规划接口,利用可学习<AFF>令牌查询交互区域并解码为紧凑嵌入以直接条件化动作生成,在多个模拟基准上取得最先进性能。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21844 2026-05-22 nlin.AO cond-mat.stat-mech physics.soc-ph 50%

A Utility-Driven Bounded-Confidence Model for Opinion Dynamics

基于效用的有界信心意见动力学模型

Alex Siebenmorgen, Juan G. Restrepo

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出一种基于效用的有界信心模型,研究意见动态中的社会影响,通过效用景观和学习率确定有效势能,并展示多模态效用函数下的意见状态切换和集群合并。

Comments 5 pages with 4 figures plus Supplementary Material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21406 2026-05-21 cs.RO 50%

MC-Risk: Multi-Component Risk Fields for Risk Identification and Motion Planning

MC-Risk:多组件风险场用于风险识别和运动规划

Maximilian Link, Yingjie Xu, Yingbai Hu, Yinlong Liu

机构 * Technical University of Munich(慕尼黑技术大学) The Chinese University of Hong Kong(香港中文大学) City University of Macau(澳门城市大学)

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出MC-Risk,一种与规划器对齐的多组件风险场,用于早期、校准且类别感知的风险定位。该方法通过线性组合三个可解释模块,包括电机代理场、VRU风险场和道路惩罚场,并在RiskBench碰撞子集上进行了首次标准化定量评估,展示了最佳的风险定位和最早危险指示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14628 2026-05-15 cs.HC 50%

SmartWalkCoach: An AI Companion for End-to-End Walking Guidance, Motivation, and Reflection

SmartWalkCoach: 一种面向全程步行引导、激励与反思的AI伴侣

Xianzhe Zhang, Mingxuan Hu, Bufan Xue, Erick Purwanto, Thomas J Selig, Daniel Yonto

专题命中 多模态Agent :multimodal(abstract)

AI总结 本文提出SmartWalkCoach,通过整合地理、陪伴和总结三个轻量级代理,降低步行规划的认知负荷,提升步行过程中的参与度与动机,通过动态干预改善用户感受和体验。

Comments 15 pages, 2 figures, to be presented to ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24316 2026-05-15 cs.GR 50%

Large-Scale Photogrammetric Documentation of St. John's Co-Cathedral: A Workflow for Cultural Heritage Preservation

大规模摄影测量记录圣约翰共祭坛:文化保护的流程

Matthew Kenely, Mark Bugeja, Andre Grima, Peter Pullicino, Matthew Pullicino, Dylan Seychell

专题命中 多模态Agent :multi-modal(abstract)

AI总结 本文介绍了一种用于大规模摄影测量记录马耳他瓦莱塔圣约翰共祭坛的完整流程,该建筑为世界遗产,具有复杂的巴洛克建筑和卡拉瓦乔作品。通过七晚的夜间拍摄,采集了99,000张照片,利用DSLR相机、无人机和激光雷达扫描,生成包含25-30十亿三角形的高精度3D重建。

详情

展开后加载摘要…

URL PDF HTML 收藏