arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Toronto(多伦多大学)

共收录 120
2606.31148 2026-07-01 cs.CV cs.AI cs.CL 新提交

PruneGround: Plug-and-play Spatial Pruning for 3D Visual Grounding

PruneGround: 用于3D视觉定位的即插即用空间剪枝框架

Duc Cao Dinh, Khai Le-Duc, Florent Draye, Chris Ngo, Terry Jingchen Zhang, Bernhard Schölkopf, Zhijing Jin

机构 * Knovel Engineering Lab(Knovel工程实验室) University of Toronto(多伦多大学) Vector Institute(向量研究所) ELLIS Institute(ELLIS研究所) Max Planck Institute(马克斯·普朗克研究所)

AI总结 提出PruneGround框架,通过语言引导的空间剪枝、多视角描述重构和LLM定位器,在剪枝区域高效定位目标,在多个基准上取得最优结果。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30987 2026-07-01 cs.CL econ.GN q-fin.EC 新提交

Measuring Judgment Quality in Natural-Language Explanations: Evidence from Forecasting Tournaments

自然语言解释中的判断质量测量:来自预测锦标赛的证据

Christopher W. Karvetski, Sheldon S. Huang, Simas Kučinskas, Nadja Flechner, Jingyu Hu, Philip Tetlock, Ezra Karger

机构 * Forecasting Research Institute(预测研究所) Good Judgment Inc(Good Judgment公司) University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所) Stanford University(斯坦福大学) School of Arts and Sciences & Wharton, University of Pennsylvania(宾夕法尼亚大学文理学院与沃顿商学院) Federal Reserve Bank of Chicago(芝加哥联邦储备银行) Federal Reserve System(联邦储备系统)

AI总结 提出解释质量标记(EQMs),用大语言模型评分60种理论驱动的推理模式,在超过55,000个预测-理由对中预测准确性,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30968 2026-07-01 cs.CV 新提交

PhotoQuilt: Training-Free Arbitrary-Resolution Photomosaics via Bootstrapped Tiled Denoising

PhotoQuilt: 通过引导式分块去噪实现无训练任意分辨率的光马赛克

Koorosh Roohi, Javad Rajabi, Andrew Fleet, Babak Taati

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Samsung Research(三星研究院) KITE Research Institute(KITE研究所) Queen’s University(女王大学)

AI总结 提出PhotoQuilt框架,通过引导式分块去噪过程,在无需训练的情况下生成任意分辨率的光马赛克,兼顾全局结构与局部细节,并避免二次注意力成本。

Comments 17 pages, 9 figures. Project page: https://kooroshrh.github.io/photo-quilt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30937 2026-07-01 cs.CV 新提交

No Adaptation Without Observation: Observability-Constrained Test-Time Prompt Tuning for LiDAR Semantic Segmentation

无观测则无适应:面向LiDAR语义分割的观测约束测试时提示调整

Linlian Jiang, Wentao Ju, Sadman Rakib Pinon, Jianwei Xian, Zhixiang Chi, Xinxin Zuo, Yang Wang

机构 * Concordia University(康考迪亚大学) Mila – Quebec AI Institute(米拉-魁北克人工智能研究所) University of Toronto(多伦多大学)

AI总结 针对LiDAR语义分割在部署中性能下降的问题,提出一种几何约束的测试时提示调整框架,通过估计感知可靠性并加权空间监督,仅调整轻量提示适配器,实现稳定适应。

Comments IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25354 2026-07-01 cs.CL 新提交

Efficient and Trainable Language Model Test-Time Scaling via Local Branch Routing

通过局部分支路由实现高效且可训练的语言模型测试时扩展

Yutong Yin, Mingyu Jin, Jin Pan, Changyi Yang, Zijie Xia, Dhruv Pai, Shuming Hu, Zhen Zhang, Chenyang Zhao, Jinman Zhao, Wujiang Xu, Raymond Li, Xin Eric Wang, Julian McAuley, Zhaoran Wang

机构 * Northwestern University(西北大学) Rutgers University(罗格斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) LMSYS Org(LMSYS组织) Tilde Research(Tilde研究) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Toronto(多伦多大学) University of British Columbia(不列颠哥伦比亚大学) University of California, San Diego(加州大学圣迭戈分校)

AI总结 提出局部分支路由(LBR)框架,通过轻量级路由器选择局部前瞻树中的深度-1子路径,实现令牌级测试时扩展,在数学推理基准上优于链式思维和软令牌分支基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28166 2026-06-29 cs.AI 新提交

Tandem Reinforcement Learning with Verifiable Rewards

具有可验证奖励的串联强化学习

Difan Jiao, Raghav Singhal, Robert West, Ashton Anderson

机构 * University of Toronto(多伦多大学) EPFL(瑞士联邦理工学院洛桑分校)

AI总结 提出串联强化学习(TRL),通过强弱模型交替生成推理链并共同奖励,在保持独立推理能力的同时提升模型间兼容性和可读性。

Comments 21 pages,7 figures,8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18610 2026-06-29 cs.RO cs.CV 新提交

SC3-Eval: Evaluating Robot Foundation Models via Self-Consistent Video Generation

SC3-Eval: 通过自洽视频生成评估机器人基础模型

Wei-Cheng Tseng, Gashon Hussein, Yuzhu Dong, Allen Z. Ren, Lucy X. Shi, XuDong Wang, Sergey Levine, Zhaoshuo Li, Jinwei Gu, Florian Shkurti, Ming-Yu Liu, Quan Vuong

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) NVIDIA(英伟达) Physical Intelligence Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Allen Institute for AI(艾伦人工智能研究所)

AI总结 提出SC3-Eval方法,利用前向-反向动力学一致性、跨视角一致性和测试时一致性,将预训练视频基础模型转化为准确的策略评估器,在7个真实世界策略上达到0.929的皮尔逊相关系数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26095 2026-06-25 cs.RO cs.AI cs.CV 新提交

Learning Action Priors for Cross-embodiment Robot Manipulation

跨具身机器人操作的动作先验学习

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Toronto(多伦多大学) Amazon(亚马逊)

AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25451 2026-06-25 cs.LG cs.AI 新提交

Learning with a Single Rollout via Monte Carlo Pass@k Critic

通过蒙特卡洛 Pass@k 评判器进行单次 rollout 学习

Fengdi Che, Yang Liu, Lei Yu, Meng Cao, Tong Che, Rupam Mahmood, Dale Schuurmans

机构 * University of Alberta(阿尔伯塔大学) BIGAI(北京通用人工智能研究院) University of Toronto(多伦多大学) McGill University, Mila(麦吉尔大学,米拉) Nvidia Research(英伟达研究院) Amii(阿尔伯塔机器智能研究所) CIFAR AI Chair(CIFAR人工智能教席)

AI总结 提出单次 rollout 近端策略优化(SR-PPO),利用每个提示的一次 rollout 训练 token 级信用评判器,通过 Pass@k 成功概率提供更选择性学习信号,避免重复采样并改善信用分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25178 2026-06-25 cs.AI 新提交

Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR

通用推理的可迁移性:多领域RLVR的自动课程

Yongjin Yang, Jiarui Liu, Yinghui He, Lechen Zhang, Bernhard Schölkopf, Zhijing Jin

机构 * Jinesis Lab, University of Toronto & Vector Institute(Jinesis实验室,多伦多大学与向量研究所) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ELLIS Institute Tübingen(ELLIS研究所图宾根) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) EuroSafeAI

AI总结 提出迁移感知课程(TAC),利用优势信号和投影梯度估计跨领域可迁移性,在多领域推理套件上实现最佳平均准确率。

Comments 32 pages, including supplementary material; code available at https://github.com/YangYongJin/transfer-aware-curriculum

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25149 2026-06-25 cs.HC cs.AI 新提交

Proactive Systems in HCI and AI: Concepts, Challenges, and Opportunities

人机交互与人工智能中的主动系统:概念、挑战与机遇

Nima Zargham, Sharon Ferguson, Jaisie Sin, Cosmin Munteanu, Anastasia Kuzminykh

机构 * University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) Carleton University(卡尔顿大学)

AI总结 本文通过多学科研讨会,旨在建立主动系统的清晰概念框架,识别设计与评估方法的不足,并制定以人为中心的指南,以推动主动技术的稳健发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22601 2026-06-23 stat.ML cs.LG stat.AP stat.CO 新提交

Scalable Bayesian Additive Models for Stellar Flare Detection via Amortized Gaussian Process Inference and Hidden Markov Models

可扩展贝叶斯加性模型:通过摊销高斯过程推理和隐马尔可夫模型进行恒星耀斑检测

Rodrigo Herrera, Vianey Leos-Barajas, Gwendolyn Eadie, Elizaveta Semenova, James Davenport

机构 * Department of Statistical Sciences, University of Toronto(多伦多大学统计科学系) Data Sciences Institute, University of Toronto(多伦多大学数据科学研究院) School of the Environment, University of Toronto(多伦多大学环境学院) David A. Dunlap Department of Astronomy and Astrophysics, University of Toronto(多伦多大学大卫·A·邓拉普天文与天体物理系) School of Public Health, Imperial College London(伦敦帝国学院公共卫生学院) Department of Astronomy, University of Washington(华盛顿大学天文学系)

AI总结 提出生成式代理框架,利用变分自编码器压缩Celerite先验,避免精确协方差运算,结合隐马尔可夫模型实现恒星耀斑的高效检测。

Comments Main paper: 19 pages, full paper: 34 pages. 4 appendices. 9 main figures, 21 figures in total. 4 tables. Poster Presenter, SSC 2026 (Statistical Society of Canada Annual Meeting) and ISBA 2026 (International Society for Bayesian Analysis World Meeting)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22397 2026-06-23 cs.RO 新提交

Do Rigid-Body Simulators Dream of Soft Robots? Learning Contact-Rich Manipulation for Tendon-Driven Continuum Robots

刚体模拟器会梦见软体机器人吗?学习肌腱驱动连续体机器人的接触丰富操作

Chengnan Shentu, Nicholas Baldassini, Tongjia Zheng, Priyanka Rao, Jessica Burgner-Kahrs

机构 * University of Toronto(多伦多大学)

AI总结 针对肌腱驱动连续体机器人缺乏接触丰富操作模拟基础设施的问题,提出基于连续介质力学的离散化方法,将软体机器人原生集成到MuJoCo中,实现仿真到真实世界的零样本迁移。

Comments Project Page: https://continuumroboticslab.github.io/opencr-mujoco/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21365 2026-06-23 cs.SD cs.AI 新提交

LambdaMark: Semantic Audio Watermarking for Robustness and Radioactivity

LambdaMark: 面向鲁棒性和放射性的语义音频水印

Kexin Li, Xiao Hu, Ilya Grishchenko, David Lie

机构 * University of Toronto, Canada(多伦多大学,加拿大)

AI总结 提出LambdaMark,首个通用放射性水印方案,通过将多比特水印嵌入语义音频潜在表示实现鲁棒性和放射性,实验证明在常见失真和去除攻击下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19328 2026-06-23 cs.LG cs.AI cs.RO 新提交

UBP2: Uncertainty-Balanced Preference Planning for Efficient Preference-based Reinforcement Learning

UBP2: 不确定性平衡的偏好规划用于高效基于偏好的强化学习

Mohamed Nabail, Leo Kaixuan Cheng, Jingmin Wang, Nicholas Rhinehart

机构 * Learning, Embodied Autonomy, and Forecasting (LEAF) Lab, University of Toronto(学习、具身自主与预测(LEAF)实验室,多伦多大学)

AI总结 提出UBP2方法,通过联合推理奖励、动力学和值函数的不确定性来主动引导探索,在Meta-World基准上显著提高了样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08437 2026-06-23 eess.IV cs.CV 新提交

X-Palm: Paired Multispectral-to-Smartphone Dataset for Cross-Domain Palmprint Authentication

X-Palm: 用于跨域掌纹认证的配对多光谱到智能手机数据集

Jamal Seyedmohammadi, Pai Chet Ng, Angelo Genovese, Zhixiang Chi, Jeannie Lee, Konstantinos N. Plataniotis

机构 * Singapore Institute of Technology(新加坡科技学院) Università degli Studi di Milano(米兰大学) University of Toronto(多伦多大学)

AI总结 为解决掌纹识别中受控注册与非约束认证之间的域差距,提出首个配对身份的多光谱-智能手机跨域数据集X-Palm,包含6006张图像,覆盖大规模模态和环境变化,实验表明现有模型在该数据集上性能严重下降,而基于X-Palm训练的模型具有跨域鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20404 2026-06-19 cs.CV 新提交

FlowBender: Feedback-Aware Training for Self-Correcting Conditional Flows

FlowBender: 面向自校正条件流的反馈感知训练

Daniel Gilo, Sven Elflein, Ido Sobol, Or Litany

机构 * Technion(以色列理工学院) NVIDIA(英伟达) University of Toronto(多伦多大学) Vector Institute(向量研究所)

AI总结 针对条件扩散/流模型常违反任务约束的问题,提出FlowBender闭环框架,将对齐误差作为输入训练网络学习校正策略,在图像翻译、复原和3D纹理贴图中同时提升保真度与合理性。

Comments Project page: https://flow-bender.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19888 2026-06-19 cs.LG cs.AI 新提交

SL-S4Wave: Self-Supervised Learning of Physiological Waveforms with Structured State Space Models

SL-S4Wave:基于结构化状态空间模型的生理波形自监督学习

Feng Wu, Harsh Deep, Eric Lehman, Sanyam Kapoor, Guoshuai Zhao, Rahul Krishnan, Gari Clifford, Li-wei H Lehman

机构 * Massachusetts Institute of Technology(麻省理工学院) OpenEvidence, USA(OpenEvidence(美国)) New York University(纽约大学) Xi’an Jiaotong University(西安交通大学) University of Toronto(多伦多大学) Emory University(埃默里大学)

AI总结 提出SL-S4Wave框架,结合对比学习与基于结构化状态空间模型的编码器,通过多尺度子核全局卷积捕获多通道生理波形的局部和长程依赖,在心律失常检测等任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19558 2026-06-19 cs.LG cs.CL 新提交

Displacement Is Not Direction: Evaluating Fidelity Metrics for Quantized LLM Deployment

位移不是方向:评估量化LLM部署的保真度指标

Miloš Nikolić, Ali Hadi Zadeh, Enrique Torres Sanchez, Andreas Moshovos

机构 * ByteShape University of Toronto(多伦多大学) Vector Institute for Artificial Intelligence(向量人工智能研究所)

AI总结 本文研究KL散度等保真度指标在量化语言模型部署中与下游基准分数的相关性,发现整体强相关但在近基线区域失效,归因于KL散度主要衡量分歧量而非方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19388 2026-06-19 cs.SE cs.CL cs.HC 新提交

Beyond the GUI Paradigm: Do Mobile Agents Need the Phone Screen?

超越GUI范式:移动代理是否需要手机屏幕?

Li Gu, Zihuan Jiang, Linqiang Guo, Zhixiang Chi, Ziqiang Wang, Huan Liu, Yuanhao Yu, Tse-Hsun Chen, Yang Wang

机构 * Mila – Québec AI Institute(魁北克人工智能研究所) Concordia University(康科迪亚大学) University of Toronto(多伦多大学) McMaster University(麦马斯特大学)

AI总结 本文挑战移动代理的GUI主导范式,提出CLI应同等重要,通过实验证明CLI代理在AndroidWorld和MobileWorld上超越GUI基线,并引入CLI-Advantage任务套件展示其优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19227 2026-06-18 cs.RO 新提交

Constant Time-Delay Leader Following with Neural Networks and Invariant Extended Kalman Filters for Arbitrary Trajectories

基于神经网络与不变扩展卡尔曼滤波的任意轨迹恒定时间延迟领航跟随

Luka Antonyshyn, Paulo Ricardo Marques de Araujo, Sidney Givigi

机构 * University of Toronto Institute for Aerospace Studies(多伦多大学航空航天研究所) School of Computing(计算学院)

AI总结 提出一种结合概率Seq2Seq神经网络与不变扩展卡尔曼滤波的恒定时间延迟轨迹跟踪方法,用于无通信、无全局坐标的车队,在SE(2)流形上准确估计领车轨迹,并利用几何模型预测控制提升性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18384 2026-06-18 cs.LG cs.DC 新提交

SCOPE-FL: A Strategy-proof Chain-based Optimal pareto efficient Federated Learning System

SCOPE-FL:一种策略证明的基于链的最优帕累托高效联邦学习系统

Seyed Salar Ghazi, Kaiwen Zhang, Mehdi feizi, Hans-Arno Jacobsen

机构 * École de Technologie Supérieure (ÉTS)(高等技术学院) Ferdowsi University of Mashhad(菲尔多西大学) University of Toronto(多伦多大学)

AI总结 针对分层联邦学习中客户端选择策略缺乏帕累托效率和策略证明性导致整体福利下降的问题,提出SCOPE-FL框架,采用顶级交易循环算法同时保证帕累托最优和策略证明性,并通过区块链智能合约实现奖励分配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18097 2026-06-17 cs.RO 新提交

WireCraft: A Simulation Benchmark for Industrial DLO Manipulation

WireCraft:工业DLO操作仿真基准

Chongyu Zhu, Ramy ElMallah, Hyegang Kim, Zachary Tang, Jiachen Rao, Artem Arutyunov, Seungyeon Ha, Chi-Guhn Lee

机构 * Department of Mechanical and Industrial Engineering, University of Toronto(多伦多大学机械与工业工程系) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) CREFLE Inc.(CREFLE公司)

AI总结 针对工业中可变形线性物体(DLO)操作缺乏统一基准的问题,提出WireCraft仿真基准,支持可配置难度和资产,涵盖三种任务族,并评估强化学习、模仿学习和视觉-语言-动作策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17506 2026-06-17 cs.CL 新提交

Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement

通过认知权利评估大语言模型的二阶偏见

Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) EuroSafeAI Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))

AI总结 提出基于认知权利理论的逻辑推理任务,评估LLM在判断偏见内容时表现出的二阶偏见,发现模型判断存在系统性偏差且能规避安全护栏。

Comments 20 pages, 13 tables, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17427 2026-06-17 cs.CV cs.HC 新提交

Impact of Hand Impairment and Occlusions on Hand Pose Estimation Accuracy in Augmented Reality Applications

手部损伤和遮挡对增强现实应用中手部姿态估计精度的影响

Damian M. Manzone, Mathew Szymanowski, Olga Taran, Shuo Cai, Melissa Marquez-Chin, Tammy Zeng, Hardeep Singh, Cesar Marquez-Chin, José Zariffa

机构 * KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(大学健康网络多伦多康复研究所KITE研究所) Institute of Biomedical Engineering, University of Toronto(多伦多大学生物医学工程研究所) Department of Health Sciences and Technology, ETH Zürich(苏黎世联邦理工学院健康科学与技术系) Department of Occupational Science & Occupational Therapy and the Rehabilitation Sciences Institute, University of Toronto(多伦多大学职业科学与职业治疗系及康复科学研究所)

AI总结 研究评估了HoloLens 2和多种姿态估计算法在手部损伤和物体遮挡条件下的精度,发现算法可泛化至手部损伤人群,透明物体略有优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17339 2026-06-17 cs.AI cs.CL cs.SD 新提交

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

SpeechDx: 面向临床语音AI的多任务基准

Sejal Bhalla, Larry Kieu, Aina Merchant, Eyal de Lara, Alex Mariakakis

机构 * University of Toronto(多伦多大学)

AI总结 提出SpeechDx基准,涵盖12个数据集和27个任务,通过语音产生阶段(概念化、公式化、发音)组织任务,评估12种音频编码器,发现大规模语音模型表现最佳,但尚无表示能可靠泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16219 2026-06-16 cs.CE cs.LG physics.comp-ph 新提交

Graphical conditional generative modeling for digital twin modeling

面向数字孪生建模的图条件生成建模

Zongren Zou, Théo Bourdais, Ricardo Baptista, Houman Owhadi

机构 * Department of Computing and Mathematical Sciences, California Institute of Technology(计算与数学科学系,加州理工学院) Department of Statistical Sciences, University of Toronto(统计科学系,多伦多大学)

AI总结 针对数字孪生建模中的保真度问题,提出一种基于条件生成模型和高斯过程方差分析(核模式分解)的框架,从观测数据中发现影响目标条件分布的关键变量,构建简约随机代理模型,并在控制、强化学习等任务中验证其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15931 2026-06-16 cs.MA cs.AI 新提交

DeepRoot: A KG-Coordinated Multi-Agent System for Therapeutic Reasoning over Historical Medical Texts

DeepRoot: 一个基于知识图谱协调的多智能体系统,用于历史医学文本的治疗推理

Zijian Carl Ma, Sean J. Wang, Sijbren Kramer, Li Erran Li

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

AI总结 提出DeepRoot多智能体系统,通过联合构建和利用验证知识图谱,将接地与推理分离并组合,从历史医学文本中恢复药物-疾病治疗关系,显著优于基线LLM和工具调用LLM。

Journal ref ICML 2026 GenBio; ACM CAIS 2026 Workshop AI Agents for Discovery in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15898 2026-06-16 cs.RO 新提交

VL2Spike: Spike-driven Distillation from VLMs for Low-Power Visual Perception in Embodied AI

VL2Spike:面向具身AI低功耗视觉感知的VLM脉冲驱动蒸馏

Zinan Liu, Eric Zheng, Soumyaratna Debnath, Hao Shi, Ling Xiao, Lin Wang

机构 * School of EEE, Nanyang Technological University (NTU)(南洋理工大学电气与电子工程学院) Department of Computer Science, University of Toronto(多伦多大学计算机科学系) Advanced Micro Devices, Inc.(超威半导体公司) State Key Laboratory of Extreme Photonics and Instrumentation, Zhejiang University(浙江大学极端光子学与仪器国家重点实验室) Faculty of Information Science and Technology, Hokkaido University(北海道大学信息科学与技术学院)

AI总结 提出VL2Spike框架,通过时空视觉脉冲蒸馏和脉冲原型引导语言蒸馏,将VLM多模态知识迁移至Spikformer,在静态数据集上提升6.81%性能且能耗仅15.7%,并显著增强机器人视觉地点识别能力。

Comments 9 pages, 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15160 2026-06-16 cs.CV cs.LG 新提交

DLWM: Diverse Latent World Models for Efficient Multimodal Reasoning

DLWM: 多样化潜在世界模型用于高效多模态推理

David Huang, Lianlei Shan

机构 * University of Toronto(多伦多大学) Tsinghua University(清华大学)

AI总结 提出DLWM框架,结合潜在空间推理与强化学习,通过多样化潜在假设和资源感知策略提升多模态推理效率,准确率提升2-5%,内存减少24%。

Comments Preprint. 9 pages main text, 15 pages total including appendix, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏