arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

共收录 830
2604.21203 2026-04-24 stat.ML cs.LG

Refining Covariance Matrix Estimation in Stochastic Gradient Descent Through Bias Reduction

通过偏差减少改进随机梯度下降中的协方差矩阵估计

Ziyang Wei, Wanrong Zhu, Jingyang Lyu, Wei Biao Wu

机构 * Department of Statistics(统计系) University of Chicago(芝加哥大学) University of California, Irvine(加州大学尔湾分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出一种全新的在线去偏差协方差估计器,无需二阶导数即可显著提升估计精度,收敛速度为n^{(α-1)/2}√logn,优于现有无Hessian方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20904 2026-04-23 cs.LG cs.IT math.IT math.OC stat.ML

Optimal Single-Policy Sample Complexity and Transient Coverage for Average-Reward Offline RL

平均回报离线强化学习中单策略样本复杂度与瞬时覆盖的最优性

Matthew Zurek, Guy Zamir, Yudong Chen

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

AI总结 本文研究了平均回报MDP中的离线强化学习,提出基于目标策略的精确样本复杂度界,并首次处理一般弱连通MDP,引入改进的悲观折扣价值迭代算法。

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19670 2026-04-22 cs.RO cs.AI

Multi-Cycle Spatio-Temporal Adaptation in Human-Robot Teaming

人类-机器人协同中的多周期空间-时间适应

Alex Cuellar, Michael Hagenow, Julie Shah

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) UW Madison Department of Computer Science(威斯康星大学麦迪逊分校计算机科学系)

AI总结 本文提出RAPIDDS框架,通过联合适应任务调度和机器人运动扩散模型,提升人类-机器人协同的效率与空间适应性,通过仿真和物理机器人实验验证了其有效性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06080 2026-04-22 cond-mat.mtrl-sci cs.LG

Regression with Large Language Models for Materials and Molecular Property Prediction

利用大语言模型进行材料和分子性质预测的回归

Ryan Jacobs, Maciej P. Polak, Lane E. Schultz, Hamed Mahdavi, Vasant Honavar, Dane Morgan

机构 * Department of Materials Science and Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校材料科学与工程系) Department of Computer Science and Engineering, The Pennsylvania State University(宾夕法尼亚州立大学计算机科学与工程系) College of Information Sciences and Technology, The Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Artificial Intelligence Research Laboratory, The Pennsylvania State University(宾夕法尼亚州立大学人工智能研究实验室) Center for Artificial Intelligence Foundations and Scientific Applications, The Pennsylvania State University(宾夕法尼亚州立大学人工智能基础与科学应用中心)

AI总结 本文探讨了大语言模型在材料和分子性质回归任务中的能力,通过在QM9数据集和28种材料属性上评估LLaMA 3,发现其在生成损失微调下能提供与随机森林或全连接神经网络相当的回归结果,但误差率较高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18936 2026-04-22 cs.LG cs.AI hep-ph hep-th

Fine-Tuning Small Reasoning Models for Quantum Field Theory

对量子场论进行小规模推理模型的微调

Nathaniel S. Woodward, Zhiqi Gao, Yurii Kvasiuk, Kendrick M. Smith, Frederic Sala, Moritz Münchmeyer

机构 * Department of Physics, University of Wisconsin-Madison(威斯康星大学麦迪逊分校物理系) Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Perimeter Institute for Theoretical Physics(理论物理研究所)

AI总结 本文研究了在训练大型语言模型时,领域特定物理推理能力的发展,通过微调小规模推理模型,生成合成问题和人类编写的问题,进行强化学习和监督微调实验,分析推理错误的变化,并公开数据管道和训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18913 2026-04-22 cs.CL

LogosKG: Hardware-Optimized Scalable and Interpretable Knowledge Graph Retrieval

LogosKG:硬件优化的可扩展且可解释的知识图谱检索

He Cheng, Yifu Wu, Saksham Khatwani, Maya Kruse, Dmitriy Dligach, Timothy A. Miller, Majid Afshar, Yanjun Gao

机构 * LARK Lab, University of Colorado Anschutz(洛克拉克实验室,科罗拉多大学安施图茨分校) University of Colorado Boulder(科罗拉多大学波德分校) Loyola University Chicago(芝加哥洛克拉克大学) Harvard Medical School(哈佛医学院) Boston Children’s Hospital(波士顿儿童医院) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 LogosKG通过符号知识图谱和硬件高效操作实现大规模知识图谱的多跳检索,提升效率与可解释性,展示出在生物医学知识与大语言模型推理对齐分析中的应用价值。

Comments Accepted to the ACL 2026 Main Conference. 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18829 2026-04-22 cs.CV

DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

DUALVISION:用于鲁棒视觉推理的RGB-红外多模态大语言模型

Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon(亚马逊) Northeastern University(东北大学)

AI总结 本文提出DUALVISION,通过局部化交叉注意力融合IR-RGB信息,提升多模态大语言模型在视觉退化条件下的性能,并引入DV-204K和DV-500数据集进行评估。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18639 2026-04-22 cs.LG cs.AI

Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning

易于获取的样本足矣:通过数据高效的强化学习实现自演化大语言模型

Zhiyin Yu, Bo Zhang, Qibin Hou, Zhonghai Wu, Xiao Luo, Lei Bai

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nankai University(南开大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出EasyRL方法,通过结合易标注数据的知识转移与逐步分治策略,实现大语言模型的数据高效自演化,实验表明仅使用10%的易标注数据即可超越现有最佳基线。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01375 2026-04-22 cs.AI

RIFT: A RubrIc Failure Mode Taxonomy and Automated Diagnostics

RIFT:一种基于Rubric的故障模式分类和自动诊断

Zhengyang Qi, Charles Dickens, Derek Pham, Amanda Dsouza, Armin Parchami, Frederic Sala, Paroma Varma

机构 * Snorkel AI University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出RIFT框架,通过系统化分类rubric的故障模式,提升评估的可靠性与有效性,通过人类标注和自动指标验证了其一致性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22737 2026-04-22 cs.CV

Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models

Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准

Enyi Shi, Pengyang Shao, Yanxin Zhang, Chenhang Cui, Jiayi Lyu, Xiaobo Xia, Fei Shen, Tat-Seng Chua

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)

AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17941 2026-04-21 cs.CV cs.CL

From Heads to Neurons: Causal Attribution and Steering in Multi-Task Vision-Language Models

从头到神经元:多任务视觉-语言模型中的因果归因与操控

Qidong Wang, Junjie Hu, Ming Jiang

机构 * Tongji University(同济大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文提出HONES框架,通过任务相关的注意力头来评估神经元的因果贡献,改进多任务视觉-语言模型中神经元的归因与操控,提升模型性能。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08184 2026-04-21 math.PR cs.LG stat.ML

Wasserstein-p Central Limit Theorem Rates: From Local Dependence to Markov Chains

Wasserstein-p 中心极限定理速率:从局部依赖到马尔可夫链

Yixuan Zhang, Qiaomin Xie

机构 * Department of Industrial & Systems Engineering, University of Wisconsin-Madison(工业与系统工程系,威斯康星大学麦迪逊分校)

AI总结 本文研究了多维依赖数据在Wasserstein-p距离下的中心极限定理速率,针对局部依赖序列和几何递归马尔可夫链,首次在W_1距离下获得最优O(n^{-1/2})速率,并在较弱矩假设下获得W_p(p≥2)的CLT速率,改进了现有依赖数据领域的最佳界。

Comments ACM SIGMETRICS 2026. 73 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17312 2026-04-21 cs.LG cs.AI

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

面向大数据稀缺性的大型语言模型强化学习综述:挑战与解决方案

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, Yatao Bian, Ming Zhang, Wei Ye, Tieke He, Jie Yang, Guanjie Zheng, Zhonghai Wu, Bo Zhang, Lei Bai, Xiao Luo

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Nankai University(南开大学) Tongji University(同济大学) Nanjing University(南京大学) University of Wollongong(沃林根大学) Shanghai Jiao Tong University(上海交通大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文综述了在数据稀缺条件下大型语言模型强化学习的挑战与解决方案,提出三级框架,梳理现有方法并分析其优劣,为高效强化学习提供理论基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05073 2026-04-21 cs.AI

Uncertainty Quantification in LLM Agents: Foundations, Emerging Challenges, and Opportunities

大语言模型代理中的不确定性量化:基础、新兴挑战与机遇

Changdae Oh, Seongheon Park, To Eun Kim, Jiatong Li, Wendi Li, Samuel Yeh, Xuefeng Du, Hamed Hassani, Paul Bogdan, Dawn Song, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学) University of Pennsylvania(宾夕法尼亚大学) University of Southern California(南加州大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文探讨了大语言模型代理中不确定性量化的基础、挑战及未来方向,提出新的框架并分析了现实场景中的技术难题。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04334 2026-04-21 cs.CV

GeoArena: Evaluating Open-World Geographic Reasoning in Large Vision-Language Models

GeoArena:在大视觉-语言模型中评估开放世界地理推理

Pengyue Jia, Yingyi Zhang, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(香港城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

AI总结 本文提出GeoArena框架,通过人偏好评估动态图像中的地理推理能力,评估17种前沿LVLM,分析模型行为与人类偏好可靠性。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14240 2026-04-21 cs.AI

LiveResearchBench: A Live Benchmark for User-Centric Deep Research in the Wild

LiveResearchBench: 一个用于真实世界中以用户为中心的深度研究的实时基准

Jiayu Wang, Yifei Ming, Riya Dulepet, Qinglin Chen, Austin Xu, Zixuan Ke, Frederic Sala, Aws Albarghouthi, Caiming Xiong, Shafiq Joty

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学) Salesforce AI Research(Salesforce AI研究院)

AI总结 本文提出LiveResearchBench,一个包含100个专家精选任务的实时基准,涵盖日常生活、企业与学术领域,要求进行广泛、动态的实时网络搜索与综合。通过DeepEval评估17个前沿深度研究系统,揭示其优势、失败模式及关键组件。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15182 2026-04-20 cs.AI

Goal-based Neural Physics Vehicle Trajectory Prediction Model

基于目标的神经物理车辆轨迹预测模型

Rui Gan, Haotian Shi, Pei Li, Keshu Wu, Bocheng An, Linheng Li, Junyi Ma, Chengyuan Ma, Bin Ran

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Southeast University(东南大学)

AI总结 本文提出GNP模型,通过两阶段预测车辆目标和轨迹,提升长短期预测精度与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-04-20 cs.AI

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15505 2026-04-20 cs.CL cs.AI

PolicyBank: Evolving Policy Understanding for LLM Agents

PolicyBank: 为LLM代理演化政策理解

Jihye Choi, Jinsung Yoon, Long T. Le, Somesh Jha, Tomas Pfister

机构 * Google Cloud(谷歌云) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 研究通过交互与反馈让LLM代理自主优化政策解读,提出PolicyBank机制以结构化存储政策洞察并迭代完善,有效填补规范缺口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10577 2026-04-20 cs.CR cs.AI

The Blind Spot of Agent Safety: How Benign User Instructions Expose Critical Vulnerabilities in Computer-Use Agents

智能体安全的盲点:良性用户指令如何暴露计算机使用智能体的关键漏洞

Xuwei Ding, Skylar Zhai, Linxin Song, Jiate Li, Taiwei Shi, Nicholas Meade, Siva Reddy, Jian Kang, Jieyu Zhao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Minnesota(明尼苏达大学) University of Southern California(南加州大学) McGill University(麦吉尔大学) Mila(Mila研究院) MBZUAI(MBZUAI研究院)

AI总结 研究揭示了良性用户指令下智能体安全漏洞,提出OS-BLIND基准测试,发现多数智能体在攻击条件下成功率高达90%以上,且在多智能体系统中风险加剧,现有安全措施效果有限。

Comments 63 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16315 2026-04-20 cs.CV cs.CL

SignX: Continuous Sign Recognition in Compact Pose-Rich Latent Space

SignX:在紧凑的姿态丰富潜在空间中实现连续手语识别

Sen Fang, Yalin Feng, Chunyu Sui, Hongbin Zhong, Yanxin Zhang, Hongwei Yi, Hezhen Hu, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) Nanyang Technological University(南洋理工大学) Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) University of Wisconsin--Madison(威斯康星大学麦迪逊分校) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 本文提出SignX框架,通过统一潜在表示和ViT模型实现高效连续手语识别,显著降低计算消耗并在翻译任务中达到SOTA准确率。

Comments 33 pages, CSLR SOTA (2026). More demo at https://signerx.github.io/SignX/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15289 2026-04-17 cs.RO

Abstract Sim2Real through Approximate Information States

通过近似信息状态实现抽象sim2real

Yunfu Deng, Yuhao Li, Josiah P. Hanna

机构 * Prediction and Action Lab (PAL)(预测与行动实验室) University of Wisconsin – Madison(威斯康星大学麦迪逊分校) Department of Computer Sciences, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) Manning College of Information and Computer Sciences, University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校信息与计算机科学学院)

AI总结 本文研究了在抽象模拟器中通过强化学习训练政策并成功迁移到现实世界的问题,提出了一种利用真实任务数据修正抽象模拟器动力学的方法,实现了sim2sim和sim2real的政策迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08952 2026-04-17 cs.CL cs.IR

MAB-DQA: Addressing Query Aspect Importance in Document Question Answering with Multi-Armed Bandits

MAB-DQA: 通过多臂老虎机解决文档问答中的查询方面重要性

Yixin Xiang, Yunshan Ma, Xiaoyu Du, Yibing Chen, Yanxin Zhang, Jinhui Tang

机构 * Nanjing University of Science and Technology(南京理工大学) Singapore Management University(新加坡国立大学) Nanjing Pami Intelligent Technology Co., Ltd.(南京帕米智能科技有限公司) University of Wisconsin - Madison(威斯康星大学麦迪逊分校) Nanjing Forestry University(南京林业大学)

AI总结 本文提出MAB-DQA框架,通过多臂老虎机模型解决文档问答中查询方面的重要性问题,通过分解查询为方面感知的子查询并动态分配检索预算,提升文档理解性能。

Comments Accepted by ACL 2026. 20 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22564 2026-04-17 cs.LG

MIOFlow 2.0: A unified framework for inferring cellular stochastic dynamics from single cell and spatial transcriptomics data

MIOFlow 2.0:一种统一框架,用于从单细胞和空间转录组数据推断细胞随机动态

Xingzhi Sun, João Felipe Rocha, Brett Phelan, Dhananjay Bhaskar, Guillaume Huguet, Yanlei Zhang, Alexander Tong, Ke Xu, Oluwadamilola Fasina, Mark Gerstein, Natalia Ivanova, Christine L. Chaffer, Guy Wolf, Smita Krishnaswamy

机构 * Yale University(耶鲁大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Université de Montréal(蒙特利尔大学;魁北克人工智能研究所) Mila - Quebec AI Institute(佐治亚大学) University of Georgia(嘉宾医学研究所以及学院) Garvan Institute of Medical Research

AI总结 本文提出MIOFlow 2.0框架,结合流形学习、最优传输和神经微分方程,改进单细胞和空间转录组数据中细胞轨迹推断,提升轨迹准确性和揭示隐藏的细胞转换驱动因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20091 2026-04-17 cs.CL

How Retrieved Context Shapes Internal Representations in RAG

检索上下文如何塑造RAG中的内部表示

Samuel Yeh, Sharon Li

机构 * Department of Computer Science, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

AI总结 研究通过潜在表示分析检索文档类型对LLM隐藏状态的影响,揭示上下文相关性和分层处理对内部表示的影响,为RAG系统设计提供见解。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13654 2026-04-16 cs.RO

Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap

面向无人机的视觉与语言导航:进展、挑战与研究路线图

Hanxuan Chen, Jie Zheng, Siqi Yang, Tianle Zeng, Siwei Feng, Songsheng Cheng, Ruilong Ren, Hanzhong Guo, Shuai Yuan, Xiangyue Wang, Kangli Wang, Ji Pei

机构 * Autel Robotics, Shenzhen, China(大疆创新,深圳,中国) School of Intelligent Software and Engineering, Nanjing University, Nanjing, China(南京大学智能软件与工程学院,南京,中国) School of Computer, Data & Information Sciences, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机、数据与信息科学学院,麦迪逊,WI,美国) Southern University of Science and Technology, Shenzhen, China(南方科技大学,深圳,中国) The University of Hong Kong, Hong Kong SAR, China(香港大学,香港特别行政区,中国) School of Software and Microelectronics, Peking University, Beijing, China(北京大学软件与微电子学院,北京,中国)

AI总结 本文综述了无人机视觉与语言导航领域,分析了从早期模块化方法到基于大模型的智能系统的发展,探讨了现实部署中的挑战,并提出了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13403 2026-04-16 cs.CV

Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks

为何多模态上下文学习滞后?揭示内部机制和瓶颈

Yu Wang, Sharon Li

机构 * Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系)

AI总结 本文分析了多模态上下文学习在零样本设置中表现与少样本演示下退化的原因,揭示了模型在视觉与文本表示对齐和任务映射转移方面的不足,并提出改进方法。

Comments ACL Main 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13346 2026-04-16 cs.CL

AgentSPEX: An Agent SPecification and EXecution Language

AgentSPEX:一种代理规范与执行语言

Pengcheng Wang, Jerry Huang, Jiarui Yao, Rui Pan, Peizhi Niu, Yaowenqi Liu, Ruida Wang, Renhao Lu, Yuwei Guo, Tong Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Baylor College of Medicine(贝勒医学院)

AI总结 本文提出AgentSPEX,一种用于定义LLM代理工作流的显式控制流和模块化结构的语言,支持类型步骤、分支、循环、并行执行和显式状态管理,并提供可定制的代理框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13332 2026-04-16 cs.LG

Selecting Feature Interactions for Generalized Additive Models by Distilling Foundation Models

通过蒸馏基础模型选择广义加性模型中的特征交互

Jingyun Jia, Chandan Singh, Rich Caruana, Ben Lengerich

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) Intelligible AI(可解释AI)

AI总结 本文提出TabDistill方法,利用表格基础模型和事后蒸馏技术,提取显著特征交互以提升广义加性模型的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏