arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 2335
2609.11920 2026-09-11 cs.RO 新提交

EVPeriscope: Extended Perception across Aerial and Ground Vehicles with Event-based Propeller Tracking

EVPeriscope:基于事件螺旋桨跟踪的空中与地面车辆扩展感知

Dexter Ong, Vijay Kumar, Pratik Chaudhari

机构 * University of Pennsylvania(宾夕法尼亚大学)

AI总结 EVPeriscope利用事件相机检测四旋翼螺旋桨高频信号,实现地面与空中机器人的可靠相对定位,在恶劣条件下支持闭环导航,扩展地面机器人感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11918 2026-09-11 cs.LG cs.AI stat.ML 新提交

General Quantification of Covariate and Concept Shifts

协变量偏移与概念偏移的通用量化

Hongbo Chen, Li Charlie Xia

机构 * South China University of Technology(华南理工大学)

AI总结 本文提出基于熵正则化最优传输的$\gamma^{*}$-概念偏移定义,统一协变量与概念偏移的误差界,并开发可估计的DataShifts算法,为分布偏移下的学习误差提供通用量化工具。

Comments 38 pages, 9 figures, accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11917 2026-09-11 cs.LG cs.CL 新提交

Data Scarcity and Model Sparsity: Mixtures-of-Experts Overfit More to Repeated Data

数据稀缺与模型稀疏:混合专家模型对重复数据的过拟合更严重

Atindra Jha, Margaret Li, Jure Leskovec, Percy Liang, Luke Zettlemoyer

机构 * Stanford University(斯坦福大学) Paul G. Allen School of Computer Science, University of Washington(华盛顿大学保罗·G·艾伦计算机科学学院)

AI总结 本文研究数据重复对混合专家模型的影响,发现其比密集模型过拟合更严重,且随稀疏性加剧;强掩码正则化可缓解,但无法完全替代唯一数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11916 2026-09-11 cs.AI 新提交

Can Edge-Deployable Vision-Language Models Identify Species?

可边缘部署的视觉语言模型能否识别物种?

William Zhou, Mayukha Siripuram, Xiao Yan, Ziqi Liu, Yi Ding

机构 * Plano West Senior High School(普莱诺西高中) Centennial High School(百年高中) The University of Texas at Dallas(德克萨斯大学达拉斯分校)

AI总结 本研究评估边缘可部署的2-8B视觉语言模型在物种识别上的表现,发现所有模型在野外图像上均显著退化,且专用模型BioCLIP虽小却大幅领先,表明差距源于训练数据而非模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11913 2026-09-11 cs.CL 新提交

Distance generalization in transformers: why bother with positional encoding?

距离泛化中的Transformer:为何需要位置编码?

Daniel Henrik Nevermann, Claudius Gros

机构 * Institute for Theoretical Physics, Goethe University Frankfurt(法兰克福大学理论物理研究所)

AI总结 本文研究Transformer在固定上下文长度下对未见词元间距离的泛化能力,通过合成延迟复制任务,探讨位置编码、数据多样性及迁移学习正负性,强调理解底层机制的重要性。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11910 2026-09-11 cs.LG 新提交

From Protocols to Evidence: Bounded Claims for AI in Service of the Common Good

从协议到证据:服务于公共利益的AI的有限主张

Nitesh V. Chawla, Paulo Benanti

机构 * University of Notre Dame(圣母大学) LUISS Guido Carli University(路易斯大学)

AI总结 本文提出断裂测试和RISE AI架构,区分证据受限部署与测量受限治理,以实现基于证据的有限AI主张,服务公共利益。

Journal ref ACM AI Summit 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11900 2026-09-11 cs.AI cs.CL cs.CV 新提交

MindTopo: Can Foundation Models Reason in Topological Space?

MindTopo:基础模型能否在拓扑空间中进行推理?

Yunfei Ge, Anbang Liu, Qineng Wang, Johnalbert Garnica, Jianwen Lyu, Zihan Wang, Reuben Tan, Jianfeng Gao, Ruohan Zhang, Yining Hong, Jiajun Wu, Manling Li

机构 * Northwestern University(西北大学) Microsoft Research(微软研究院) Stanford University(斯坦福大学)

AI总结 本文提出MindTopo基准,从认知科学和形式拓扑出发,评估基础模型在连续性等五个拓扑属性上的推理与规划能力,发现推理优于规划且均远低于人类水平。

Comments Preprint version

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11899 2026-09-11 cs.CV cs.HC 新提交

Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding

一次标注,按需取帧:面向预算受限的智能体长视频理解的视觉需求路由

Weitong Cai, Hang Zhang, Yukai Huang, Yiqiao Xie, Shan Gao, Jiankang Deng, Songcen Xu, Jifei Song, Zhensong Zhang

机构 * Queen Mary University of London(伦敦玛丽女王大学) Durham University(杜伦大学) Imperial College London(帝国理工学院) Huawei(华为)

AI总结 针对边缘设备长视频理解,提出CFD框架,利用视觉-文本二元性,通过离线标注索引和按查询的视觉需求路由,仅对感知问题取帧,在降低计算成本的同时保持高精度。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11897 2026-09-11 cs.LG 新提交

CausalArena: Benchmarking Causal Discovery in the Foundation Model Era

CausalArena:基础模型时代的因果发现基准测试

Zi-Rong Li, Si-Yang Liu, Tian-Zuo Wang, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院)

AI总结 CausalArena提出统一可演进的基准,通过合成、语义操作和公式基础SCMs及真实数据评估因果发现,揭示跨基准性能不可迁移,强调多样性与预训练重叠挑战。

Comments 47 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11894 2026-09-11 cs.CV cs.GR cs.LG eess.SP 新提交

3D Point Splatting for mmWave Radar Novel View Synthesis

用于毫米波雷达新视角合成的3D点泼溅

Adnan Armouti, Yixuan Gao, Rajalakshmi Nandakumar

机构 * Cornell Tech(康奈尔科技学院)

AI总结 提出3D点泼溅(3DPS),首个可微雷达点渲染器,基于雷达方程推导,实现物理忠实、复数值和多视点合成,在ColoRadar数据集上性能优于光学NVS基线1.7-5.2倍。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11892 2026-09-11 cs.CL 新提交

Nuha-Speech: Building General-Purpose Arabic Speech-LLMs

Nuha-Speech:构建通用阿拉伯语语音大语言模型

Yingzhi Wang, Reem Alhazzani, Muhammad Alqurishi

机构 * Elm Company(埃尔姆公司)

AI总结 Nuha-Speech构建了含150万样本的阿拉伯语语音问答语料库,基于Qwen-Omni微调模型,并设计评估框架,以建立通用阿拉伯语语音大语言模型的基础设施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11886 2026-09-11 cs.CV 新提交

Guided Super-Resolution of Digital Elevation Models with Diffusion-Based Image Generators

基于扩散图像生成器的数字高程模型引导超分辨率

Armand Mihai Nicolicioiu, Dominik Narnhofer, Nando Metzger, Daniel Panangian, Ksenia Bittner, Konrad Schindler

机构 * ETH Zürich(苏黎世联邦理工学院) German Aerospace Center (DLR)(德国航空航天中心)

AI总结 针对DSM分辨率不足问题,提出利用扩散模型和高分辨率光谱图像引导,将5米DSM超分辨率至0.5米,提升结构细节与几何精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11884 2026-09-11 cs.LG cs.CV 新提交

CoRA-NAS: Coarse Ranking and Anchor-Residual Refinement for Neural Architecture Search

CoRA-NAS:用于神经架构搜索的粗排序与锚点残差细化

Yifan Yang, Zhaoyan Wang, Zheng Gao, Xiaoyu Li, Jiaojiao Jiang

机构 * University of New South Wales(新南威尔士大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

AI总结 CoRA-NAS 提出两阶段框架,结合静态排序先验与低成本学习曲线细化,实现跨空间鲁棒且低成本的架构选择,在多个基准上取得高排序相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11878 2026-09-11 cs.CL cs.AI cs.LG 新提交

Domain-Specific Hallucination Detection in Large Language Models

大型语言模型中的领域特定幻觉检测

Varun Teja Chundru, Debasmita Biswas

机构 * Purdue University Fort Wayne(普渡大学韦恩堡分校)

AI总结 提出多信号幻觉检测流水线,在HaluEval上达F1=0.915,并利用DPO将生成器幻觉率降低55.9%,同时发现领域匹配预训练对跨领域适应至关重要。

Comments 6 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11876 2026-09-11 cs.AI 新提交

On the Regularization Landscape for the Linear Recommendation Models

线性推荐模型的正则化景观研究

Dong Li, Zhenming Liu, Ruoming Jin, Hao Zhou, Zhi Liu, Jing Gao, Bin Ren

机构 * Kent State University(肯特州立大学) College of William and Mary(威廉与玛丽学院) iLambda(iLambda公司)

AI总结 本文研究线性推荐模型中正则化景观,发现性能领先者统一于核范数或Frobenius范数正则化,并提出两种低秩闭式解,兼具两者优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11875 2026-09-11 cs.RO 新提交

UniMPA: A Unified Memory-Prediction-Action Model via Action-Grounded Transition Modeling

UniMPA:一种通过动作接地转移建模的统一记忆-预测-动作模型

Wei Li, Rui Shao, Jie He, Lingsen Zhang, Ziwei Liu, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Nanyang Technological University(南洋理工大学)

AI总结 针对VLA模型中的转移可实现性差距问题,提出UniMPA统一模型,通过动作接地转移接口、持久选择性预测和双记忆库检索,解决转移模糊性、预测执行不匹配及经验实现不匹配。

Comments Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI). Project page: https://JiuTian-VL.github.io/UniMPA-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11871 2026-09-11 cs.RO 新提交

Learning Agent-based Model Predictive Control for Holistic Vehicle Performance

基于学习的智能体模型预测控制以实现整车性能优化

Jiaming Zhong, Reza Valiollahi Mehrizi, Mohammad Pirani, Chao Yu, Alireza Kasaiezadeh, Yash Vardhan Pant, Amir Khajepour

机构 * University of Waterloo(滑铁卢大学) University of Ottawa(渥太华大学) General Motors Company(通用汽车公司)

AI总结 提出学习型智能体模型预测控制(LAMPC),结合模型与数据方法,用高斯过程回归预测未知贡献,提升多智能体系统整车性能,仿真实验优于传统AMPC。

Comments 12 pages. Author accepted manuscript

Journal ref IEEE Transactions on Intelligent Transportation Systems, vol. 25, no. 11, pp. 17482-17492, November 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11870 2026-09-11 cs.CL 新提交

Augustinian BabyLM: What Ostensive Definition Can and Cannot Teach a Small Language Model

奥古斯丁婴儿语言模型:直示定义能教给小型语言模型什么,不能教什么

Lisa Bylinina

机构 * Institute for Language Sciences(语言科学研究所) Utrecht University(乌得勒支大学)

AI总结 本文研究直示定义对小型语言模型的影响,通过视觉初始化嵌入,发现其留下持久印记但不影响抽象语法基准,仅在对象属性知识上有优势,并指出现有评估无法捕捉此效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11865 2026-09-11 cs.CL 新提交

Epistemic orientation predicts legislative effectiveness among members of the US Congress

认知取向预测美国国会议员的立法效能

Segun Aroyehun, Stephan Lewandowsky, David Garcia

机构 * University of Konstanz(康斯坦茨大学) University of Bristol(布里斯托大学) University of Potsdam(波茨坦大学) Complexity Science Hub(复杂性科学中心)

AI总结 本研究利用证据减去直觉得分分析美国国会议员演讲和推文,发现意识形态极端者证据导向语言更少,且该语言与立法效能正相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11860 2026-09-11 cs.AI cs.LG 新提交

Explainability Assistant: A Conversational XAI Interface for Interpreting Energy Consumption Models

可解释性助手:用于解读能耗模型的可对话XAI界面

Rodion Krjutškov, Eduard Barbu, Nikos Sakkas, Sofia Yfanti

机构 * Nupp Software Apintech Ltd(Apintech有限公司) POLIS-21 Group(POLIS-21集团) Hellenic Mediterranean University(希腊地中海大学)

AI总结 针对能耗预测模型难以解读的问题,提出基于大语言模型函数调用的可对话XAI系统,实现94%意图解析准确率,专家评估显示其优于传统仪表板。

Comments 11 pages, 3 figures. Accepted author version of a paper published at ICECET 2026

Journal ref 2026 6th International Conference on Electrical, Computer and Energy Technologies (ICECET), Rome, Italy, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11859 2026-09-11 cs.AI 新提交

From Parameters to Answers: How LLMs Retrieve and Use Their Internal Knowledge

从参数到答案:大语言模型如何检索和使用其内部知识

Wenkang Wei, Yuan Fang, Renhe Jiang, Hong Cheng, Xingtong Yu

机构 * University of Science and Technology of China(中国科学技术大学) Singapore Management University(新加坡管理大学) The University of Tokyo(东京大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 本研究通过逐层干预揭示LLM回答时对查询路由和内部知识的依赖变化,区分了早期可读性、自然强度、因果引导和后期内容依赖,并发现模型间存在差异。

Comments 53 pages, 13 figures, including appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11851 2026-09-11 cs.CL 新提交

IndicTriMix: Developing Language Identification Datasets and Models for Tri-Language Code-Mixing

IndicTriMix:开发三语代码混合的语言识别数据集与模型

Pruthwik Mishra, Rudra Trivedi, Avi Patel, Ashok Urlana, Shrikant Malviya

机构 * Sardar Vallabhbhai National Institute of Technology Surat(萨达尔·瓦拉巴伊国家理工学院苏拉特校区) TCS Research Hyderabad(塔塔咨询服务公司海得拉巴研究中心)

AI总结 本文提出IndicTriMix,通过微调MuRIL和XLM-RoBERTa模型,利用平行句生成代码混合数据,构建三语语言识别基准,有效实现标记级语言识别。

Comments 9 pages, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11842 2026-09-11 cs.LG cs.AI 新提交

Model-Aware Schedules Improve Generation via Fiberwise Optimal Transport

模型感知调度通过纤维最优传输改进生成

Luyi Jia, Boyan Zhang, Yilun Liu, Steffen Rulands

机构 * Arnold-Sommerfeld-Center for Theoretical Physics(阿诺德-索末菲理论物理中心) Ludwig-Maximilians-Universität München(慕尼黑大学) Institute of Informatics, Ludwig-Maximilians-Universität München(慕尼黑大学信息学研究所) Munich Center for Machine Learning(慕尼黑机器学习中心)

AI总结 提出基于纤维最优传输的模型感知调度方法,通过结合预测风险与动力学作用优化时间分配,在扩散和流匹配模型中持续优于基线,显著降低FID。

Comments 11 pages, 2 figures. Keywords: Diffusion models; flow matching; schedule optimization; fiberwise optimal transport; time reparameterization; empirical universality

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11838 2026-09-11 cs.CL 新提交

Target leakage, not model class, explains reported accuracy in survey-based cardiovascular screening: a leakage-tiered audit of glass-box and tabular foundation models

目标泄漏而非模型类别解释了基于调查的心血管筛查中报告的准确性:对玻璃盒模型和表格基础模型的泄漏分层审计

Raad Bin Tareaf, Murad Al-Rajab, Samia Loucif, Samer Ellaham, Cedric Schmitz

机构 * XU Exponential University of Applied Sciences(XU指数应用科学大学) German University of Digital Science(德国数字科学大学) Abu Dhabi University(阿布扎比大学) Zayed University(扎耶德大学) Cleveland Clinic Hospital(克利夫兰诊所医院)

AI总结 本研究通过泄漏分层审计发现,心血管筛查模型报告的准确性主要源于目标泄漏而非模型类别,玻璃盒模型在保持性能的同时支持公平性修复和高效推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11804 2026-09-11 cs.CV cs.AI cs.LG 新提交

Logit Refiner: Improving Visual Autoregressive Models via Intra-Scale Dependency Modeling

Logit Refiner:通过尺度内依赖建模改进视觉自回归模型

Meimingwei Li, Stefan Andreas Baumann, Felix Krause, Björn Ommer

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心)

AI总结 针对视觉自回归模型并行解码忽略尺度内依赖导致局部不连贯的问题,提出Logit Refiner轻量模块,通过顺序采样恢复依赖,仅增10%参数,显著提升生成质量并泛化至文本到图像生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11801 2026-09-11 cs.LG cs.AI 新提交

Thinking with Looped Flows

循环流思考

Ayhan Suleymanzade, Chanhyuk Lee, Floor Eijkelboom, Nicholas M. Boffi, İsmail İlkan Ceylan, Jinwoo Kim

机构 * AITHYRA

AI总结 提出循环流方法,用局部去噪目标训练循环模型,通过概率流积分实现推理,在多个推理基准上超越现有循环模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11790 2026-09-11 cs.LG 新提交

Dynamic language model representations for multi-objective reaction optimisation

动态语言模型表示用于多目标反应优化

Joshua W. Sin, David Ming Segura, Bojana Ranković, Siu Lun Chau, Marius D. R. Lutz, Andrea Anelli, Ryan P. Burwood, Kurt Püntener, Maximilian J. Notheis, Raphael Bigler, Philippe Schwaller

机构 * F. Hoffmann-La Roche AG(罗氏制药公司) EPFL(洛桑联邦理工学院) Nanyang Technological University(南洋理工大学)

AI总结 本研究提出用微调语言模型动态学习反应表示,结合高斯过程代理模型,在多目标贝叶斯优化中减少实验次数,并成功应用于钯催化氰化和不对称氢化反应,实现高收率和高对映选择性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11786 2026-09-11 cs.CL cs.AI 新提交

Beyond Word Error Rate: A Switch Aware Evaluation of ASR and Audio Language Models on English Yoruba Code-Switched Speech

超越词错误率:针对英语-约鲁巴语代码转换语音的ASR与音频语言模型的转换感知评估

Chibuzor Okocha, Christan Earl Grant

机构 * University of Florida(佛罗里达大学)

AI总结 本研究提出转换感知评估框架,对11个ASR和音频语言模型在英语-约鲁巴语代码转换语音上进行测试,发现聚合词错误率掩盖转换行为,音频语言模型在转换局部指标上显著更优,并发布评估工具以支持可复现基准测试。

Comments Accepted to IEEE Speech Language Tecnology

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11780 2026-09-11 cs.LG cs.CR cs.NE 新提交

Predicting Privacy Leakage from Weight Spectral Density

从权重谱密度预测隐私泄露

Richard J. Preen, Jim Smith

机构 * University of the West of England(西英格兰大学)

AI总结 本研究利用重尾自正则化框架下的廉价谱度量(如稳定秩和Log alpha-Norm)预测成员推理攻击的隐私泄露,发现其关联强于传统泛化差距,为可扩展隐私审计提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.11775 2026-09-11 cs.RO 新提交

Rapid Learning of Dexterous In-Hand Pen Writing through Real-Time Jacobian Estimation

通过实时雅可比估计快速学习灵巧手内钢笔书写

Kai Stewart, Yasunori Toshimitsu, Robert K. Katzschmann

机构 * ETH Zurich(苏黎世联邦理工学院)

AI总结 提出基于实时任务雅可比估计的具身控制方法,无需模型或示范,仅用CPU在18秒内实现拟人手内钢笔书写,达到亚毫米精度,并跨三个系统验证。

Comments 8 pages, 7 figures. Project website an be seen at https://srl-ethz.github.io/rapid-dexterous-writing/

详情

展开后加载摘要…

URL PDF HTML 收藏