arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Maryland, College Park(马里兰大学帕克分校)

共收录 39
2608.05466 2026-08-14 cs.AI cs.LG 版本更新

Recursive Synthesis for Long-Horizon Terminal Tasks

长视界终端任务的递归合成

Zhongzhi Li, Yucheng Shi, Zongxia Li, Ruhan Wang, Anhao Li, Zixun Huang, Junyao Yang, Lei Ke, Ninghao Liu, Haitao Mi, Leowei Liang

机构 * Tencent HY LLM Frontier(腾讯HY大模型前沿团队) University of Georgia(佐治亚大学) University of Maryland, College Park(马里兰大学帕克分校) University of Pennsylvania(宾夕法尼亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) National University of Singapore(新加坡国立大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 本文提出RST递归合成框架,低成本规模化生成3.7万余个长视界终端任务,经微调或PPO优化后,多款Qwen模型在多个终端基准任务上性能显著提升,且递归过程无明显上限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07029 2026-08-12 eess.IV cs.CV 版本更新

Guidestar-Free Adaptive Optics with Asymmetric Apertures

无引导星自适应光学与非对称孔径

Weiyun Jiang, Haiyun Guo, Christopher A. Metzler, Ashok Veeraraghavan

机构 * Rice University(Rice大学) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文提出一种无需引导星或波前传感器的闭环自适应光学系统,利用非对称孔径和机器学习实现实时波前校正,通过自然场景测量估计PSF并重建相位畸变,实验验证其在密集自然场景中优于现有方法。

Comments Accepted to ACM Transactions on Graphics (TOG)

Journal ref ACM Transactions on Graphics, Volume 45, Issue 5, Article 39 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06296 2026-08-11 cs.LG 版本更新

On-Policy Self-Distillation without Any Supervision

无任何监督的在线策略自蒸馏

Yijiang Li, Bingyang Wang, Yijun Liang, Yunjie Tian, Di Fu, Nuno Vasconcelos

机构 * UC San Diego(加州大学圣迭戈分校) Georgia Institute of Technology(佐治亚理工学院) University of Maryland, College Park(马里兰大学帕克分校) ByteDance(字节跳动)

AI总结 本研究提出无监督在线策略自蒸馏(U-OPSD),仅用模型自身生成结果实现在线策略自蒸馏,在多数学基准上优于基础模型,部分场景超越OPSD、GRPO等监督方法。

Comments Project page at https://williamium3000.github.io/u-opsd/ and code at https://github.com/williamium3000/u-opsd

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27594 2026-08-07 cs.LG 版本更新

Compliance2LoRA: Personalizable On-Demand Safety Alignment on Arbitrary Policy Subsets via Hypernetwork-Generated LoRA Adapters

Compliance2LoRA:通过超网络生成的LoRA适配器对任意策略子集进行按需安全对齐

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学帕克分校)

AI总结 Compliance2LoRA是一种自适应超网络框架,可通过生成LoRA适配器,在单个大型推理模型上实现对任意安全策略子集的按需对齐,且不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13460 2026-08-07 cs.CV 版本更新

VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models

VISA: VLM引导的实例语义审计用于3D占据世界模型

Ruiqi Xian, Yuehan Xian, Jing Liang, Xuewei Qi, Dinesh Manocha

机构 * University of Maryland College Park(马里兰大学帕克分校) Nanjing University of Posts and Telecommunications(南京邮电大学) Stanford University(斯坦福大学) Motional AD Inc.(Motional AD公司)

AI总结 提出VISA方法,利用离线VLM对每个物理对象实例进行结构化语义审计,并通过可靠性加权损失蒸馏到3D占据模型中,无需VLM推理即可提升封闭集占据mIoU。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03136 2026-08-04 cs.CL 版本更新

StoryScope: Investigating idiosyncrasies in AI fiction

StoryScope:探究人工智能小说中的个体差异

Jenna Russell, Rishanth Rajendhran, Chau Minh Pham, Mohit Iyyer, John Wieting

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 本文提出StoryScope方法,通过分析叙事层面的特征区分AI和人类生成的故事,发现AI故事在主题解释和情节结构上更单一,而人类故事更具道德模糊性和时间复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03519 2026-08-04 cs.CL cs.AI 版本更新

TS-Reasoner: Aligning Time Series Foundation Models with LLM Reasoning

TS-Reasoner:将时间序列基础模型与大语言模型推理能力对齐

Fangxu Yu, Hongyu Zhao, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 TS-Reasoner通过两阶段训练将时间序列基础模型与大语言模型对齐,在多个基准上性能优于同类模型且数据效率更高,解决了时间序列模型推理能力不足的问题。

Comments Accepted to Transactions on Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28627 2026-08-03 eess.SY cs.RO cs.SY math.OC 版本更新

Reachability Guarantees for Cart-Pole Swing-Up and Stabilization

小车-摆杆起摆与稳定的可达性保证

Mohamed Khalid M Jaffar

机构 * Department of Aerospace Engineering(航空航天工程系) University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 针对欠驱动小车-摆杆系统,提出基于能量/LQR切换控制的可达性分析,通过Lyapunov函数和LaSalle不变性原理证明从紧致初始集到竖直平衡的收敛,并设计切换区域保证起摆到稳定的形式化过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18426 2026-07-30 cs.RO 版本更新

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA

Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Rahul Kumar, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学帕克分校)

AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25897 2026-07-28 cs.RO cs.LG cs.SY eess.SY 版本更新

Variational Neural Belief Parameterizations for Robust Dexterous Grasping under Multimodal Uncertainty

变分神经信念参数化用于多模态不确定性下的鲁棒灵巧抓取

Clinton Enwerem, Shreya Kalyanaraman, John S. Baras, Calin Belta

机构 * Department of Electrical & Computer Engineering and Institute for Systems Research, University of Maryland, College Park, MD, USA(电气与计算机工程系和系统研究所,马里兰大学,College Park, MD, USA) Maryland Applied Graduate Engineering, A. James Clark School of Engineering, University of Maryland, College Park, MD, USA(马里兰应用研究生工程学院,A. James Clark工程学院,马里兰大学,College Park, MD, USA)

AI总结 本文提出变分推理方法,通过可微高斯混合模型表示信念,利用Gumbel-Softmax和位置-尺度重参数化实现平滑采样,提升抓取鲁棒性并减少规划时间。

Comments 11 pages, 10 figures. Accepted for publication at IROS 2026. Code, simulation assets, and dataset at https://github.com/coenwerem/vnb-grasp

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08543 2026-07-28 cs.CV 版本更新

Spectral Principal Paths: A Spectral Perspective on Linear Representation Formation in LLMs

谱主路径:大语言模型中线性表示形成的谱视角

Bowei Tian, Xuntao Lyu, Meng Liu, Hongyi Wang, Ang Li

机构 * University of Maryland, College Park(马里兰大学 College Park 分校) North Carolina State University(北卡罗来纳州立大学) Genbio AI

AI总结 提出输入空间线性假设和谱主路径框架,利用谱理论解释大语言模型中线性表示的形成与稳定性,并给出严格保证。

Comments 21 Pages. In Conference on Language Modeling (COLM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27355 2026-07-23 cs.RO 版本更新

RouterVLA: Budgeted Commissioning and Expert Onboarding for Growing VLA Pools

RouterVLA:将冒烟测试转化为异构VLA选择的监督信号

Xingyu Ren, Chugang Yi, Youran Sun

机构 * The Chinese University of Hong Kong(香港中文大学) University of Maryland, College Park(马里兰大学 College Park 分校) Tsinghua University(清华大学)

AI总结 提出RouterVLA方法,利用预部署评估的冒烟测试记录来监督异构VLA策略的选择,通过结果分离的交叉拟合和透明规则,在LIBERO-Plus数据集上将保留集成功率提升14.64个百分点。

Comments v2: revised title, updated author list, restructured the experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03245 2026-07-22 cs.AR cs.AI cs.SE 版本更新

FVRuleLearner: Operator-Level Reasoning Tree (Op-Tree)-Based Rules Learning for Formal Verification

FVRuleLearner:基于操作级推理树(OP-Tree)的规则学习用于形式验证

Lily Jiaxin Wan, Chia-Tung Ho, Yunsheng Bai, Cunxi Yu, Ghaith Bany Hamad, Deming Chen, Haoxing Ren

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) NVIDIA(英伟达) University of Maryland, College Park(马里兰大学帕克分校)

AI总结 本文提出FVRuleLearner,通过操作级推理树模型,提升形式验证中SVA操作符选择的准确性和效率,显著提高语法和功能正确性。

Comments Accepted to IEEE VTS'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26667 2026-07-22 cs.IR cs.AI 版本更新

M-RAG: Semantic Key-Value Indexing for Retrieval-Augmented Generation

M-RAG:使RAG更快、更强和更高效

Xu Sun, Tongkai Xu, Baiheng Xie, Li Huang, Qiang Gao, Kunpeng Zhang

机构 * Southwestern University of Finance and Economics(西南财经大学) Zhida AI, Zhida Technology(智达AI,智达科技) University of Maryland, College Park(马里兰大学帕克分校)

AI总结 M-RAG提出一种无片段检索策略,通过提取结构化元标记提升检索与生成效率,实验证明其在低资源环境下优于传统RAG方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11491 2026-07-22 cs.LG physics.comp-ph 版本更新

Potential failures of physics-informed machine learning in traffic flow modeling: theoretical and experimental analysis

交通流建模中物理信息机器学习的潜在失败:理论与实验分析

Yuan-Zheng Lei, Yaobang Gong, Dianwei Chen, Yao Cheng, Xianfeng Terry Yang

机构 * University of Maryland, College Park, MD 20742, United States(马里兰大学学院公园分校) Florida Atlantic University, Boca Raton, FL 33431, United States(佛罗里达 Atlantic 大学)

AI总结 研究探讨物理信息机器学习在交通流建模中失败的原因,定义失败情形,指出有效更新条件难满足致PIML失败,通过理论分析建立物理残差MSE下界,解释基于LWR的PIML能优于ARZ的原因。

Comments Technical errors in the bound proof

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08940 2026-07-21 cs.LG 版本更新

TSRouter: Dynamic Modality-Model Selection for Time Series Reasoning

TSRouter:用于时间序列推理的动态模态-模型选择

Fangxu Yu, Tao Feng, Dehai Min, Lu Cheng, Ge Liu, Tianyi Zhou

机构 * University of Maryland, College Park(马里兰大学帕克分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois Chicago(伊利诺伊大学芝加哥分校) MBZUAI(Mohamed Bin Zayed University of Artificial Intelligence)

AI总结 研究针对时间序列推理中不同模型能力互补及特性差异问题,提出基于图的TSRouter动态路由框架,通过构建异构图并将路由设为候选评分问题来选择最优模态-模型对,在多任务评估中性能显著提升,还具备零样本泛化等优势。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17950 2026-07-21 cs.CV 版本更新

UPLiFT: Efficient Pixel-Dense Feature Upsampling with Local Attenders

UPLiFT:高效像素密集特征上采样与局部关注者

Matthew Walmer, Saksham Suri, Anirud Aggarwal, Abhinav Shrivastava

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Meta

AI总结 UPLiFT通过高效局部关注者操作符实现低成本的像素密集特征上采样,优于现有方法。

Comments Accepted to CVPR 2026 as conference paper. Website: see https://www.cs.umd.edu/~mwalmer/uplift/. Code and Models: see https://github.com/mwalmer-umd/UPLiFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17366 2026-07-16 cs.LG eess.SP 版本更新

EM-GANSim: Real-time and Accurate EM Simulation Using Conditional GANs for 3D Indoor Scenes

EM-GANSim:使用条件生成对抗网络进行3D室内场景的实时准确电磁仿真

Ruichen Wang, Dinesh Manocha

机构 * University of Maryland, College Park(马里兰大学College Park分校)

AI总结 研究针对3D室内无线通信电磁仿真问题,提出EM-GANSim方法,用改进条件GAN结合电磁理论预测功率分布,经多场景评估具有高准确率和低计算时间,是首个此类实时算法,还将发布代码和数据集。

Comments 12 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08964 2026-07-14 cs.AI 版本更新

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

长视野终端基准测试:使用基于密集奖励的评分方式测试智能体在长视野终端任务中的极限

Zongxia Li, Zhongzhi Li, Yucheng Shi, Ruhan Wang, Junyao Yang, Zhichao Liu, Xiyang Wu, Anhao Li, Yue Yu, Ninghao Liu, Lichao Sun, Haotao Mi, Leowei Liang

机构 * Tencent(腾讯) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) University of Minnesota, Twin Cities(明尼苏达大学双城分校) Indiana University(印第安纳大学) Lehigh University(里海大学) National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 研究针对现有终端基准测试局限,引入长视野终端基准测试(Long-Horizon-Terminal-Bench),含46个长视野任务。通过分解为分级子任务提供密集中间奖励,评估15个前沿模型,揭示改进空间,分析失败模式,发布该基准测试助力长视野终端智能体发展。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22588 2026-07-10 cs.CL cs.AI cs.LG 版本更新

Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

重新思考大语言模型作为评判器:通过语义能力不对称利用小语言模型进行表示作为评判器

Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Daqing He

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Pittsburgh(匹兹堡大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Connecticut(康涅狄格大学)

AI总结 研究探讨小语言模型能否作高效评估器,基于语义能力不对称假设提出“表示作为评判器”范式,通过INSPECTOR框架实例化,实验显示其在推理基准测试中性能出色,为可扩展评估提供了更优选择。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14833 2026-07-07 eess.IV cs.CV q-bio.QM 版本更新

Cell as Point: One-Stage Framework for Efficient Cell Tracking

细胞即点:高效细胞追踪的单阶段框架

Yaxuan Song, Jianan Fan, Heng Huang, Mei Chen, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Department of Computer Science, University of Maryland College Park(马里兰大学学院公园分校计算机科学系) Microsoft(微软公司)

AI总结 提出细胞追踪单阶段框架CAP,将细胞视为点,利用轨迹相关性联合追踪,消除检测或分割需求。创新采用自适应事件引导采样和滚动窗口推理策略,解决数据不平衡与长序列推理问题,性能优于现有方法。

Comments 34 pages, 8 figures, 8 tables. Accepted by Pattern Recognition. Code is available at https://github.com/YXSong000/CAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29173 2026-07-01 cs.RO 版本更新

TacGen: Touch Is a Necessary Dimension of Physical-World Representation -- Addressing Tactile Data Scarcity with Scalable Vision-to-Touch Alignment and Generation

TacGen: 触觉是物理世界表征的必要维度——通过可扩展的视觉到触觉对齐与生成解决触觉数据稀缺问题

Wanghao Ye, Aarosh Das, Sihan Chen, Yiting Wang, Bowei Tian, Guoheng Sun, Shwai He, Zheyu Shen, Ziyao Wang, Yexiao He, Zhaoyi Liu, Meng Liu, Yuning Zhang, Meng Feng, Ziyi Wang, Yilong Dai, Yifei Dong, Siyuan Peng, Zhenle Duan, Joshua Liu, Lang Xiong, Ang Li

机构 * University of Maryland, College Park(马里兰大学帕克分校) Carnegie Mellon University(卡内基梅隆大学) University of Alabama(阿拉巴马大学) University of Washington(华盛顿大学) Stanford University(斯坦福大学)

AI总结 针对触觉数据稀缺问题,提出TacGen方法,通过视觉-触觉对比对齐和潜在空间残差MLP生成器合成触觉潜在表示,在质量、密度、硬度等物理属性预测上显著优于纯视觉模型,并大幅提升触觉操作性能。

Comments 49 pages, 29 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.01447 2026-06-26 cs.LG cs.GT 版本更新

Decentralized Best-Response-Based Learning in Two-Player Zero-Sum Stochastic Games: A Finite-Sample Analysis

两人零和随机博弈中基于最优响应的去中心化学习:有限样本分析

Zaiwei Chen, Kaiqing Zhang, Eric Mazumdar, Asuman Ozdaglar, Adam Wierman

机构 * Purdue University(普渡大学) University of Maryland, College Park(马里兰大学学院公园分校) Caltech(加州理工学院) MIT(麻省理工学院)

AI总结 本文对两人零和矩阵博弈和随机博弈中的去中心化学习进行有限样本分析,提出基于最优响应的学习算法,并证明其样本复杂度。

Comments A preliminary version [arXiv:2303.03100] of this paper, with a subset of the results that are presented here, was presented at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02968 2026-06-25 gr-qc astro-ph.IM cs.LG 版本更新

Flexible Gravitational-Wave Parameter Estimation with Transformers

基于Transformer的灵活引力波参数估计

Annalena Kofler, Maximilian Dax, Stephen R. Green, Jonas Wildberger, Nihar Gupte, Jakob H. Macke, Jonathan Gair, Alessandra Buonanno, Bernhard Schölkopf

机构 * Max Planck Institute for Intelligent Systems, Max-Planck-Ring 4, 72076 T\"ubingen, Germany Max Planck Institute for Gravitational Physics (Albert Einstein Institute), Am M\"uhlenberg 1, 14476 Potsdam, Germany ELLIS Institute T\"ubingen, Maria-von-Linden-Straße 2, 72076 T\"ubingen, Germany T\"ubingen AI Center, Maria-von-Linden-Straße 1, 72076 T\"ubingen, Germany Nottingham Centre of Gravity \& School of Mathematical Sciences, University of Nottingham, University Park, Nottingham, NG7 2RD, United Kingdom Department of Physics, University of Maryland, College Park, MD 20742, USA Machine Learning in Science, University of T\"ubingen \& T\"ubingen AI Center, 72076 T\"ubingen, Germany

AI总结 提出灵活Transformer架构Dingo-T1,通过训练策略适应不同分析设置,实现引力波参数估计,支持多种配置和一致性测试,中位数采样效率从1.4%提升至4.2%。

Comments 5+15 pages, 3+8 figures

Journal ref Phys. Rev. Lett. 136, 251401, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12983 2026-06-23 cs.LG cs.CC 版本更新

Decision Tree Learning on Product Spaces

在产品空间上进行决策树学习

Arshia Soltani Moakhar, Faraz Ghahremani, Kiarash Banihashem, MohammadTaghi Hajiaghayi

机构 * Department of Computer Science, University of Maryland, College Park, USA(大学计算机科学系,马里兰大学,College Park,美国)

AI总结 本文研究了在任意产品分布下决策树贪心启发法的理论分析,证明了贪心算法能构造出近似决策树,并提出了一种无需参数的算法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14145 2026-06-23 cs.CL cs.CV 版本更新

MMOU: A Massive Multi-Task Omni Understanding and Reasoning Benchmark for Long and Complex Real-World Videos

MMOU:面向长且复杂真实世界视频的大规模多任务全模态理解与推理基准

Arushi Goel, Sreyan Ghosh, Vatsal Agarwal, Nishit Anand, Kaousheik Jayakumar, Lasha Koroshinadze, Yao Xu, Katie Lyons, James Case, Karan Sapra, Kevin J. Shih, Siddharth Gururani, Abhinav Shrivastava, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Bryan Catanzaro, Mohammad Shoeybi, Wei Ping

机构 * NVIDIA, USA(NVIDIA美国分公司) University of Maryland, College Park, USA(马里兰大学帕克分校)

AI总结 提出MMOU基准,包含2万个人工标注问题与11877个长视频,覆盖13项技能,评估多模态大模型在长视频中的全模态理解与推理能力,最佳闭源模型仅64.2%准确率,开源模型46.8%。

Comments Project Page: https://huggingface.co/datasets/nvidia/MMOU

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21357 2026-06-23 stat.ML cs.LG 版本更新

Conditional neural control variates for variance reduction in Bayesian inverse problems

条件神经控制变量用于贝叶斯逆问题中的方差缩减

Ali Siahkoohi, Hyunwoo Oh

机构 * Department of Computer Science University of Central Florida(计算机科学系佛罗里达中央大学) Department of Physics and Maryland Center for Fundamental Physics University of Maryland College Park(物理系马里兰根本物理中心马里兰大学学院公园分校)

AI总结 提出条件神经控制变量方法,利用联合模型-数据样本学习摊销控制变量,通过Stein恒等式和分层耦合层架构,显著降低贝叶斯逆问题中蒙特卡洛估计的方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08091 2026-06-23 cs.CL cs.AI cs.HC 版本更新

Arguments that Alter Minds: LLM Rationales Sway Human (and LLM) Notions of Plausibility

改变思维的观点:LLM 理由影响人类(和 LLM)对合理性的看法

Shramay Palta, Peter Rankel, Sarah Wiegreffe, Rachel Rudinger

机构 * University of Maryland, College Park(马里兰大学学院公园分校)

AI总结 研究 LLM 生成的赞成/反对理由如何影响人类和 LLM 对常识基准答案的合理性判断,发现理由能显著改变判断,表明 LLM 可影响人类信念。

Comments ACL 2026 Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-06-17 cs.CR cs.AI 版本更新

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏