arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

2026-05-12 至 2026-05-12 共收录 14
2605.10806 2026-05-12 cs.CV cs.AI cs.LG

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10516 2026-05-12 cs.AI

Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability

一致性作为可检验的属性:评估AI代理可靠性的统计方法

Harsh Raj, Niranjan Orkat, Suvrorup Mukherjee, Aritra Guha, Cheryl Flynn, Subhabrata Majumdar

机构 * Northeastern University(东北大学) University of Pécs(佩奇大学) University of Michigan(密歇根大学) AT&T Chief Data Office(AT&T首席数据办公室) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

AI总结 本文提出了一种评估AI代理可靠性的统计方法,通过输出级可靠性和轨迹级稳定性指标,揭示代理核心能力与执行鲁棒性之间的差异,验证了轨迹一致性指标在诊断敏感性上的优势。

Comments 33 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10186 2026-05-12 cs.CL cs.AI

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

LegalCiteBench: 评估法律语言模型中的引文可靠性

Sijia Chen, Hang Yin, Shunfan Zhou

机构 * Northeastern University(东北大学) Phala

AI总结 本文提出LegalCiteBench,用于评估法律语言模型在闭书环境下引文恢复、验证和案例匹配的能力,发现即使最强模型在引文检索和完成任务上得分低于7/100,且多数模型存在误导性引文问题。

Comments Preprint. 23 pages including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10045 2026-05-12 cs.CV

ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models

ExtraVAR: 用于视觉自回归模型中分辨率外推的阶段感知RoPE重映射

Feihong Yan, Shaoyu Liu, Haixuan Wang, Shuai Lu, Linfeng Zhang, Huiqi Li, Xiangyang Ji

机构 * Beijing Institute of Technology(北京理工大学) Xidian University(西安电子科技大学) Northeastern University at Qinhuangdao(秦皇岛东北大学) Shanghai Jiao Tong University(上海交通大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出ExtraVAR,通过阶段感知RoPE重映射解决视觉自回归模型中分辨率外推的全局重复、局部重复和细节退化问题,引入熵驱动自适应注意力校准提升结构和细节质量。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09314 2026-05-12 cs.AI

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

大语言模型如何被说服:几个被重定向的注意力头

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Skywork AI

AI总结 研究揭示大语言模型在被说服时,少量中间层注意力头决定答案,通过重定向注意力产生事实性错误,该机制在开源LLM和现实攻击场景中均有效。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06969 2026-05-12 cs.CV

Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

将多模态大语言模型引入红外-可见图像融合质量评估

Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) University of Washington(华盛顿大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

AI总结 本文提出FuScore,利用多模态大语言模型生成连续质量评分,以更精确区分质量相近的融合图像,并结合多维子维度一致性和三重目标函数提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03783 2026-05-12 cs.LG cs.AI cs.CL

Efficient Estimation of Kernel Surrogate Models for Task Attribution

高效估计用于任务归因的核替代模型

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

AI总结 本文提出核替代模型用于高效估计任务归因,通过第二阶分析建立线性替代模型与影响函数的联系,并在多个任务设置中验证其有效性,实现更高的相关性和可扩展性。

Comments 27 pages. Appeared in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09212 2026-05-12 cs.LG

Rethinking Ratio-Based Trust Regions for Policy Optimization in Multi-Agent Reinforcement Learning

重新思考基于比率的信任区域用于多智能体强化学习中的策略优化

Chulabhaya Wijesundara, Andrea Baisero, Zhongheng Li, Gregory Castañón, Alan Carlin, Christopher Amato

机构 * Northeastern University(东北大学) STR University of California, Irvine(加州大学尔湾分校)

AI总结 本文提出MARS方法,通过乘法对称几何屏障替代传统比率信任区域机制,提升多智能体策略优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08776 2026-05-12 cs.AI

Reasoning Compression with Mixed-Policy Distillation

基于混合策略蒸馏的推理压缩

Han Yang, Mingyan Wu, Bailan He, Zeyu Cao, Sikuan Yan, Kevin Qinghong Lin, Zifeng Ding

机构 * Technical University of Munich(慕尼黑技术大学) GESIS – Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Northeastern University(东北大学) LMU Munich(慕尼黑大学) Siemens AG(西门子股份公司) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Mina AI

AI总结 本文提出混合策略蒸馏框架,通过从大模型压缩推理轨迹到小模型,有效减少token使用并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08467 2026-05-12 cs.LG

CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

CUDAHercules:用于LLM的硬件感知专家级CUDA优化基准测试

Shiyang Li, Zijian Zhang, Guangyan Sun, Yuebo Luo, Winson Chen, Yanzhi Wang, Mingyi Hong, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Northeastern University(东北大学)

AI总结 CUDAHercules基准测试评估生成CUDA代码与人类专家级优化的差距,揭示自动化CUDA编程在硬件感知和优化策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20012 2026-05-12 eess.SP cs.LG

Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems

可靠的基于大语言模型的边缘-云-专家级联系统用于电信知识系统

Qiushuo Hou, Sangwoo Park, Matteo Zecchin, Yunlong Cai, Guanding Yu, Osvaldo Simeone, Tommaso Melodia

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Centre for Intelligent Information Processing Systems (CIIPS), Department of Engineering, King’s College London(伦敦国王学院工程系智能信息处理系统中心) Intelligent Networked Systems Institute (INSI) at Northeastern University(东北大学智能网络化系统研究所)

AI总结 本文提出一种边缘-云-专家级联的LLM知识系统,通过问答流程实现决策,利用高效边缘模型处理常规查询,云模型处理复杂问题,必要时引入专家。通过统计严谨的阈值选择方法,保证在给定置信水平下可靠性。

Comments This paper has been submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26574 2026-05-12 cs.AI cond-mat.other cs.CL hep-th quant-ph

Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark

探测人工智能推理的临界点(CritPt):一个前沿物理研究基准

Minhui Zhu, Minyang Tian, Xiaocheng Yang, Tianci Zhou, Lifan Yuan, Penghao Zhu, Eli Chertkov, Shengyan Liu, Yufeng Du, Ziming Ji, Indranil Das, Qingzhi Chen, Junyi Cao, Yufeng Du, Jiabin Yu, Peixue Wu, Jinchen He, Yifan Su, Yikun Jiang, Yujie Zhang, Chang Liu, Ze-Min Huang, Weizhen Jia, Yunkai Wang, Farshid Jafarpour, Yong Zhao, Xinan Chen, Jessie Shelton, Aaron W. Young, John Bartolotta, Wenchao Xu, Yue Sun, Anjun Chu, Victor Colussi, Chris Akers, Nathan Brooks, Wenbo Fu, Jinchao Zhao, Marvin Qi, Anqi Mu, Yubo Yang, Allen Zang, Yang Lyu, Peizhi Mai, Christopher Wilson, Xuefei Guo, Juntai Zhou, Daniel Inafuku, Chi Xue, Luyu Gao, Ze Yang, Yaïr Hein, Yonatan Kahn, Kevin Zhou, Di Luo, John Drew Wilson, Jarrod T. Reilly, Dmytro Bandak, Ofir Press, Liang Yang, Xueying Wang, Hao Tong, Nicolas Chia, Eliu Huerta, Hao Peng

机构 * Argonne National Laboratory(阿贡国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Ohio State University(俄亥俄州立大学) Independent(独立) Northeastern University(东北大学) Caltech(加州理工学院) University of Florida(佛罗里达大学) University of Waterloo(滑铁卢大学) University of Maryland, College Park(马里兰大学学院公园分校) Columbia University(哥伦比亚大学) Perimeter Institute for Theoretical Physics(理论物理研究所) University of Connecticut(康涅狄格大学) University of Cologne(科隆大学) The Chinese University of Hong Kong(香港中文大学) Utrecht University(乌得勒支大学) Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院) Paul Scherrer Institute(保罗·谢尔研究所)

AI总结 本文提出CritPt基准,用于测试LLM在未发表的科研级推理任务中的能力,涵盖现代物理多个领域,发现当前LLM在复杂科研挑战中表现有限,仅能实现5.7%的准确率。

Comments 40 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08327 2026-05-12 cs.LG cs.AI

Interactive Critique-Revision Training for Reliable Structured LLM Generation

交互式批评-修订训练用于可靠的结构化大语言模型生成

Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

机构 * The George Washington University(乔治华盛顿大学) Northeastern University(东北大学) United States Military Academy(美国军事学院)

AI总结 本文提出DPA-GRPO方法,通过生成器-验证器游戏中的结构化验证干预,提升结构化决策的准确性与一致性,实验显示其在TaxCalcBench TY24上优于零样本生成和生成器-only RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08232 2026-05-12 cs.LG physics.comp-ph physics.flu-dyn

Hierarchical Multi-Fidelity Learning for Predicting Three-Dimensional Flame Wrinkling and Turbulent Burning Velocity

分层多保真学习用于预测三维火焰褶皱和湍流燃烧速度

Saghar Zolfaghari, Yu Xie, Junfeng Yang, Safa Jamali

机构 * Department of Mechanical and Industrial Engineering, Northeastern University, Boston, MA 02115, USA(机械与工业工程系,东北大学,波士顿,马萨诸塞州,02115,美国) School of Mechanical Engineering, University of Leeds, Leeds, UK(机械工程学院,利兹大学,利兹,英国)

AI总结 本文提出分层多保真神经网络框架MuFiNNs,通过整合稀疏高保真实验数据与结构化低保真表示,有效预测三维火焰褶皱和湍流燃烧速度,克服了高保真实验数据获取的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏