arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

共收录 1238
2511.15408 2026-05-15 cs.CL cs.AI cs.IR cs.MA cs.NE

Chinese Short-Form Creative Content Generation via Explanation-Oriented Multi-Objective Optimization

通过解释导向的多目标优化生成中文短文本创意内容

Shanlin Zhou, Xinpeng Wang, Jianxun Lian, Zhenghao Liu, Laks V. S. Lakshmanan, Xiaoyuan Yi, Yongtao Hao

机构 * Tongji University(同济大学) Microsoft Research Asia(微软亚洲研究院) Northeastern University(东北大学) University of British Columbia(不列颠哥伦比亚大学)

AI总结 本文提出MAGIC-HMO框架,通过多目标优化解决中文短文本生成中个性化约束与解释可靠性问题,在中文婴儿命名任务中优于六个基线模型。

Comments 19 pages,10 figures. Submitted to ACM for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14111 2026-05-15 cs.AI cs.HC

Modeling Bounded Rationality in Drug Shortage Pharmacists Using Attention-Guided Dynamic Decomposition

在药物短缺情况下,利用注意力引导的动态分解建模有限理性药剂师

Yaniv Eliyahu Amiri, Noah Chicoine, Jacqueline Griffin, Stacy Marsella

机构 * Khoury College of Computer Sciences, Northeastern University, Boston, MA, USA(东北大学科里学院计算机科学系,波士顿,马萨诸塞州,美国) Department of Mechanical and Industrial Engineering, Northeastern University, Boston, MA, USA(东北大学机械与工业工程系,波士顿,马萨诸塞州,美国) Department of Psychology, Northeastern University, Boston, MA, USA(东北大学心理学系,波士顿,马萨诸塞州,美国)

AI总结 本文提出一种有限理性注意力引导决策框架,通过动态分解药物为高成本推理子集和低成本监控子集,模拟不同场景显示注意力引导规划能稳定决策而不需完全状态推理。

Comments Accepted at CogSci 2026. 6 pages plus references, 1 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02920 2026-05-15 cs.LG cs.CV cs.SI

Learning Multimodal Embeddings for Traffic Accident Prediction and Causal Estimation

学习多模态嵌入用于交通事故预测和因果估计

Ziniu Zhang, Minxuan Duan, Haris N. Koutsopoulos, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

AI总结 本文通过结合道路网络数据与卫星图像,提出多模态学习方法,提升交通事故预测精度,并发现降水、高速道路和季节因素对事故率的影响。

Comments 17 pages. Appeared in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20984 2026-05-15 cs.CR cs.LG

ACE: A Security Architecture for LLM-Integrated App Systems

ACE:用于集成大语言模型的应用系统的安全架构

Evan Li, Tushin Mallick, Evan Rose, William Robertson, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

AI总结 本文提出ACE架构,通过分离规划阶段提升LLM集成应用系统的安全性和可用性,验证其在对抗性攻击中的有效性。

Comments 25 pages, 13 figures, 8 tables; accepted by Network and Distributed System Security Symposium (NDSS) 2026

Journal ref Network and Distributed System Security (NDSS) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13803 2026-05-14 cs.CV

EvoGround: Self-Evolving Video Agents for Video Temporal Grounding

EvoGround:用于视频时间定位的自进化视频智能体

Minjoon Jung, Byoung-Tak Zhang, Lorenzo Torresani

机构 * Seoul National University(首尔国立大学) Northeastern University(东北大学)

AI总结 本文提出EvoGround框架,通过两个自进化智能体自学习视频时间定位,无需人工标注数据,在多个基准上表现优异。

Comments Project page: https://minjoong507.github.io/projects/EvoGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13625 2026-05-14 cs.AI

How to Interpret Agent Behavior

如何解释智能体行为

Jie Gao, Kaiser Sun, Jen-tse Huang, Katherine Van Koevering, Sijie Ji, Heyuan Huang, Weiyan Shi, Zhuoran Lu, Ziang Xiao, Daniel Khashabi, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) California Institute of Technology(加州理工学院) Northeastern University(东北大学) Purdue University(普渡大学)

AI总结 本文提出ACT*ONOMY框架,通过构建行为分类体系和开放仓库,帮助研究人员更一致地解读智能体行为,提升监控与控制能力。

Comments 34 pages in total

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13316 2026-05-14 cs.CL cs.LG

Do Activation Verbalization Methods Convey Privileged Information?

激活 verbalization 方法是否传递了特权信息?

Millicent Li, Alberto Mario Ceballos Arroyo, Giordano Rogers, Naomi Saphra, Byron C. Wallace

机构 * Northeastern University(东北大学) Kempner Institute, Harvard University(哈佛大学凯姆纳研究所) Boston University(波士顿大学)

AI总结 本文评估了激活 verbalization 方法的有效性,发现其可能反映生成器模型的知识而非目标模型的操作,需更精准的基准测试。

Comments ICML 2026. 41 pages, 23 tables, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12755 2026-05-14 cs.AI

State-Centric Decision Process

以状态为中心的决策过程

Sungheon Jeong, Ryozo Masukawa, Sanggeon Yun, Mahdi Imani, Mohsen Imani

机构 * University of California, Irvine(加州大学尔湾分校) Northeastern University(东北大学)

AI总结 本文提出SDP框架,通过让智能体逐步构建缺失的状态空间和转换规则,解决语言环境缺乏运行时结构的问题,并在多个基准测试中取得最佳无训练结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21577 2026-05-14 cs.LG

Collaborative Parameter Learning: Mitigating Forgetting via Parameter-Level Gradient Analysis

协同参数学习:通过参数级梯度分析缓解遗忘

Mutian Yang, Zisen Zhan, Yutong Chen, Haolin Li, Kaiwen Wang, Kaili Zheng, Yuguang Wang, Qi Wang, Jiandong Gao, Ji Wu

机构 * Department of Electronic Engineering, Tsinghua University, Beijing, China(清华大学电子工程系,北京,中国) Institute of Medical Technology, Peking University Health Science Center, Peking University, Beijing, China(北京大学医学部医学技术研究所,北京大学,北京,中国) College of Information Science and Engineering, Northeastern University, Shenyang, China(东北大学信息科学与工程学院,沈阳,中国) College of AI, Tsinghua University, Beijing, China(清华大学人工智能学院,北京,中国) Beijing National Research Center for Information Science and Technology, Beijing, China(北京信息科学与技术国家研究中心,北京,中国)

AI总结 本文提出协同参数学习方法,通过分析参数级梯度相似性,识别冲突参数和协作参数,冻结冲突参数以减少遗忘,提升模型在多任务和多语言场景下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03167 2026-05-14 cs.CL cs.AI cs.LG

Where Do Reasoning Models Refuse?

推理模型拒绝发生在何处?

Kureha Yamaguchi, Benjamin Etheridge, Andy Arditi

机构 * The Alan Turing Institute(艾伦·图灵研究所) University of Oxford(牛津大学) Northeastern University(东北大学)

AI总结 研究探讨推理模型在生成响应前拒绝决策的位置,发现推理链中的初始句子对拒绝决定有显著影响,并通过激活方向分析揭示了拒绝机制。

Comments v1 accepted to the ICML 2025 Workshop on Reliable and Responsible Foundation Models (R2FM). 20 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12570 2026-05-14 cs.CV

M3Net: A Macro-to-Meso-to-Micro Clinical-inspired Hierarchical 3D Network for Pulmonary Nodule Classification

M3Net:一种受临床诊断流程启发的宏-中-微三级层次3D网络用于肺结节分类

Jinyue Li, Yuzhou Yu, Jingjing Yang, Meng Fu, Yani Zhang, Shuyao He, Dianlong Ge, Xin Ning, Yannan Chu, Qiankun Li

机构 * Hefei Cancer Hospital of CAS, Institute of Health and Medical Technology, Hefei Institutes of Physical Science, Chinese Academy of Sciences(中国科学院合肥医疗健康研究院、健康与医疗技术研究所、物理研究所) University of Science and Technology of China(中国科学技术大学) Graduate School, Bengbu Medical College(蚌埠医疗学院研究生院) Department of Pulmonary and Critical Care Medicine, The First Affiliated Hospital of USTC, Division of Life Sciences and Medicine, University of Science and Technology of China (USTC)(中国科学技术大学附属第一医院呼吸与危重症医学科、生命科学与医学学院) Northeastern University(东北大学) Institute of Semiconductors, Chinese Academy of Sciences(中国科学院半导体研究所) College of Computing and Data Science (CCDS), Nanyang Technological University(南洋理工大学计算与数据科学学院)

AI总结 本文提出M3Net,通过多尺度上下文信息整合,提升肺结节分类的准确性和可解释性,在LIDC-IDRI和USTC-FHLN数据集上取得最佳性能。

Comments Published in Information Fusion (2026), 15 pages, 5 figures

Journal ref Information Fusion, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12364 2026-05-13 cs.CR cs.LG cs.MA

Attacks and Mitigations for Distributed Governance of Agentic AI under Byzantine Adversaries

针对拜占庭攻击者下的分布式代理AI治理的攻击与缓解措施

Matthew D. Laws, Alina Oprea, Cristina Nita-Rotaru

机构 * Northeastern University(东北大学)

AI总结 本文分析了 compromised Provider 发起的攻击,并提出三种解决方案,在安全与性能之间进行权衡。

Comments 18 pages, 18 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12264 2026-05-13 cs.CR cs.CL cs.LG

Reconstruction of Personally Identifiable Information from Supervised Finetuned Models

从监督微调模型中重建个人身份信息

Sae Furukawa, Alina Oprea

机构 * Northeastern University(东北大学)

AI总结 本文研究了从监督微调模型中重建个人身份信息的问题,提出COVA算法在前缀攻击下优于现有提取方法,揭示了不同PII类型泄露程度差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12138 2026-05-13 cs.CV cs.CL cs.IR

Design Your Ad: Personalized Advertising Image and Text Generation with Unified Autoregressive Models

为广告设计:基于统一自回归模型的个性化广告图像和文本生成

Yexing Xu, Wei Feng, Shen Zhang, Haohan Wang, Yuxin Qin, Yaoyu Li, Ao Ma, Yuhao Luo, Lu Wang, Xudong Ren, Haoran Wang, Run Ling, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Longguang Wang, Yulan Guo

机构 * Sun Yat-Sen University(中山大学) Northeastern University(东北大学)

AI总结 本文提出统一广告生成模型Uni-AdGen,通过单个自回归框架生成个性化图文广告,结合前景感知模块和指令微调提升生成质量,并引入大规模广告数据集和新指标提升个性化生成效果。

Comments 22 pages, 19 figures, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11161 2026-05-13 cs.LG cs.AI

Interpretability Can Be Actionable

可解释性可以是可操作的

Hadas Orgad, Fazl Barez, Tal Haklay, Isabelle Lee, Marius Mosbach, Anja Reusch, Naomi Saphra, Byron Wallace, Sarah Wiegreffe, Eric Wong, Ian Tenney, Mor Geva

机构 * Kempner Institute at Harvard University(哈佛大学凯默纳研究所) University of Southern California(美国南加州大学) Mila – Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) Google DeepMind(谷歌DeepMind) Tel Aviv University(特拉维夫大学) University of Pennsylvania(宾夕法尼亚大学) University of Maryland(马里兰大学) University of Oxford(牛津大学) Northeastern University(东北大学) Boston University(波士顿大学)

AI总结 本文探讨了可解释性研究的核心问题,提出应以可操作性作为评价标准,通过具体性和验证性两个维度分析阻碍实际应用的障碍,并提出五个领域和评估框架。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24652 2026-05-13 cs.CL cs.LG

Demystifying When Pruning Works via Representation Hierarchies

通过表示层次解析剪枝何时有效

Shwai He, Guoheng Sun, Haichao Zhang, Yun Fu, Ang Li

机构 * University of Maryland, College Park, USA(美国马里兰大学学院公园分校) Northeastern University, USA(美国东北大学)

AI总结 本文通过分析语言模型内部计算的三个空间,揭示剪枝在非生成任务中有效而在生成任务中失效的原因,为剪枝应用提供指导。

Comments ICML 2026. 24 pages, 21 figures, and 3 tables. Includes an appendix with supplementary experiments and derivations

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10806 2026-05-12 cs.CV cs.AI cs.LG

PhyGround: Benchmarking Physical Reasoning in Generative World Models

PhyGround:用于生成世界模型中物理推理的基准测试

Juyi Lin, Arash Akbari, Yumei He, Lin Zhao, Haichao Zhang, Arman Akbari, Xingchen Xu, Zoe Y. Lu, Enfu Nan, Hokin Deng, Edmund Yeh, Sarah Ostadabbas, Yun Fu, Jennifer Dy, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Tulane University(路易斯安那州立大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 PhyGround通过250个精心设计的提示和13种物理定律的分类,评估视频生成中的物理推理能力,采用大规模人工研究验证并发布专用VLM评估工具PhyJudge-9B,显著降低偏见。

Comments Preprint. 56 pages, 39 figures, 40 tables. Project page: https://phyground.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10516 2026-05-12 cs.AI

Consistency as a Testable Property: Statistical Methods to Evaluate AI Agent Reliability

一致性作为可检验的属性:评估AI代理可靠性的统计方法

Harsh Raj, Niranjan Orkat, Suvrorup Mukherjee, Aritra Guha, Cheryl Flynn, Subhabrata Majumdar

机构 * Northeastern University(东北大学) University of Pécs(佩奇大学) University of Michigan(密歇根大学) AT&T Chief Data Office(AT&T首席数据办公室) Indian Institute of Management Bangalore(班加罗尔印度管理学院)

AI总结 本文提出了一种评估AI代理可靠性的统计方法,通过输出级可靠性和轨迹级稳定性指标,揭示代理核心能力与执行鲁棒性之间的差异,验证了轨迹一致性指标在诊断敏感性上的优势。

Comments 33 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10186 2026-05-12 cs.CL cs.AI

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

LegalCiteBench: 评估法律语言模型中的引文可靠性

Sijia Chen, Hang Yin, Shunfan Zhou

机构 * Northeastern University(东北大学) Phala

AI总结 本文提出LegalCiteBench,用于评估法律语言模型在闭书环境下引文恢复、验证和案例匹配的能力,发现即使最强模型在引文检索和完成任务上得分低于7/100,且多数模型存在误导性引文问题。

Comments Preprint. 23 pages including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10045 2026-05-12 cs.CV

ExtraVAR: Stage-Aware RoPE Remapping for Resolution Extrapolation in Visual Autoregressive Models

ExtraVAR: 用于视觉自回归模型中分辨率外推的阶段感知RoPE重映射

Feihong Yan, Shaoyu Liu, Haixuan Wang, Shuai Lu, Linfeng Zhang, Huiqi Li, Xiangyang Ji

机构 * Beijing Institute of Technology(北京理工大学) Xidian University(西安电子科技大学) Northeastern University at Qinhuangdao(秦皇岛东北大学) Shanghai Jiao Tong University(上海交通大学) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出ExtraVAR,通过阶段感知RoPE重映射解决视觉自回归模型中分辨率外推的全局重复、局部重复和细节退化问题,引入熵驱动自适应注意力校准提升结构和细节质量。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09314 2026-05-12 cs.AI

How LLMs Are Persuaded: A Few Attention Heads, Rerouted

大语言模型如何被说服:几个被重定向的注意力头

Xiangkun Sun, Lingkai Kong, Aoqi Zhang, Liang Zeng, Tonghan Wang

机构 * Northeastern University(东北大学) Harvard University(哈佛大学) Tsinghua University(清华大学) Skywork AI

AI总结 研究揭示大语言模型在被说服时,少量中间层注意力头决定答案,通过重定向注意力产生事实性错误,该机制在开源LLM和现实攻击场景中均有效。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06969 2026-05-12 cs.CV

Bringing Multimodal Large Language Models to Infrared-Visible Image Fusion Quality Assessment

将多模态大语言模型引入红外-可见图像融合质量评估

Yuchen Guo, Junli Gong, Yao Lu, Xintong Xu, Yiuming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) University of Washington(华盛顿大学) Hong Kong Baptist University(香港 Baptist大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港 Baptist大学)

AI总结 本文提出FuScore,利用多模态大语言模型生成连续质量评分,以更精确区分质量相近的融合图像,并结合多维子维度一致性和三重目标函数提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03783 2026-05-12 cs.LG cs.AI cs.CL

Efficient Estimation of Kernel Surrogate Models for Task Attribution

高效估计用于任务归因的核替代模型

Zhenshuo Zhang, Minxuan Duan, Hongyang R. Zhang

机构 * Northeastern University(东北大学)

AI总结 本文提出核替代模型用于高效估计任务归因,通过第二阶分析建立线性替代模型与影响函数的联系,并在多个任务设置中验证其有效性,实现更高的相关性和可扩展性。

Comments 27 pages. Appeared in ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09212 2026-05-12 cs.LG

Rethinking Ratio-Based Trust Regions for Policy Optimization in Multi-Agent Reinforcement Learning

重新思考基于比率的信任区域用于多智能体强化学习中的策略优化

Chulabhaya Wijesundara, Andrea Baisero, Zhongheng Li, Gregory Castañón, Alan Carlin, Christopher Amato

机构 * Northeastern University(东北大学) STR University of California, Irvine(加州大学尔湾分校)

AI总结 本文提出MARS方法,通过乘法对称几何屏障替代传统比率信任区域机制,提升多智能体策略优化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08776 2026-05-12 cs.AI

Reasoning Compression with Mixed-Policy Distillation

基于混合策略蒸馏的推理压缩

Han Yang, Mingyan Wu, Bailan He, Zeyu Cao, Sikuan Yan, Kevin Qinghong Lin, Zifeng Ding

机构 * Technical University of Munich(慕尼黑技术大学) GESIS – Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所) Northeastern University(东北大学) LMU Munich(慕尼黑大学) Siemens AG(西门子股份公司) University of Cambridge(剑桥大学) University of Oxford(牛津大学) Mina AI

AI总结 本文提出混合策略蒸馏框架,通过从大模型压缩推理轨迹到小模型,有效减少token使用并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08467 2026-05-12 cs.LG

CUDAHercules: Benchmarking Hardware-Aware Expert-level CUDA Optimization for LLMs

CUDAHercules:用于LLM的硬件感知专家级CUDA优化基准测试

Shiyang Li, Zijian Zhang, Guangyan Sun, Yuebo Luo, Winson Chen, Yanzhi Wang, Mingyi Hong, Caiwen Ding

机构 * University of Minnesota(明尼苏达大学) Northeastern University(东北大学)

AI总结 CUDAHercules基准测试评估生成CUDA代码与人类专家级优化的差距,揭示自动化CUDA编程在硬件感知和优化策略上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20012 2026-05-12 eess.SP cs.LG

Reliable LLM-Based Edge-Cloud-Expert Cascades for Telecom Knowledge Systems

可靠的基于大语言模型的边缘-云-专家级联系统用于电信知识系统

Qiushuo Hou, Sangwoo Park, Matteo Zecchin, Yunlong Cai, Guanding Yu, Osvaldo Simeone, Tommaso Melodia

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院) Centre for Intelligent Information Processing Systems (CIIPS), Department of Engineering, King’s College London(伦敦国王学院工程系智能信息处理系统中心) Intelligent Networked Systems Institute (INSI) at Northeastern University(东北大学智能网络化系统研究所)

AI总结 本文提出一种边缘-云-专家级联的LLM知识系统,通过问答流程实现决策,利用高效边缘模型处理常规查询,云模型处理复杂问题,必要时引入专家。通过统计严谨的阈值选择方法,保证在给定置信水平下可靠性。

Comments This paper has been submitted to a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26574 2026-05-12 cs.AI cond-mat.other cs.CL hep-th quant-ph

Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark

探测人工智能推理的临界点(CritPt):一个前沿物理研究基准

Minhui Zhu, Minyang Tian, Xiaocheng Yang, Tianci Zhou, Lifan Yuan, Penghao Zhu, Eli Chertkov, Shengyan Liu, Yufeng Du, Ziming Ji, Indranil Das, Qingzhi Chen, Junyi Cao, Yufeng Du, Jiabin Yu, Peixue Wu, Jinchen He, Yifan Su, Yikun Jiang, Yujie Zhang, Chang Liu, Ze-Min Huang, Weizhen Jia, Yunkai Wang, Farshid Jafarpour, Yong Zhao, Xinan Chen, Jessie Shelton, Aaron W. Young, John Bartolotta, Wenchao Xu, Yue Sun, Anjun Chu, Victor Colussi, Chris Akers, Nathan Brooks, Wenbo Fu, Jinchao Zhao, Marvin Qi, Anqi Mu, Yubo Yang, Allen Zang, Yang Lyu, Peizhi Mai, Christopher Wilson, Xuefei Guo, Juntai Zhou, Daniel Inafuku, Chi Xue, Luyu Gao, Ze Yang, Yaïr Hein, Yonatan Kahn, Kevin Zhou, Di Luo, John Drew Wilson, Jarrod T. Reilly, Dmytro Bandak, Ofir Press, Liang Yang, Xueying Wang, Hao Tong, Nicolas Chia, Eliu Huerta, Hao Peng

机构 * Argonne National Laboratory(阿贡国家实验室) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Virginia Tech(弗吉尼亚理工大学) Ohio State University(俄亥俄州立大学) Independent(独立) Northeastern University(东北大学) Caltech(加州理工学院) University of Florida(佛罗里达大学) University of Waterloo(滑铁卢大学) University of Maryland, College Park(马里兰大学学院公园分校) Columbia University(哥伦比亚大学) Perimeter Institute for Theoretical Physics(理论物理研究所) University of Connecticut(康涅狄格大学) University of Cologne(科隆大学) The Chinese University of Hong Kong(香港中文大学) Utrecht University(乌得勒支大学) Harvard University(哈佛大学) ETH Zürich(苏黎世联邦理工学院) Paul Scherrer Institute(保罗·谢尔研究所)

AI总结 本文提出CritPt基准,用于测试LLM在未发表的科研级推理任务中的能力,涵盖现代物理多个领域,发现当前LLM在复杂科研挑战中表现有限,仅能实现5.7%的准确率。

Comments 40 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08327 2026-05-12 cs.LG cs.AI

Interactive Critique-Revision Training for Reliable Structured LLM Generation

交互式批评-修订训练用于可靠的结构化大语言模型生成

Fei Xu Yu, Zuyuan Zhang, Mahdi Imani, Nathaniel D. Bastian, Tian Lan

机构 * The George Washington University(乔治华盛顿大学) Northeastern University(东北大学) United States Military Academy(美国军事学院)

AI总结 本文提出DPA-GRPO方法,通过生成器-验证器游戏中的结构化验证干预,提升结构化决策的准确性与一致性,实验显示其在TaxCalcBench TY24上优于零样本生成和生成器-only RL基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08232 2026-05-12 cs.LG physics.comp-ph physics.flu-dyn

Hierarchical Multi-Fidelity Learning for Predicting Three-Dimensional Flame Wrinkling and Turbulent Burning Velocity

分层多保真学习用于预测三维火焰褶皱和湍流燃烧速度

Saghar Zolfaghari, Yu Xie, Junfeng Yang, Safa Jamali

机构 * Department of Mechanical and Industrial Engineering, Northeastern University, Boston, MA 02115, USA(机械与工业工程系,东北大学,波士顿,马萨诸塞州,02115,美国) School of Mechanical Engineering, University of Leeds, Leeds, UK(机械工程学院,利兹大学,利兹,英国)

AI总结 本文提出分层多保真神经网络框架MuFiNNs,通过整合稀疏高保真实验数据与结构化低保真表示,有效预测三维火焰褶皱和湍流燃烧速度,克服了高保真实验数据获取的限制。

详情

展开后加载摘要…

URL PDF HTML 收藏