arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

2026-07-08 至 2026-07-08 共收录 7
2607.06111 2026-07-08 eess.SY cs.AI cs.SY 新提交

LLM-Guided Measurement Credibility Correction for Trustworthy Industrial Process Inference

用于可信工业过程推理的大语言模型引导的测量可信度校正

Youcheng Zong, Runda Jia, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学)

AI总结 研究工业过程推理中测量可信度问题,提出大语言模型引导的测量可信度校正方法,通过转换测量语义、构建参考并校正冲突,使预测器输入更可信,在多任务中降低误差,增加少量参数且推理时间短,提升了预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05721 2026-07-08 cs.CL 新提交

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

SpanUQ:用于大语言模型生成的跨度级不确定性量化

Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

机构 * Amazon(亚马逊) Northeastern University(东北大学)

AI总结 研究大语言模型生成的跨度级不确定性量化问题,提出SPANUQ轻量级探测器,通过混合贝塔分布估计不确定性,经特殊训练方式构建基准。实验显示其在不确定性质量、速度及错误定位上表现出色,且能在多个大语言模型上通用。

Comments The project page is available at https://damon-demon.github.io/SpanUQ.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05645 2026-07-08 cs.LG physics.ao-ph 新提交

Domain-Adaptive Climate Downscaling Under Temporal Distribution Shift

时间分布变化下的域自适应气候降尺度

Shuochen Wang, Nishant Yadav, Auroop R. Ganguly

机构 * Northeastern University(东北大学) Microsoft(微软公司) The Institute for Experiential AI, Northeastern University(东北大学体验式人工智能研究所)

AI总结 研究针对美国大陆日温度降尺度的时间分布变化问题,提出时间域自适应降尺度框架,结合历史数据监督HR重建与域对齐,实验表明该模型优于其他方法,能提升HR气候预测稳健性,尤其在特定区域和条件下效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05315 2026-07-08 cs.RO 新提交

Socially-Aware Autonomous Doorway Traversal and Payload Delivery for Emergency Assistance

面向应急援助的具备社会感知能力的自主过门与物资递送机器人系统

Andrew Snowdy, Ananya Trivedi, Sarvesh Prajapati, Lorena Maria Genua, Taskin Padir

机构 * Department of Electrical and Computer Engineering, Northeastern University(美国东北大学电气与计算机工程系) Northeastern University(美国东北大学)

AI总结 针对机器人辅助应急疏散场景,以行为树为核心框架实现社会感知自主过门与救援物资递送功能,经多场景实验验证系统可靠性,为应急响应机器人提供实用基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00860 2026-07-08 cs.SI cs.AI cs.CL

GenPT: Beyond Self-Report for Reliable LLM Psychometrics via Generative Projective Testing

GenPT:通过生成式投射测试实现超越自我报告的可靠LLM心理测量

Ming Wang, Shuang Wu, Bixuan Wang, Lu Lin, Yuxin Chen, Xiaocui Yang, Daling Wang, Shi Feng, Yifei Zhang, Yufan Sun

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) School of Computing and Information Systems, Singapore Management University(新加坡管理学院计算机与信息学院) Mental Health Education Center, Northeastern University(东北大学心理健康教育中心) School of Psychology, Northeast Normal University(东北师范大学心理学系) Faculty of psychology, Southwest University(西南大学心理学系) School of Sociology and Psychology, Central University of Finance and Economics(中央财经大学社会学与心理学学院) College of Arts, Northeastern University(东北大学艺术学院)

AI总结 针对自我报告问卷在人格化智能体心理测量中存在的训练语料污染和方向性偏差问题,提出GenPT方法,通过改编投射测试范式并构建三阶段评估流程,实现了更可靠的心理状态测量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15600 2026-07-08 cs.RO cs.AI cs.CL cs.CV 版本更新

From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

从被动观察者到主动批评者:强化学习激发机器人操作的过程推理

Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Xiamen University Malaysia(厦门大学马来西亚分校) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xspark AI

AI总结 本文提出PRIMO R1框架,通过强化学习使视频MLLMs成为主动批评者,提升机器人操作中长期任务的监督准确性,实验表明其在过程推理和零样本泛化方面表现优异。

Comments Accepted to ECCV 2026. 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09696 2026-07-08 cs.CV 版本更新

ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models

ZeroBench:当代大型多模态模型的一个不可能的视觉基准测试

Jonathan Roberts, Mohammad Reza Taesiri, Ansh Sharma, Akash Gupta, Samuel Roberts, Ioana Croitoru, Simion-Vlad Bogolin, Jialu Tang, Florian Langer, Vyas Raina, Vatsal Raina, Hanyi Xiong, Vishaal Udandarao, Jingyi Lu, Shiyang Chen, Sam Purkis, Tianshuo Yan, Wenye Lin, Gyungin Shin, Qiaochu Yang, Anh Totti Nguyen, David I. Atkinson, Aaditya Baranwal, Alexandru Coca, Mikah Dang, Sebastian Dziadzio, Jakob D. Kunz, Kaiqu Liang, Alexander Lo, Brian Pulfer, Steven Walton, Charig Yang, Kai Han, Samuel Albanie

机构 * University of Cambridge(剑桥大学) University of Alberta(阿尔伯塔大学) The University of Hong Kong(香港大学) University of Oxford(牛津大学) Northeastern University(东北大学) Astadeus College of Southern Maryland(马里兰州南部学院) University of Geneva(日内瓦大学) University of Oregon(俄勒冈大学)

AI总结 针对大型多模态模型在图像解释方面不足但在现有视觉基准测试中优势易逝的问题,引入通过对抗过滤策划的ZeroBench基准测试,评估多个模型,展现其潜力并公开测试内容,为模型视觉能力评估提供长期有效的新基准。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏