arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Northeastern University(东北大学)

共收录 1238
2607.15180 2026-07-17 cs.LG cs.SY eess.SY 新提交

RTS Smoother-Guided Learning of Physics-Based Neural Differential Models

基于RTS平滑器引导的物理神经网络微分模型学习

Ahmet Demirkaya, Georgios Stratis, Tales Imbiriba, Zachary D. Danziger, Deniz Erdogmus

机构 * Northeastern University(东北大学) University of Massachusetts Boston(马萨诸塞大学波士顿分校) Emory University(埃默里大学)

AI总结 针对部分状态变量可测、动力学方程部分未知的情况,提出混合神经-物理框架,交替进行状态和参数估计,利用RTS平滑器和反向传播,能从测量中学习缺失的ODE组件,提升潜在状态重建和长期预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14499 2026-07-17 cs.AI 新提交

Contextualized Evaluation of Vision Language Models through Dynamic, Multi-turn Interactions

通过动态多轮交互对视觉语言模型进行情境化评估

Yijiang Li, Huiqi Zou, Bingyang Wang, Ziang Xiao

机构 * UC San Diego(加州大学圣地亚哥分校) Northeastern University(东北大学) Georgia Institute of Technology(佐治亚理工学院) Johns Hopkins University(约翰·霍普金斯大学)

AI总结 研究多模态大语言模型现实有效性问题,提出CEDI框架,通过三方交互、多轮半结构化对话及多种策略评估,应用于视觉幻觉,发现能揭示更多接近实际情况的幻觉,凸显其对MLLMs能力评估的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14152 2026-07-17 cs.HC cs.AI 新提交

"Trust Junk" Leads to Unjustified Support for Highly Discriminatory Predictive Models

“信任垃圾”导致对高度歧视性预测模型的不合理支持

Michael Correll, Lucy Havens, Mahsan Nourani

机构 * Northeastern University(东北大学)

AI总结 研究发现在可解释人工智能中,模型解释里提供的准确但多余或无关的数据会使人们对明显歧视性和不公平的模型产生不合理信任,提示XAI设计者和开发者要注意工作中的修辞及可视化带来的潜在问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14099 2026-07-17 cs.CL cs.AI cs.CV 新提交

Just Keep Prompting: Evaluating Repetitive Socratic Prompting in VLMs

只需持续提示:评估视觉语言模型中的重复苏格拉底式提示

Shayda Moezzi, Bishoy Galoaa, Lorena Genua, Taskin Padir, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

AI总结 研究视觉语言模型在反复提示下的稳定性,引入JKP多轮评估框架,用三种策略对模型提问,在STAR基准子集上评估GPT-4o、Gemini 2.5 Pro和Qwen3-VL-30B,发现重复提示利弊兼具且因模型而异,揭示了模型压力反应概况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12771 2026-07-17 cs.LG cs.CE cs.CL q-bio.BM 版本更新

Learning Mechanistic Reasoning for Chemical Reactions with Large Language Models

利用大语言模型学习化学反应的机理推理

Xingyu Dang, Haocheng Tang, Junmei Wang, Yanjun Li

机构 * Princeton University(普林斯顿大学) University of Pittsburgh(匹兹堡大学) Northeastern University(东北大学) University of Florida(佛罗里达大学)

AI总结 研究利用大语言模型学习化学反应机理推理,构建大规模推理数据集及福山基准,通过机理感知训练微调Qwen3 - 30B - A3B,在福山基准集A上精确路径匹配超FlowER模型,增强了语言模型的化学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13818 2026-07-16 cs.RO 新提交

Learning Robust Execution in Robotic Manipulation with Agentic Reinforcement Learning

通过智能强化学习在机器人操作中学习鲁棒执行

Xiaopeng Zhang, Yueyang Weng, Qi Liu, Yongjin Mu, Yanjie Li

机构 * School of Inteligence Science and Engineering, the Harbin Institute of Technology Shenzhen(哈尔滨工业大学(深圳)智能科学与工程学院) Faculty of Robot Science and Engineering, Northeastern University(东北大学机器人科学与工程学院)

AI总结 针对机器人操作面临的挑战,提出用两个互补指标评估执行质量,构建智能强化学习框架,通过高级决策恢复有效执行,在LIBERO基准测试中提升了执行成功率,增强了执行鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13497 2026-07-16 cs.RO 新提交

Layered Risk Mapping for Autonomous Patient Transport in Expeditionary Medical Facilities

用于远征医疗设施中自主患者运输的分层风险映射

Lorena Maria Genua, Sarvesh Prajapati, Damla Leblebicioglu, Taşkın Padır

机构 * Institute for Experiential Robotics, Northeastern University(体验式机器人研究所,东北大学)

AI总结 针对远征医疗设施中自主患者运输面临的复杂导航挑战,提出分层风险映射框架,融合多种环境危害,经配对蒙特卡洛评估及实际验证,有效降低碰撞率、提高障碍物清除率,满足相关运营模式规划要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02911 2026-07-16 cs.CL 版本更新

The Ghost Annotator: a Framework to Explore Human Label Variation in Content Moderation through Conformal Prediction

幽灵标注者:通过共形预测探索内容审核中人类标签变异的框架

Mirko Lai, Alessandra Urbinati, Simona Frenda, Fabiana Vernero, Marco Antonio Stranisci

机构 * Laboratory for the Modeling of Biological and Socio-technical Systems, Northeastern University(生物与社会技术系统建模实验室,东北大学) Heriot-Watt University(赫瑞-沃顿大学) aequa-tech Università del Piemonte Orientale(皮埃蒙特东方大学) Università degli Studi di Torino(托斯卡纳大学)

AI总结 提出结合共形预测与协同过滤式标注者表征的框架,通过幽灵预测度量和幽灵标注者表征量化模型预测与所有人类标注的分歧,并发现模型在标注者分歧时不确定性增加,但大型模型对无人类对齐文本更自信,且存在结构性人口统计偏差。

Comments The publishing of this preprint is contextual with the ACL ARR cycle system. After an encouraging review in January we revised and submit the paper on Arxiv. However, a new batch of reviewers raised additional issues that will lead to significant revisions of the experimental setting. Therefore, we decide to withdraw the manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10607 2026-07-16 cs.CV 版本更新

Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation

跟踪并描述任何运动:通过轨迹条件生成实现开放词汇时空字幕

Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

AI总结 研究提出TCAM框架,无需文本查询和区域提示,通过字幕感知重采样器在点粒度结合跟踪与语言,用现有分割注释训练,能描述视频中运动、定位时间及轨迹,优于密集视频字幕基线,匹配相关方法,为运动驱动视频理解提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21324 2026-07-15 cs.NE cs.LG 版本更新

Stochastic Quantum Spiking Neural Networks with Quantum Memory and Local Learning

具有量子记忆和局部学习的随机量子脉冲神经网络

Jiechen Chen, Bipin Rajendran, Osvaldo Simeone

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Institute for Intelligent Networked Systems, Northeastern University London(伦敦东北大学智能网络系统研究所)

AI总结 本文提出了一种具有量子记忆和局部学习的随机量子脉冲神经网络模型,通过单次 shot 实现事件驱动的随机脉冲生成,并通过硬件友好的局部学习规则进行训练,从而在固定参数数量下优于传统和量子脉冲神经网络。

Comments Published in IEEE Journal on Selected Areas in Communications

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04144 2026-07-15 cs.AI 版本更新

RippleBench: Capturing Ripple Effects Using Existing Knowledge Repositories

RippleBench: 利用现有知识库捕捉涟漪效应

Roy Rinberg, Usha Bhalla, Igor Shilov, Flavio P. Calmon, Rohit Gandikota

机构 * Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) Northeastern University(东北大学)

AI总结 提出RippleBench-Maker自动管道,从知识库检索语义邻居生成选择题,评估八种遗忘方法在Llama3-8B-Instruct上的涟漪效应,发现准确率下降随语义距离衰减且跨模型一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11554 2026-07-15 cs.HC cs.AI cs.CL cs.CY cs.ET 版本更新

Toward Metaphor-Fluid Conversation Design for Voice User Interfaces

面向语音用户界面的隐喻灵活对话设计

Smit Desai, Jessie Chin, Dakuo Wang, Benjamin Cowan, Michael Twidale

机构 * Northeastern University(东北大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University College Dublin(都柏林大学)

AI总结 研究针对语音用户界面现有隐喻设计不足,提出隐喻灵活设计方法,通过动态调整隐喻表示适应不同情境。经实验对比默认VUI,该方法提升了用户相关感受,但因个体差异需个性化,挑战了传统设计范式,展现新方法潜力。

Comments Accepted at ACM CUI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11855 2026-07-14 cs.RO 新提交

Robust bipedal locomotion on flowable slopes via foot-driven terrain manipulation

通过足部驱动的地形操纵在可流动斜坡上实现稳健的双足运动

Deniz Kerimoglu, Junnosuke Kamohara, Jiyeon Maeng, Ziwon Yoon, Seth Hutchinson, Ye Zhao, Daniel I. Goldman

机构 * Georgia Institute of Technology(佐治亚理工学院) Northeastern University(东北大学)

AI总结 研究双足机器人在颗粒斜坡上的运动控制问题,通过研究带防滑钉足部的地面动力学,发现中等防滑钉间距利于行走,据此设计可调整防滑钉深度的足部,应用于大小不同的双足机器人,提出以肢体为中心调节地形相互作用的新控制方法。

Comments 38 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11423 2026-07-14 cs.CL 新提交

ToFu: A White-Box, Token-Efficient Agent Harness for Researchers

ToFu:面向研究人员的白盒、令牌高效代理工具包

Junhao Ruan, Yuan Ge, Bei Li, Yongjing Yin, Yuchun Fan, Xin Chen, Jingang Wang, Chenglong Wang, Jingbo Zhu, Tong Xiao

机构 * Northeastern University(东北大学) LongCat RSI, Meituan(美团龙猫RSI) NiuTrans Research(小牛翻译研究院)

AI总结 研究提出ToFu这一代理工具包,作为研究助手,以高令牌效率等支持实际研究流程,且能本地部署;作为研究对象,提供白盒工具包供研究人员检查、修改和评估,兼具强大性能与用户体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11167 2026-07-14 cs.RO cs.AI cs.LG 新提交

Pix2Act: Image-Space Manipulation Policies with Equivariant Augmentation

Pix2Act:具有等变增强的图像空间操纵策略

Haojie Huang, Linfeng Zhao, Haotian Liu, Zhang Ye, Si-Yuan Huang, Mingxi Jia, Boce Hu, Fangzhou Lin, Yu Qi, Dian Wang, Robin Walters, Robert Platt

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) University of Pennsylvania(宾夕法尼亚大学) Brown University(布朗大学) Texas A&M University(德州农工大学)

AI总结 研究针对将操纵动作表示为相机平面二维轨迹带来的挑战,提出Pix2Act模仿学习方法,通过生成图像空间关键点轨迹及三角测量恢复末端执行器姿态,将三维控制转为二维预测问题,提升泛化能力与性能,优于现有基线且抗相机扰动。

Comments Project Website: https://haojhuang.github.io/pix2act_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11118 2026-07-14 cs.CV 新提交

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

GHOST:不透明表面纹理的几何引导幻觉

Langxu Zhao, Zuan Gu, Tianhan Gao

机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)

AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10706 2026-07-14 cs.RO cs.AI cs.CV cs.LG 新提交

Action Map Policy: Learning 3D Closed-loop Manipulation via Pixel Classification

动作映射策略:通过像素分类学习3D闭环操作

Haojie Huang, Zhang Ye, Linfeng Zhao, Boce Hu, Mingxi Jia, Yu Qi, Ahmed Agha, Dian Wang, Robert Platt, Robin Walters

机构 * Northeastern University(东北大学) Stanford University(斯坦福大学) Brown University(布朗大学)

AI总结 研究针对机器人学习中动作空间的挑战,提出动作映射策略(AMP),将3D闭环操作策略学习转为图像空间分类问题,通过投影动作到图像平面,以像素为类别控制维度,实现高精度、快速推理,实验证明其优于基线。

Comments Project Website: https://haojhuang.github.io/amp_page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10087 2026-07-14 cs.CV 新提交

CVKD-UDA: Cross-View Knowledge Distillation for 3D Unsupervised Domain Adaptive Segmentation

CVKD-UDA:用于3D无监督域自适应分割的跨视图知识蒸馏

Zhimin Yuan, Ming Cheng, Shangshu Yu, Wen Li, Dunqiang Liu, Xin Huang, Cheng Wang

机构 * School of Artificial Intelligence, Nanyang Normal University(南阳师范学院人工智能学院) School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Fujian Key Laboratory of Sensing and Computing for Smart Cities, School of Informatics, Xiamen University(厦门大学信息学院福建省智慧城市感知与计算重点实验室)

AI总结 研究3D无监督域自适应分割,提出CVKD-UDA方法,通过将体素大小作为核心因素构建域相似表示,利用跨视图互补线索及设计相关组件平衡热身模型特性,有效提升自训练方法性能,为3D UDA分割提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05972 2026-07-14 cs.CC cs.CR cs.LG 版本更新

Generalized and Unified Equivalences between Hardness and Pseudoentropy

硬度与伪熵之间的广义统一等价关系

Lunjia Hu, Salil Vadhan

机构 * Northeastern University(东北大学) Harvard University(哈佛大学)

AI总结 研究计算硬度与计算随机性的关系,证明统一伪熵刻画,适用于一般熵概念族,由单个通用函数见证。通过权重受限校准等技术,证明增强引理,相比前人刻画在字母表大小依赖上有指数级改进且此依赖不可避免。

Comments Accepted to TCC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09059 2026-07-13 cs.AI 新提交

ARCANA: A Reflective Multi-Agent Program Synthesis Framework for ARC-AGI-2 Reasoning

ARCANA:用于ARC-AGI-2推理的反射式多智能体程序合成框架

Kunbo Zhang, Lei Fu, Zeyu Wang, Zijing Liu, Kejian Tong

机构 * Columbia University(哥伦比亚大学) University of California, Los Angeles(加州大学洛杉矶分校) Northeastern University(东北大学)

AI总结 ARCANA是用于ARC-AGI-2推理的多智能体框架,将任务分解为感知、假设生成等步骤,智能体通过可微黑板通信,由元控制器调度。其设计结合程序搜索与校正,提升了抽象转换任务的推理效率和解决方案质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03631 2026-07-13 cs.LG cs.AI 版本更新

AnchorMoE: Interpretable Time Series Classification via Anchor-Routed MoE

AnchorMoE: 基于锚点路由的混合专家模型实现可解释时间序列分类

Tao Xie, Zexi Tan, Haoyi Xiao, Mengke Li, Yiqun Zhang, Yang Lu, Cuie Yang, Yiu-ming Cheung

机构 * School of Automation, Guangdong University of Technology(广东工业大学自动化学院) School of Computer Science and Technology, Guangdong University of Technology(广东工业大学计算机科学与技术学院) College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) School of Informatics, Xiamen University(厦门大学信息学院) State Key Laboratory of Synthetical Automation for Process Industries, Northeastern University(东北大学过程工业综合自动化国家重点实验室) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系)

AI总结 提出AnchorMoE框架,利用混合专家架构对局部补丁进行多视角表示并路由至专门专家,通过加性分解实现前向可解释性,并引入几何正交约束和不确定性感知门控机制提升稀疏信号下的分解可靠性与噪声抑制。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11305 2026-07-10 cs.LG cs.IT math.IT stat.ML 版本更新

Beyond Fixed False Discovery Rates: Post-Hoc Conformal Selection with E-Variables

超越固定虚假发现率:事后符合性选择与e变量

Meiyi Zhu, Osvaldo Simeone

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Institute for Intelligent Networked Systems, Northeastern University London(伦敦东北大学智能网络系统研究所)

AI总结 本文提出post-hoc CS方法,通过e变量和e-BH程序,在有限样本下提供可靠性保障,允许用户根据需求调整选择数量与FDR的平衡,同时保持FDR控制。

Comments 19 pages, 51 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15543 2026-07-10 cs.CL cs.AI 版本更新

ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation

ParamMute:抑制知识关键的前馈神经网络以实现忠实的检索增强生成

Pengcheng Huang, Zhenghao Liu, Yukun Yan, Haiyan Zhao, Xiaoyuan Yi, Hao Chen, Zhiyuan Liu, Maosong Sun, Tong Xiao, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)

AI总结 研究RAG中LLMs不忠实生成问题,提出ParamMute框架抑制相关FFNs激活并校准模型,通过CoFaithfulQA基准评估,显著提升忠实性,减少对参数记忆依赖,为提高LLM在RAG中的可信度提供新方向。

Comments 26 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07123 2026-07-09 cs.CV cs.SY eess.SY 新提交

Widest-Path Reachability Fields for Connectivity-Preserving Slender Structure Segmentation

用于保持连通性的细长结构分割的最宽路径可达性场

Youcheng Zong, Runda Jia, Minxuan Hu, Weilan Su, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(东北大学信息科学与工程学院) Changsha Stomatological Hospital(长沙市口腔医院)

AI总结 研究针对细长曲线结构分割中拓扑破碎问题,提出最宽路径可达性场(WPRF),通过可微最大 - 最小代数重定向梯度流到连通性瓶颈,经多数据集实验验证,该方法能有效提升分割效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06625 2026-07-09 cs.LG cs.AI cs.SY eess.SY 新提交

Open-Ended Scenario Reasoning for Specialist Model Adaptation

用于专家模型适配的开放式场景推理

Youcheng Zong, Runda Jia, Ranmeng Lin, Mingxuan Ren, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(东北大学信息科学与工程学院)

AI总结 研究流程工业专家模型在新场景中退化问题,提出ROAM框架,利用大语言模型知识和推理,在不重训情况下使冻结模型适应新场景,实验证明该框架能有效降低误差并控制开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23347 2026-07-09 cs.LG eess.SP 版本更新

Distributed Dynamic Associative Memory via Online Convex Optimization

通过在线凸优化实现分布式动态关联记忆

Bowen Wang, Matteo Zecchin, Osvaldo Simeone

机构 * Department of Engineering, King’s College London(伦敦国王学院工程系) Communication Systems Department, EURECOM(EURECOM通信系统部) Institute for Intelligent Networked Systems (INSI) at Northeastern University London(伦敦东北大学智能网络系统研究所)

AI总结 研究将关联记忆扩展到多智能体及时变数据流场景的分布式动态关联记忆问题,提出基于树的分布式在线梯度下降算法DDAM-TOGD,推导其性能保证并引入优化策略,实验证明该框架在动态分布式环境中有更高准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05116 2026-07-09 cs.CV cs.AI cs.RO 版本更新

VOTE: Vision-Language-Action Optimization with Trajectory Ensemble Voting

VOTE:基于轨迹集成投票的视觉-语言-动作优化

Juyi Lin, Amir Taherin, Arash Akbari, Arman Akbari, Lei Lu, Guangyu Chen, Taskin Padir, Xiaomeng Yang, Weiwei Chen, Yiqian Li, Xue Lin, David Kaeli, Pu Zhao, Yanzhi Wang

机构 * Northeastern University(东北大学) Cisco(思科) EmbodyX

AI总结 针对VLA模型生成令牌多、动作利用不足的问题,开发训练框架微调模型减少令牌生成,引入基于投票的集成策略优化推理,相比现有模型性能更优,推理更快,证明了实际可部署性。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06111 2026-07-08 eess.SY cs.AI cs.SY 新提交

LLM-Guided Measurement Credibility Correction for Trustworthy Industrial Process Inference

用于可信工业过程推理的大语言模型引导的测量可信度校正

Youcheng Zong, Runda Jia, Dakuo He

机构 * College of Information Science and Engineering, Northeastern University(信息科学与工程学院,东北大学)

AI总结 研究工业过程推理中测量可信度问题,提出大语言模型引导的测量可信度校正方法,通过转换测量语义、构建参考并校正冲突,使预测器输入更可信,在多任务中降低误差,增加少量参数且推理时间短,提升了预测准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05721 2026-07-08 cs.CL 新提交

SpanUQ: Span-Level Uncertainty Quantification for Large Language Model Generation

SpanUQ:用于大语言模型生成的跨度级不确定性量化

Yimeng Zhang, Yingying Zhuang, Ziyi Wang, Yuxuan Lu, Pei Chen, Aman Gupta, Zhe Su, Ming Tan, Zhilin Zhang, Qun Liu, Manikandarajan Ramanathan, Rajashekar Maragoud, Edward Vul, Jing Huang, Dakuo Wang

机构 * Amazon(亚马逊) Northeastern University(东北大学)

AI总结 研究大语言模型生成的跨度级不确定性量化问题,提出SPANUQ轻量级探测器,通过混合贝塔分布估计不确定性,经特殊训练方式构建基准。实验显示其在不确定性质量、速度及错误定位上表现出色,且能在多个大语言模型上通用。

Comments The project page is available at https://damon-demon.github.io/SpanUQ.html

详情

展开后加载摘要…

URL PDF HTML 收藏