Gaze Heads: How VLMs Look at What They Describe
注视头:视觉语言模型如何观察它们所描述的内容
机构 * Northeastern University(东北大学)
AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。
高校专区
注视头:视觉语言模型如何观察它们所描述的内容
机构 * Northeastern University(东北大学)
AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。
Every Eval Ever:AI评估结果的统一模式与社区仓库
机构 * Technical University Munich(慕尼黑工业大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; Weizenbaum Institute(魏岑鲍姆研究所) ; Zuse Institute Berlin(柏林祖泽研究所) ; Evidence Prime ; Trustible ; Kitware ; ETH Zurich(苏黎世联邦理工学院) ; StickFlux Labs ; Stanford University(斯坦福大学) ; Northeastern University(东北大学) ; IBM Research(IBM研究院) ; Comenius University Bratislava(布拉迪斯拉发夸美纽斯大学) ; Cisco(思科) ; University of Notre Dame(圣母大学) ; Hebrew University of Jerusalem(耶路撒冷希伯来大学) ; University of Oxford(牛津大学) ; Ohio University(俄亥俄大学) ; Writer ; TCS Research(塔塔咨询服务研究院) ; Oxford University Press(牛津大学出版社) ; Queen Mary University of London(伦敦玛丽女王大学) ; Technical University Berlin(柏林工业大学) ; University of Delaware(特拉华大学) ; Cinemo ; Johns Hopkins University(约翰霍普金斯大学) ; University of Copenhagen(哥本哈根大学) ; ELLIS(欧洲学习与智能系统实验室) ; Iowa State University(爱荷华州立大学) ; Meta FAIR ; University of Montreal(蒙特利尔大学) ; Mila Quebec AI Institute(Mila魁北克人工智能研究所) ; EleutherAI ; Yale University(耶鲁大学) ; Hugging Face ; University of Edinburgh(爱丁堡大学) ; Harvard University(哈佛大学) ; ETH AI Center(ETH人工智能中心) ; MIT(麻省理工学院) ; MIT-IBM Watson Lab(MIT-IBM沃森实验室)
AI总结 针对AI评估结果格式不统一、难以比较的问题,提出首个共享模式与社区众包仓库,通过标准化表示、自动转换器和社区数据库实现跨评估框架的统一。
时间回溯搜索:测试时生成式视频推理
机构 * Northeastern University(东北大学) ; Independent Researcher(独立研究者) ; Harvard & Kempner(哈佛大学与肯普纳研究所) ; MIT(麻省理工学院)
AI总结 提出时间回溯搜索(TBS),通过将搜索空间转移到时间轴,在扩散过程中定位失败点并回溯重启,显著提升视频模型在测试时的推理能力。
道德推理习得的语用推理:通过元语用链接实现泛化
机构 * Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校) ; Nanyang Technological University(南洋理工大学) ; University of Mississippi(密苏里大学) ; Northeastern University(东北大学) ; Qualcomm(高通公司) ; Michigan State University(密歇根州立大学)
AI总结 针对大语言模型在道德推理中泛化能力不足的问题,提出基于元语用链接和道德基础理论的语用推理方法,使模型获取道德推理目标与社会变量间的元语用链接,在三个任务上验证了其适应性和泛化性。
TCRL: 时序耦合对抗训练用于最坏情况下的鲁棒约束强化学习
机构 * Northeastern University(东北大学) ; Zhejiang University(浙江大学) ; Aalborg University(奥胡斯大学)
AI总结 TCRL通过引入时序耦合对抗训练框架,解决传统方法在处理时序耦合扰动时的不足,提升约束强化学习在最坏情况下的鲁棒性。
Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems, 3489 - 3491, 2026
超越承诺边界:探究大型推理模型中的附带思维链
机构 * CLCG, University of Groningen(格罗宁根大学CLCG) ; University of Milano-Bicocca(米兰-布雷拉大学) ; University of Trieste(特里耶大学) ; Khoury College of Computer Sciences, Northeastern University(东北大学Khoury计算机科学学院)
AI总结 通过早期退出估计思维链步骤的因果重要性,发现推理中存在从瞬态猜测到稳定答案的“承诺边界”,后续步骤为附带现象,可提前退出以缩短推理长度达55%而不影响性能。
EvoBrowseComp: 基于演化知识的搜索智能体基准测试
机构 * Northeastern University, China(东北大学(中国)) ; Weixin AI, Tencent Inc, China(腾讯微信AI(中国))
AI总结 提出EvoBrowseComp,一个通过实时网络遍历自动生成400道英文和400道中文无污染复杂问题的演化基准,用于评估搜索智能体在动态知识环境中的真实浏览能力。
Comments 14 pages, under review
SENTINEL: 用于训练工具使用语言模型智能体的失败驱动强化学习
机构 * Northeastern University(东北大学) ; Independent Researcher(独立研究员) ; Northwestern University(西北大学)
AI总结 提出SENTINEL框架,通过将智能体失败转化为针对性训练任务,在Tau2-Bench Retail上提升Qwen3-4B模型Pass@1从66.4到74.9,优于通用合成任务上的强化学习。
PRISM:用于共情口语对话的韵律集成多智能体推理框架
机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院)
AI总结 提出PRISM多智能体框架,通过解耦语音感知、响应生成和语音合成,并引入韵律到语言翻译机制,实现共情口语对话中的韵律适当性和知识集成。
Comments Accepted to Interspeech 2026
跨尺度科学挑战的AI智能体基准测试
机构 * Yale University(耶鲁大学) ; Broad Institute of MIT and Harvard(布罗德研究所) ; The Pennsylvania State University(宾夕法尼亚州立大学) ; Northeastern University(东北大学) ; Northwestern University(西北大学)
AI总结 提出SciAgentArena基准,含约200个交互式任务,评估AI智能体在真实科研场景中的能力,发现其在数据分析中有效,但在创新探索和开放问题上表现不均。
Comments 6 figures
CD-RCM:面向反射共聚焦显微镜的泛化连续深度新视角合成
机构 * Northeastern University(东北大学) ; Memorial Sloan Kettering Cancer Center(纪念斯隆凯特琳癌症中心)
AI总结 针对反射共聚焦显微镜各向异性3D体积,提出首个RCM专用新视角合成方法CD-RCM,通过前馈模型从稀疏z-stack预测连续深度切片,实现亚秒级高保真合成。
G-MAPP: 基于GPU加速的多智能体规划与感知用于反应式运动生成
机构 * Department of Electrical, Computer, and Biomedical Engineering, Toronto Metropolitan University(多伦多都会大学电气、计算机与生物医学工程系) ; Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑工业大学慕尼黑机器人与机器智能研究所) ; Institute for Experiential Robotics, Northeastern University(东北大学体验式机器人研究所) ; Idiap Research Institute(Idiap 研究所) ; EPFL(瑞士联邦理工学院洛桑) ; CHART Group at the School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院 CHART 小组) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学)
AI总结 提出GPU加速的框架,通过并行状态探索和紧密耦合感知-动作循环,实现非结构化环境中的实时反应式运动生成,在7自由度机器人上达到5倍加速并成功避障。
Comments The implementation is available at: https://github.com/chart-research/g-mapp
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7516-7523, June 2026
美国人工智能项目映射:2026年初现状报告及AI主修与辅修分析
机构 * Center for Inclusive Computing(包容计算中心) ; Khoury College of Computer Sciences(科里学院计算机科学学院) ; Northeastern University(东北大学) ; Boston, Massachusetts, United States(马萨诸塞州波士顿,美国)
AI总结 报告2026年春美国本科AI项目现状,开发动态更新工具扫描560多所院校的350多个项目,分析66个AI主修和87个辅修的课程要求,发现并非所有主修都要求通用AI课程但需机器学习,超三分之一主修要求AI伦理课程而辅修不足四分之一。
意识基调:TikTok 心理健康月期间的主题、情感和毒性地图
机构 * Institute for Biocomputation and Physics of Complex Systems (BIFI)(生物计算与复杂系统物理研究所) ; University of Zaragoza(萨拉戈塔大学) ; ARAID Foundation(ARAID基金会) ; Network Science Institute(网络科学研究所) ; Northeastern University London(伦敦东北大学) ; Kent Medway Medical School(肯特梅德斯医疗学院) ; LASIGE(拉西格研究所) ; Faculdade de Ciências da Universidade de Lisboa(里斯本大学科学学院) ; Department of Psychology, University of Limerick(利默里克大学心理学系) ; Observatory on Social Media, Indiana University(社交媒体观察所,印第安纳大学) ; CSSI - Kellogg School of Management, Northwestern University(CSSI - 北western大学凯洛格管理学院)
AI总结 通过分析 TikTok 2023-2024 年心理健康月期间的视频和评论,使用 BERTopic 提取主题、XLM-T 和 Detoxify 量化情感与毒性,发现视频情感偏负面而评论更混合,毒性在评论中呈长尾分布且集中于特定主题。
Comments 12 pages, 6 figures
模拟量子异步事件驱动图神经网络
机构 * King’s Communications, Learning and Information Processing (KCLIP) lab(国王通讯、学习与信息处理(KCLIP)实验室) ; Centre for Intelligent Information Processing Systems (CIIPS)(智能信息处理系统中心) ; Department of Engineering(工程系) ; Pasqal SAS(Pasqal SAS公司) ; Institute for Intelligent Networked Systems (INSI)(智能网络化系统研究所) ; Northeastern University London(伦敦东北大学)
AI总结 提出模拟量子异步事件驱动图神经网络(QA-AEGNN),利用中性原子量子处理器映射事件数据为原子阵列,通过Rydberg哈密顿量模拟消息传递,实现高效事件图计算。
Comments 31 pages, 8 figures, initial version
Embodied-BenchClaw:用于具身空间智能基准构建的自主多智能体系统
机构 * QiYuan Lab(启元实验室) ; School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) ; School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机科学与工程学院)
AI总结 提出Embodied-BenchClaw,一个通过五阶段流水线和三个智能体协调的自主系统,自动构建可验证、可执行、可维护且诊断有用的具身空间智能基准,减少人工工作量。
密度脊选择性预测:校准标签稀缺下的大语言模型与视觉语言模型幻觉检测
机构 * Northeastern University Boston, United States(东北大学波士顿分校)
AI总结 针对校准标签稀缺时大语言模型和视觉语言模型的幻觉检测问题,提出基于核密度估计的密度脊方法,利用隐藏状态生成轨迹的六维运动特征图构建响应流形,通过到最近脊顶点的欧氏距离评分,在标签稀缺协议下AUROC提升5-20点。
鲁棒的指令遵从:合作多智能体强化学习
机构 * Department of Computer Sciences, Northeastern University(东北大学计算机科学系) ; Department of Computer Sciences, Massachusetts Institute of Technology(麻省理工学院计算机科学系)
AI总结 针对外部指令中断行为并冲突长期目标的问题,提出宏动作值修正方法(MAVIC),通过修正指令边界的Bellman备份实现一致值估计,在复杂合作环境中保持高指令遵从和基础任务性能。
SDQM:用于目标检测数据集评估的合成数据质量指标
机构 * Northeastern University, Khoury College of Computer Sciences(东北大学,Khoury 计算科学学院) ; Binghamton University, School of Computing(布ingham顿大学,计算科学学院) ; Air Force Research Laboratory, Mission Applications and Infrastructure Section(空军研究实验室,任务应用与基础设施部门)
AI总结 提出SDQM指标,无需模型训练收敛即可评估合成数据质量,与YOLO11的mAP强相关,优于现有指标。
Comments Accepted and Published at SPIE: Journal of Electronic Imaging, Vol. 35, Issue 3
Journal ref Journal of Electronic Imaging 35(3), 033014 (2026)
使用多模态AI代理进行可持续性评估
机构 * Paul G. Allen School of Computer Science & Engineering, University of Washington(保罗·G·艾伦计算机科学与工程学院,华盛顿大学) ; Computer Science and Engineering, University of Notre Dame(计算机科学与工程,诺丁汉大学) ; Electrical and Computer Engineering, Northeastern University(电气与计算机工程,东北大学)
AI总结 提出多模态多代理AI系统,模拟生命周期评估专家与利益相关者协作,自动估算电子设备碳足迹,将数据收集时间从数周缩短至一分钟,误差在19%以内。
Comments This article is published in Nature Electronics, and is available online at: https://www.nature.com/articles/s41928-026-01653-w
推理模型中预测未来行为以实现更好的引导
机构 * Fraunhofer HHI(弗劳恩霍夫海因里希·赫兹研究所) ; Northeastern University(东北大学) ; KAIST(韩国科学技术院)
AI总结 通过训练激活探针预测推理模型未来行为,提出未来探针控制生成(FPCG)方法,在多个评估中实现几乎无质量下降的引导。
JOIN:通过对抗、推理和导航实现基于锚点抓取条件的双臂辅助操作连接
机构 * Northeastern University(东北大学)
AI总结 提出一种异构按需双臂系统JOIN,通过锚点臂与移动补臂的条件性连接,结合视觉语言模型和几何工具,解决代表性双臂日常生活任务,在实验中成功率更高且需更少人工修正。
Comments Xiang Zhi Tan and Taşkın Padır share equal advising
ZODS-RS -- 面向遥感的零训练目标检测与分割
机构 * Northeastern University, China(东北大学)
AI总结 提出一种无需训练的封闭式管道ZODS-RS,通过原型纯化、旋转尺度等变匹配和不确定性感知像素合并,统一了遥感图像的水平框检测与实例分割,在多个数据集上取得优异性能。
面向智能金融系统的统一多模态框架:整合强化学习、高频交易和博弈论方法与跨模态情感分析
机构 * Henan University, International Eurasia College(河南大学,国际欧亚学院) ; City University of Hong Kong, College of Business(香港城市大学,商学院) ; Northeastern University, School of Electronic and Information Engineering(东北大学,电子与信息工程学院)
AI总结 提出统一框架整合PPO、高频预测、上下文学习、博弈论和跨模态情感分析,在多个金融任务上平均提升20%以上性能。
使用LoRA和NEFTune对DeepSeek-R1-8B模型进行指令微调
机构 * University of Hong Kong(香港大学) ; Northeastern University(东北大学)
AI总结 本研究结合LoRA和NEFTune微调DeepSeek-R1-8B模型,用于金融命名实体识别,在七类实体上达到0.912的微F1分数,优于多个基线模型。
LMT: 制造系统中文本告警记录的因果发现贝叶斯框架
机构 * Department of Mechanical & Industrial Engineering, Northeastern University, Boston, MA, USA(东北大学机械与工业工程系) ; College of Integrative Studies, Singapore Management University, Singapore(新加坡国立大学整合研究学院) ; Department of Industrial Engineering and Management Sciences, Department of Mechanical Engineering, Northwestern University, IL, USA(西北大学工业工程与管理科学系、机械工程系)
AI总结 提出LMT框架,结合大语言模型提取的语义信号和基于泊松过程的时间证据,通过贝叶斯方法从文本告警记录中发现因果图,在小样本场景下表现优异。
Comments 19 pages
针对世界模型以破坏机器人学习流程
机构 * Northeastern University(东北大学) ; University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)
AI总结 本文提出针对世界模型的新型数据投毒攻击方法,通过注入恶意提示或转换动态,在看似安全的数据中生成危险训练轨迹,导致下游策略不安全。
Comments 8 Pages, CoRL Preprint
用于低空无人机视频语义分割的零参数几何门控以实现时间稳定性
机构 * Beihang University(北京航空航天大学) ; Northeastern University(东北大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Beijing Institute of Technology(北京理工大学)
AI总结 提出零参数几何门控,利用RANSAC单应性内点比率在16x16网格上路由区域,结合语义相似性传播实现时间稳定分割,在合成UAVid上提升mIoU达4.91%。
ATM:用于诊断和改进潜在世界模型的动作一致性转移矩阵
机构 * School of Software, Northeastern University(东北大学软件学院)
AI总结 提出ATM矩阵,通过轻量级探针比较真实与预测潜在转移中的动作信息,无需模拟器即可诊断世界模型质量,并引入AITS利用动作可识别性作为训练信号提升下游规划。
Comments 13 pages, 3 figures, 6 tables
通过上下文对比元强化学习的自主空中操控
机构 * National Key Laboratory of Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) ; School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) ; Faculty of Robot Science and Engineering, Northeastern University(东北大学机器人科学与工程学院) ; National Key Lab of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(北京理工大学自主智能无人系统国家重点实验室)
AI总结 提出Aco2方法,通过上下文对比元强化学习,使四旋翼无人机在无需人工干预下自主完成不同载荷的抓取、运输和投递,并直接迁移到真实世界。