arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Johns Hopkins University(约翰斯·霍普金斯大学)

共收录 79
2608.12276 2026-08-14 cs.CV 版本更新

XYZFlow:Scaling Multi dimensional Shortcut Flows for Efficient Generative Modeling

XYZFlow:用于高效生成建模的多维捷径流缩放方法

Jinxiu Liu, Xuanming Liu, Kangfu Mei, Yandong Wen, Weiyang Liu

机构 * CUHK(香港中文大学) Westlake University(西湖大学) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 XYZFlow框架通过流匹配的多维缩放实现高效图像生成,兼具7.2-8.5倍的教师模型速度提升与竞争力FID,其下一捷径预测可实现更优的质量-延迟权衡。

Comments ICML 2026 (16 pages, 5 figures)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12218 2026-08-14 cs.CL cs.AI 版本更新

Information Abundance Paradox: Long-Context Training Undermines Parametric Knowledge

信息丰度悖论:长上下文训练会破坏参数化知识

Arda Uzunoglu, Benjamin Van Durme, Daniel Khashabi

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该研究提出信息丰度悖论,发现长上下文训练会使模型减少参数化知识编码、增加对上下文的依赖,预训练和微调中均存在性能先升后降或鲁棒性降低的现象,表明近无穷大上下文缩放并非仅靠更多数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09725 2026-08-12 cs.CV 版本更新

On-Policy Distillation with Best-of-N Teacher Rollout Selection

基于N最佳教师轨迹选择的在线策略蒸馏

Ke Zhang, Yunjie Tian, Dongdi Zhao, Yijiang Li, Yuanye Liu, Vishal M Patel, Di Fu

机构 * Johns Hopkins University(约翰霍普金斯大学) TikTok University of California, San Diego(加州大学圣地亚哥分校) Fudan University(复旦大学)

AI总结 本文提出BRTS框架,通过选择更准确且与学生行为一致的教师轨迹提升在线策略蒸馏效果,在AIME和AMC基准测试中取得显著改进。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09921 2026-08-12 cs.LG 版本更新

A Tale of Two Temperatures: Simple, Efficient, and Diverse Sampling from Diffusion Language Models

双温度的故事:从扩散语言模型中实现简单、高效且多样的采样

Theo X. Olausson, Metod Jazbec, Xi Wang, Armando Solar-Lezama, Christian A. Naesseth, Stephan Mandt, Eric Nalisnick

机构 * Massachusetts Institute of Technology(麻省理工学院) UvA-Bosch Delta Lab, University of Amsterdam(阿姆斯特丹大学UvA-Bosch Delta实验室) Johns Hopkins University(约翰霍普金斯大学) University of California, Irvine(加州大学尔湾分校)

AI总结 本文提出通过温和的温度化方法提升扩散语言模型采样多样性,实现高效且多样化的样本生成,优于现有方法。

Comments V2: accepted as a full conference paper at COLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22016 2026-08-11 cs.LG cs.AI cs.CL 版本更新

ROM: Real-time Overthinking Mitigation via Streaming Detection and Intervention

ROM:通过流式检测和干预实时抑制过度思考

Xinyan Wang, Xiaogeng Liu, Ming Pei, Chaowei Xiao

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Johns Hopkins University(约翰霍普金斯大学)

AI总结 ROM通过流式检测和干预框架减少大推理模型的过度思考,提升准确率并缩短响应长度,在多个数据集上均取得显著效果。

Comments Code is available at https://github.com/SaFo-Lab/ROM

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23333 2026-08-11 cs.LG cs.CL 版本更新

Process Supervision of Confidence Margin for Calibrated LLM Reasoning

校准大语言模型推理的置信度边际过程监督

Liaoyaqi Wang, Chunsheng Zuo, William Jurayj, Benjamin Van Durme, Anqi Liu

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08910 2026-08-11 cs.CL 版本更新

SciTaRC: A Plan-Annotated Scientific Tabular QA Benchmark for Language Reasoning and Complex Computation

SciTaRC:基于科学表格数据的问答基准测试,需语言推理与复杂计算

Hexuan Wang, Yaxuan Ren, Srikar Bommireddypalli, Shuxian Chen, Adarsh Prabhudesai, Rongkun Zhou, Elina Baral, Philipp Koehn

机构 * Center for Language and Speech Processing(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学)

AI总结 SciTaRC是一个针对科学表格数据的问答基准测试,揭示了现有AI模型在语言推理和复杂计算任务上的不足。

Comments COLM 2026 (Conference on Language Modeling). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03115 2026-08-11 cs.CL eess.AS 版本更新

Discovering and Causally Validating Emotion-Sensitive Neurons in Large Audio-Language Models

在大型音频-语言模型中发现并因果验证情绪敏感神经元

Xiutian Zhao, Björn Schuller, Berrak Sisman

机构 * Center for Language and Speech Processing (CLSP)(语言与语音处理中心) Johns Hopkins University(约翰霍普金斯大学) Group on Language, Audio & Music (GLAM)(语言、音频与音乐小组) Imperial College London(伦敦帝国学院)

AI总结 本研究通过神经元层面的干预验证了大型音频-语言模型中情绪敏感神经元的存在,并揭示了情绪识别的因果机制。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04904 2026-08-07 cs.CL 版本更新

Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference

强化目标语言特征:基于SAE的多语言推理引导

Hongsheng Wang, Philipp Koehn

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 本研究针对多语言大模型性能跨语言差异问题,提出基于SAE的推理时引导方法,通过注入目标语言特征提升模型在XCOPA、XNLI、MGSM等基准上的准确率。

Comments Corrected an author name. No changes to the paper content

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03997 2026-08-07 cs.CL 版本更新

Mapping Patient-Perceived Physician Traits from Nationwide Online Reviews with LLMs

基于大语言模型(LLM)从全国在线评论中映射患者感知的医生特质

Junjie Luo, Rui Han, Arshana Welivita, Zeleikun Di, Jingfu Wu, Xuzhe Zhi, Ritu Agarwal, Gordon Gao

机构 * Johns Hopkins School of Medicine(约翰霍普金斯医学院) Johns Hopkins University(约翰霍普金斯大学) Carey Business School, Johns Hopkins University(约翰霍普金斯大学Carey商学院) Center for Digital Health Artificial Intelligence (CDHAI)(数字健康人工智能中心(CDHAI))

AI总结 本研究提出基于LLM的流程从美国百万级医生的410万条在线评论中提取10项患者感知的医生特质,揭示了全国性特质分布模式与医生原型,为相关公平性、偏见研究提供了基础。

Comments Accepted in npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03079 2026-08-06 cs.CL 版本更新

Learning to Diagnose and Correct Moral Errors: Beyond Shallow Heuristics in Moral Alignment

学习诊断和纠正错误:大型语言模型中的道德敏感性获取

Bocheng Chen, Xi Chen, Han Zi, Haitao Mao, Zimo Qi, Xitong Zhang, Kristen Johnson, Guangliang Liu

机构 * University of Mississippi(密西根州立大学) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) AWS AI Labs(AWS AI实验室) Johns Hopkins University(约翰霍普金斯大学) Qualcomm(高通) Michigan State University(密西根州立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21113 2026-08-06 cs.LG cs.CE 版本更新

A Mechanistic Analysis of Transformers for Dynamical Systems

变换器在动力系统中的机理分析

Gregory Duthé, Nikolaos Evangelou, Wei Liu, Ioannis G. Kevrekidis, Eleni Chatzi

机构 * ETH Zürich(苏黎世联邦理工学院) Johns Hopkins University(约翰霍普金斯大学) Singapore-ETH Centre(新加坡-苏黎世中心)

AI总结 本文从动力系统视角分析单层变换器在动态数据中的表示能力和限制,揭示其在不同动态系统中的表现机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18367 2026-08-06 eess.IV cs.LG 版本更新

PSI3D: Plug-and-Play 3D Stochastic Inference with Slice-wise Latent Diffusion Prior

PSI3D: 无需编程的3D随机推断与切片式潜在扩散先验

Wenhan Guo, Jinglun Yu, Yaning Wang, Jin U. Kang, Yu Sun

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 PSI3D通过切片式潜在扩散先验和总变分正则化,提升大规模3D随机推断在OCT超分辨率中的重建质量。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24600 2026-08-04 cs.AI 版本更新

Agent-as-Peer-Debriefer: A Multi-Agent Framework with Perspective-Based Refinement for Qualitative Analysis

Agent-as-Peer-Debriefer: 一种基于视角精炼的多智能体定性分析框架

Zhimin Lin, Kun Cheng, Zhiyao Shu, Junhua Fang, Juntao Li, Fan Bai, Jie Gao

机构 * Soochow University(苏州大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出一种多智能体框架,通过模拟同行汇报(peer debriefing)并引入理论驱动、数据驱动和应用三种分析视角,提升大语言模型在定性数据分析中的编码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13374 2026-08-04 q-fin.PR cs.LG q-fin.RM 版本更新

Conditional Deep Levy Models for Exotic Derivatives: History-Aware Path Generation and P-Q Payoff Diagnostics

用于奇异衍生品的条件深度Levy模型:历史感知路径生成与P-Q收益诊断

Helin Zhao, Junchi Shen

机构 * Johns Hopkins University(约翰霍普金斯大学) University of Washington Seattle(华盛顿大学(西雅图))

AI总结 该研究提出基于DLPMs的历史感知路径生成器,在股指路径生成任务中优于对照组,并构建P-Q收益诊断框架,用于奇异衍生品的收益分析。

Comments 39 pages, 5 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10101 2026-07-30 cs.LG 版本更新

On the Rademacher Complexity of Graph Neural Networks: Unifying Expressivity and Geometry

图神经网络的拉德马赫复杂度:统一表达性与几何

Martin Carrasco, Caio F. Deberaldini Netto, Vahan A. Martirosyan, Ehimare Okoyomon, Caterina Graziani

机构 * University of Fribourg(弗里堡大学) Johns Hopkins University(约翰·霍普金斯大学) Université Paris-Saclay(巴黎萨克雷大学) University of Ferrara(费拉拉大学) Technical University of Munich(慕尼黑技术大学) University of Siena(锡耶纳大学)

AI总结 该研究针对图神经网络(GNNs)泛化与表达性的权衡,采用依赖数据的经验拉德马赫复杂度,推导结合GNN表达力与输入空间几何的紧泛化界,扩展至任意GNN架构,助力GNN泛化统一理论构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15021 2026-07-29 astro-ph.SR astro-ph.GA cs.LG 版本更新

Generalization from Low- to Moderate-Resolution Spectra with Neural Networks for Stellar Parameter Estimation: A Case Study with DESI

利用神经网络从低分辨率到中等分辨率光谱进行泛化:恒星参数估计的案例研究

Xiaosheng Zhao, Yuan-Sen Ting, Rosemary F. G. Wyse, Alexander S. Szalay, Yang Huang, László Dobos, Tamás Budavári, Viska Wei

机构 * Department of Physics \& Astronomy, The Johns Hopkins University, Baltimore, MD 21218, USA Department of Astronomy, The Ohio State University, 140 West 18th Avenue, Columbus, OH 43210, USA Center for Cosmology AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA Department of Computer Science, The Johns Hopkins University, Baltimore, MD 21218, USA School of Astronomy Space Science, University of Chinese Academy of Sciences, Beijing 100049, People's Republic of China National Astronomical Observatories, Chinese Academy of Sciences, Beijing 100012, People's Republic of China Department of Information Systems, E\"otv\"os Lor\' University, Budapest 1117, Hungary Department of Applied Mathematics \& Statistics, Johns Hopkins University, Baltimore, MD 21218, USA

AI总结 本研究利用神经网络从低分辨率到中等分辨率光谱进行泛化,通过预训练和微调策略提升恒星参数估计的准确性。

Comments 22 pages, 13 figures, 4 tables. Accepted for publication in ApJ. Comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19190 2026-07-27 cs.RO cs.AI 版本更新

Agentic Real2Sim: Physics-based World Modeling with Vision-Language Agents

智能体真实到模拟:使用视觉语言智能体进行基于物理的世界建模

Guanxiong Chen, Qianjun Xia, Jiawei Peng, Heng Zhang, Bole Ma, Justin Qian, Ziyi Jiao, Bingyang Zhou, Luoxin Ye, Kaifeng Zhang, Kunyi Wang, Weijia Zeng, Yunuo Chen, Pengzhi Yang, Ziqiu Zeng, Siyuan Luo, Huamin Wang, Chao Liu, Alan Yuille, Fan Shi, Changxi Zheng, Yunzhu Li, Chenfanfu Jiang, Peter Yichen Chen

机构 * University of British Columbia(英属哥伦比亚大学) Johns Hopkins University(约翰·霍普金斯大学) National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Style3D(无合适对应中文名)

AI总结 研究针对机器人与物体交互的真实到模拟转换难题,提出智能体真实到模拟框架,利用视觉语言智能体进行广义物理世界建模,能转换真实记录为可模拟孪生体,在多场景评估效果良好,成本低,可用于下游机器人任务。

Comments Authorship change

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14193 2026-07-27 stat.ML cs.LG cs.NA math.NA physics.med-ph 版本更新

Operator-Informed Gaussian Processes for Complex Helmholtz Wavefields: From Synthetic Benchmarks to In Vivo Brain Elastography

用于复杂亥姆霍兹波场的算子引导高斯过程:从综合基准测试到体内脑弹性成像

Boyuan Deng, Kshitiz Upadhyay, Michael Shields

机构 * Department of Civil and Systems Engineering, Johns Hopkins University(约翰霍普金斯大学土木与系统工程系) Department of Aerospace Engineering and Mechanics, University of Minnesota(明尼苏达大学航空航天工程与力学系)

AI总结 研究将算子引导高斯过程回归扩展到复值亥姆霍兹问题,通过转化复算子用实值GP条件推断。在基准问题和脑弹性成像中表现良好,能返回波场后验,确定了精度上限与未校准的不确定性,校准不确定性是后续核心步骤。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05865 2026-07-23 cs.CV cs.AI cs.CR 版本更新

CGCE: Classifier-Guided Concept Erasure in Generative Models

CGCE:生成模型中的分类器引导概念擦除

Viet Nguyen, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 研究针对生成模型不安全内容生成的问题,提出分类器引导概念擦除(CGCE)框架。该框架用轻量级分类器检测并细化不良概念提示,仅在推理时修改不安全嵌入,能防止有害内容生成,在安全性和性能间取得平衡,实验验证其有效性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03328 2026-07-22 cs.CV cs.IR 版本更新

Beyond Post-Quantization: Native Hash Learning with a Dedicated HASH Token

超越后量化:使用专用哈希令牌的原生哈希学习

Xinze Liu, Ding Wang, Dayan Wu, Hengjie Zhu, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计系)

AI总结 研究高效图像检索的紧凑表示问题,提出HashViT框架,通过专用哈希令牌及相关设计在Transformer内生成二进制表示,经统一目标优化,实验表明其性能优且保留汉明码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32017 2026-07-21 cs.LG cs.AI 版本更新

TRIAGE: Role-Typed Credit Assignment for Agentic Reinforcement Learning

TRIAGE:面向智能体强化学习的角色类型化信用分配

Yuanda Xu, Zhengze Zhou, Hejian Sang, Xiaomin Li, Jiaxin Zhang, Xinchen Du, Sen Na, Zhipeng Wang, Alborz Geramifard

机构 * LinkedIn Corporation(领英公司) Harvard University(哈佛大学) Johns Hopkins University(约翰霍普金斯大学)

AI总结 提出TRIAGE框架,通过角色类型化信用分配修正GRPO仅依赖结果信用的盲点,在ALFWorld等任务中提升成功率并减少交互步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15190 2026-07-20 cs.AI 版本更新

Can We Trust Item Response Theory for AI Evaluation?

我们能信任项目反应理论进行人工智能评估吗?

Han Jiang, Sunbeom Kwon, Jinwen Luo, Ziang Xiao, Susu Zhang

机构 * Johns Hopkins University(约翰·霍普金斯大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 研究探讨项目反应理论(IRT)用于人工智能评估的可靠性,利用六个大语言模型基准模拟响应矩阵,比较四种估计工具,评估IRT在多方面的表现,发现经典估计器在大型基准中可能不可行,可扩展估计器在特定模型集下可能产生不可靠推断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11539 2026-07-20 cs.RO math.OC 版本更新

Simultaneous Calibration of Noise Covariance and Kinematics for State Estimation of Legged Robots via Bi-level Optimization

通过双层优化同时校准噪声协方差和运动学参数以实现四足机器人和双足机器人的状态估计

Denglin Cheng, Jiarong Kang, Xiaobin Xiong

机构 * Legged AI Lab(足式人工智能实验室) Johns Hopkins University(约翰霍普金斯大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Shanghai Innovation Institute (SII)(上海创新研究院)

AI总结 本文提出一种双层优化框架,通过联合校准协方差矩阵和运动学参数提升机器人状态估计的准确性与不确定性校准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06214 2026-07-17 cs.AI 版本更新

A framework for single and multi-agent human-AI curiosity ecosystems

用于单智能体和多智能体人类-人工智能好奇心生态系统的玩具框架

Ilya E. Monosov

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 该论文提出一个玩具框架,将好奇心视为生态系统,探讨单智能体询问策略及相关决策项权重随经验的变化,还扩展到多智能体,追踪多种指标,为研究好奇心生态及设计多智能体发现系统提供概念框架。

Comments fixed abstract in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15892 2026-07-15 cs.CV cs.AI 版本更新

Egocentric Bias in Vision-Language Models

视觉语言模型中的自我中心偏差

Maijunxian Wang, Yijiang Li, Bingyang Wang, Tianwei Zhao, Ran Ji, Qingying Gao, Emmy Liu, Hokin Deng, Dezhi Luo

机构 * Cognitive Science Program, University of California, Berkeley(加州大学伯克利分校认知科学项目) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) School of Computer Science, Georgia Institute of Technology & Emory University(佐治亚理工学院计算机科学学院及埃默里大学) Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Equal Advising Department of Computer Science & Wilmer Eye Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系及威尔默眼科研究所) Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Weinberg Institute for Cognitive Science, University of Michigan(密歇根大学韦恩伯格认知科学研究所)

AI总结 本文提出FlipSet基准,揭示视觉语言模型在第二级视觉视角推理中存在系统性自我中心偏差,表明模型在整合社会认知与空间操作方面存在根本性不足。

Comments Accepted at CogSci 2026 (Best Undergraduate Student Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18089 2026-07-15 cs.CV 版本更新

Together, Then Apart: Balancing Alignment and Distinctiveness for Multimodal Survival Analysis

在一起,然后分开:平衡多模态生存分析中的对齐与独特性

Wenjing Liu, Qin Ren, Wen Zhang, Yuewei Lin, Chenyu You

机构 * Stony Brook University(石溪大学) Stanford University(斯坦福大学) Johns Hopkins University(约翰霍普金斯大学) Brookhaven National Laboratory(布鲁赫林国家实验室)

AI总结 针对多模态生存分析,提出TTA框架,先基于原型对齐捕获跨模态共享结构,再通过锚定引导对比目标鼓励模态特定独特性,用不平衡最优传输处理模态不平衡和噪声对应,在多个癌症队列上评估,提升了生存预测并揭示可解释模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27537 2026-07-14 cs.CV 版本更新

MemoBench: Benchmarking World Modeling in Dynamically Changing Environments

MemoBench: 动态变化环境中的世界建模基准测试

Haoyu Chen, Kaichen Zhou, Hang Hua, Kaile Zhang, Jingwen Qian, Wufei Ma, Haonan Chen, Chunjiang Liu, Yizhou Zhao, Xiaoyuan Wang, Weiyue Li, Alan Yuille, Paul Pu Liang, Yilun Du

机构 * Harvard University(哈佛大学) MIT(麻省理工学院) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) Boston University(波士顿大学) Google(谷歌) JHU(约翰霍普金斯大学) CMU(卡内基梅隆大学) Kempner Institute(肯普纳研究所)

AI总结 提出MemoBench基准,通过目标消失-重现范式评估视频生成模型在动态环境中的记忆一致性,涵盖合成与真实场景,揭示现有模型的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23525 2026-07-14 cs.CL 版本更新

Self-Compacting Language Model Agents

自压缩语言模型智能体

Tianjian Li, Jingyu Zhang, William Jurayj, Xi Wang, Chuanyang Jin, Mehrdad Farajtabar, Eric Nalisnick, Daniel Khashabi

机构 * Johns Hopkins University(约翰霍普金斯大学) Apple(苹果公司)

AI总结 提出SelfCompact框架,让语言模型自主决定何时及如何压缩上下文,通过调用压缩工具和轻量级规则实现自适应压缩,无需微调或外部监督,在多个基准上以更低成本匹配或超越固定间隔压缩。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02905 2026-07-14 cs.AI 版本更新

FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights

FIRE-Bench:评估人工智能代理在科学见解重新发现方面的表现

Zhen Wang, Fan Bai, Zhongyan Luo, Jinyan Su, Kaiser Sun, Xinle Yu, Jieyuan Liu, Kun Zhou, Claire Cardie, Mark Dredze, Zhiting Hu, Eric P. Xing

机构 * Johns Hopkins University(约翰霍普金斯大学) Cornell University(康奈尔大学)

AI总结 研究旨在评估大语言模型驱动的人工智能代理在科学见解重新发现上的能力。核心方法是引入FIRE-Bench基准,让代理基于高层次研究问题进行全周期探索。主要贡献是为衡量代理驱动的科学发现进展提供了严格诊断框架,揭示当前代理系统在全周期科研上的挑战。

Comments 34 pages, 3 figures, 16 tables; ICML 2026 Camera-ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏