arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Carnegie Mellon University(卡内基梅隆大学)

2026-04-23 至 2026-04-23 共收录 13
2604.20179 2026-04-23 cs.CR cs.AI cs.SE

Taint-Style Vulnerability Detection and Confirmation for Node.js Packages Using LLM Agent Reasoning

基于LLM代理推理的Node.js包污点式漏洞检测与验证

Ronghao Ni, Mihai Christodorescu, Limin Jia

机构 * Carnegie Mellon University(卡内基梅隆大学) Google(谷歌)

AI总结 本文提出LLMVD.js,通过LLM代理实现Node.js包的污点式漏洞检测与验证,有效率达84%,优于传统方法,无需注解或报告。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20087 2026-04-23 cs.CL cs.LG

SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks

SkillLearnBench: 评估代理技能生成在现实任务中持续学习方法的基准

Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammirati, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

AI总结 SkillLearnBench评估持续学习方法在现实任务中生成技能的有效性,发现所有方法在无技能基线上有提升,但一致性改进困难,且更强LLM不总带来更好结果,开放任务表现不佳,外部反馈促进真实改进,自我反馈导致递归漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20021 2026-04-23 cs.LG cs.CL

Continuous Semantic Caching for Low-Cost LLM Serving

连续语义缓存用于低成本大语言模型服务

Baran Atalar, Xutong Liu, Jinhang Zuo, Siwei Wang, Wei Chen, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Washington Tacoma(华盛顿大学塔科马分校) City University of Hong Kong(香港城市大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出连续语义缓存框架,通过动态ε-网离散化与核岭回归,解决连续查询空间下的缓存优化问题,降低计算和切换开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20012 2026-04-23 cs.CV cs.AI cs.CL

EmbodiedMidtrain: Bridging the Gap between Vision-Language Models and Vision-Language-Action Models via Mid-training

EmbodiedMidtrain: 通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距

Yiyang Du, Zhanqiu Guo, Xin Ye, Liu Ren, Chenyan Xiong

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Bosch Research North America & Bosch Center for Artificial Intelligence (BCAI)(博世北美研究部及博世人工智能中心(BCAI))

AI总结 本文提出EmbodiedMidtrain方法,通过中训练弥合视觉语言模型与视觉语言动作模型之间的差距,实验表明中训练能提升不同VLM骨干网络的性能,且在初始化阶段对VLA微调有显著帮助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19851 2026-04-23 cs.GT cs.AI

Is Four Enough? Automated Reasoning Approaches and Dual Bounds for Condorcet Dimensions of Elections

四是否足够?关于选举的Condorcet维度的自动推理方法和双界

Itai Zilberstein, Ratip Emin Berker, George Li, Ruben Martins

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文通过自动推理方法研究选举中Condorcet获胜集的维度,探讨了k=4是否总是可行,并提出新的分析路径以缩小理论间隙。

Comments Appears at the 8th Games, Agents, and Incentives Workshop (GAIW-26). Held as part of the Workshops at the 25th International Conference on Autonomous Agents and Multiagent Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25844 2026-04-23 cs.CL cs.HC

Believing without Seeing: Quality Scores for Contextualizing Vision-Language Model Explanations

相信而不看:为视觉语言模型解释提供质量评分

Keyu He, Tejas Srinivasan, Brihi Joshi, Xiang Ren, Jesse Thomason, Swabha Swayamdipta

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出通过两种质量评分函数评估视觉语言模型解释的视觉忠实度和对比性,以减少对模型预测的过度依赖,实验显示质量评分能显著提升用户判断准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09958 2026-04-23 cs.CL cs.LG

Neural Bandit Based Optimal LLM Selection for a Pipeline of Subtasks

基于神经带宽的最优LLM选择用于子任务流水线

Baran Atalar, Eddie Zhang, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出一种神经上下文带宽算法,用于在无需历史LLM性能数据的情况下,指导不同子任务的LLM选择,通过子任务输出影响后续任务,实现子任务间复杂依赖关系的学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07050 2026-04-23 cs.IR cs.AI cs.CL cs.LG

ReasonRank: Empowering Passage Ranking with Strong Reasoning Ability

ReasonRank: 通过强推理能力增强文档排序

Wenhan Liu, Xinyu Ma, Weiwei Sun, Yutao Zhu, Yuchen Li, Dawei Yin, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 分校) Baidu Inc., Beijing, China(百度公司,北京,中国) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出ReasonRank,通过自动化生成推理密集型训练数据和两阶段训练方法,提升文档排序性能,实验表明其优于现有基线并具有更低延迟。

Comments 25 pages, accepted by ACL2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02132 2026-04-23 cs.CL cs.LG

Model Internal Sleuthing: Finding Lexical Identity and Inflectional Features in Modern Language Models

模型内部侦探:在现代语言模型中寻找词汇身份和屈折特征

Michael Li, Nishant Subramani

机构 * Carnegie Mellon University - Language Technologies Institute(卡内基梅隆大学-语言技术研究所)

AI总结 研究通过分析25个模型的词汇身份和屈折特征,发现屈折特征在模型中线性可解,而词汇身份在早期显著但随深度减弱,揭示了transformer在层间保持屈折特征但牺牲词汇身份以获得紧凑预测表示的机制。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13818 2026-04-23 cs.LG cs.AI cs.CL

Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning

并非所有回放都有效:在大语言模型强化学习中的回放下采样

Yixuan Even Xu, Yash Savani, Fei Fang, J. Zico Kolter

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出PODS方法,通过下采样回放来减少策略更新成本,提升学习效率。

Comments 19 pages, 10 figures, TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03624 2026-04-23 cs.HC cs.CL

LLAMADRS: Evaluating Open-Source LLMs on Real Clinical Interviews--To Reason or Not to Reason?

LLAMADRS:在真实临床访谈中评估开源大语言模型——理性推理还是不理性推理?

Gaoussou Youssouf Kebe, Jeffrey M. Girard, Einat Liebenthal, Justin Baker, Fernando De la Torre, Louis-Philippe Morency

机构 * Carnegie Mellon University, School of Computer Science(卡内基梅隆大学计算机学院) University of Kansas, Department of Psychology(堪萨斯大学心理学系) McLean Hospital, Harvard Medical School(麦肯纳医院哈佛医学院)

AI总结 本文通过LLAMADRS基准测试,评估了25种开源大语言模型在结构化临床评估中的表现,发现理性推理模型在误差控制上并不总是更优,提示提示设计对模型性能有关键影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20627 2026-04-23 cs.LG cs.RO

Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning

占用奖励塑造:改进离线目标导向强化学习中的信用分配

Aravind Venugopal, Jiayu Chen, Xudong Wu, Chongyi Zheng, Benjamin Eysenbach, Jeff Schneider

机构 * Carnegie Mellon University(卡内基梅隆大学) The University of Hong Kong(香港大学) INFIFORCE Intelligent Technology(INFIFORCE智能技术) Princeton University(普林斯顿大学)

AI总结 本文提出占用奖励塑造方法,通过提取世界模型中的时间信息,改进稀疏奖励下的信用分配问题,在13种长周期运动和操作任务中提升了2.2倍性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04950 2026-04-23 cs.CV cs.AI

Location-Aware Pretraining for Medical Difference Visual Question Answering

面向位置的预训练方法用于医学差异视觉问答

Denis Musinguzi, Caren Han, Prasenjit Mitra

机构 * Department of Electrical and Computer Engineering, Carnegie Mellon University, Kigali, Rwanda(电气与计算机工程系,卡内基梅隆大学,刚果(金)基利齐) University of Melbourne, Melbourne, Australia(墨尔本大学,墨尔本,澳大利亚)

AI总结 本文提出一种面向位置的预训练框架,结合AREF、GCAP和CAREF任务,提升医学差异VQA中细粒度空间视觉表征能力,实现胸部X光图像中临床相关变化的准确识别与推理。

Comments 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏