arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-10 至 2026-07-10 共收录 227 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 33 篇

2602.23440 2026-07-10 cs.CL cs.IR 版本更新 81%

Truncated Step-Level Sampling with Process Rewards for Retrieval-Augmented Reasoning

截断步骤级采样与过程奖励用于检索增强推理

Chris Samarinas, Haw-Shiuan Chang, Hamed Zamani

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SLATE方法,通过截断步骤级采样和密集过程奖励解决检索增强推理中的信用分配问题,实验表明其在多跳任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08400 2026-07-10 cs.CR cs.AI cs.LG 新提交 81%

TRACE: A Two-Channel Robust Attribution Watermark via Complementary Embeddings for LLM-Agent Trajectories

TRACE:一种通过互补嵌入实现的用于大语言模型智能体轨迹的双通道鲁棒归属水印

Zheng Gao, Xiaoyu Li, Xiaoyan Feng, Jiaojiao Jiang, Yang Song, Yulei Sui, Zhenchang Xing, Liming Zhu

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织(CSIRO)的数据61)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型智能体轨迹归属水印易被经销商攻击的问题,提出TRACE方法,通过互补嵌入构建双通道水印,包括基于局部内容的选择通道和基于日志框架的计数通道,实验表明该方法能保证水印鲁棒性,保持智能体成功率且检测分数高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08059 2026-07-10 cs.LG cs.AI 新提交 81%

When Thinking Hurts: Epistemic Signals in the Reasoning Chains of Visual Language Models

当思考有害时:视觉语言模型推理链中的认知信号

Mayank Singal

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型推理链中的认知信号,通过在相同对抗样本上运行四个模型,发现不同模型的答案熵行为模式有差异,思考链熵在部分情况下优于答案熵,还发现结构化弃权及其实用弃权门可提升准确率。

Comments 7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13356 2026-07-10 cs.CL cs.AI cs.GT 版本更新 81%

Peer-Predictive Self-Training for Language Model Reasoning

同伴预测自训练用于语言模型推理

Shi Feng, Hanlin Zhang, Fan Nie, Sham Kakade, Yiling Chen

机构 * Harvard University(哈佛大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出PST框架,通过多模型协作利用交叉模型聚合响应作为内部训练信号,提升数学推理任务的准确率并减少生成-验证差距。

Comments 22 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08449 2026-07-10 cs.CV cs.LG 新提交 79%

Predicting Viticulture Potential through an Ensemble of U-Net and a Geospatial Foundation Model

通过U-Net和地理空间基础模型的集成预测葡萄种植潜力

Jorge Ignacio Perez, Hwaai Kang Kee, Lucas Rassbach

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.LG

AI总结 针对ImageCLEF AI4Agri 2026法国南部葡萄种植潜力预测子任务,DS@GT ARC团队采用U-Net和地理空间基础模型集成方法,其最佳模型准确率达68.32,在7个团队中排第二,且实现已公开。

Comments To be published in CLEF 2026 Working Notes

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07858 2026-07-10 cs.AI cs.LG 新提交 79%

Agentic AI and Retrieval-Augmented Models in Straight-Through Underwriting

直通式承保中的智能体人工智能与检索增强模型

Robert Richardson, Josh Meyers, Brian Hartman, David Sandberg

机构 * Brigham Young University

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能在精算实践中的应用,开发用于小型商业企业主保单直通式承保的智能体人工智能框架,通过构建实验环境比较三条承保管道,发现智能体系统总体表现最佳,在特定场景中优势明显。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08514 2026-07-10 cs.CV 新提交 78%

Do Egocentric Video-Language Models Capture Both Hand- and Object-Centric Cues?

以自我为中心的视频-语言模型是否捕捉了以手和物体为中心的线索?

Masatoshi Tateno, Alexandros Stergiou, Risa Shinoda, Yoichi Sato, Dima Damen

机构 * The University of Tokyo(东京大学) University of Twente(特温特大学) University of Bristol(布里斯托大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 研究手部-物体交互识别中现有视频-语言模型的局限,提出结合手部-物体掩码训练与HOI-动态感知解码器的新范式,构建DEHOI测试平台评估,证明该方法更有效利用相关信息,在多方面优于现有模型,提升HOI理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08231 2026-07-10 cs.CR cs.HC 新提交 78%

Simulating the Resident: Generating Executable Smart Home Schedules via LLM Personas

模拟住户:通过大语言模型角色生成可执行的智能家居日程安排

Victor Jüttner, Xenia Wagner, Christoph Jahn, Erik Buchmann

专题命中 推理与问题求解 :LLM(title,abstract)

AI总结 该研究针对智能家居领域因收集真实住户数据存在问题,提出利用大语言模型生成多样化住户角色与模拟智能家居交互,通过设计框架、多阶段管道及概念验证,实现可执行日程安排,支持注重隐私的智能家居实验。

Comments Published in the Proc. 1st Symposium on Artificial Intelligence throughout the Human-Centered Design Process (https://dl.gi.de/handle/20.500.12116/48536). Winner of the Best Paper Award

Journal ref Proc. 1st Symposium on Artificial Intelligence throughout the Human-Centered Design Process 2026 (AI-HCD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07287 2026-07-10 cs.RO 新提交 78%

TouchWorld: A Predictive and Reactive Tactile Foundation Model for Dexterous Manipulation

TouchWorld:一种用于灵巧操作的预测性和反应性触觉基础模型

Jianyi Zhou, Feiyang Hong, Yunhao Li, Yicheng Zhao, Yongjue Cen, Zirui Liu, Jiakang Huang, Zirui Chen, Ruiyang Zhang, Weizhuo Zhu, Xuhua Song, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) PHANES AI(PHANES人工智能公司)

专题命中 推理与问题求解 :foundation model(title,abstract)

AI总结 研究针对日常环境中灵巧操作需预测与反应的问题,提出TouchWorld模型。该模型采用分层策略,分离多项任务。通过将触摸用于预测和反馈,提升局部接触适应性。在六个相关任务中表现出色,超越最强基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02885 2026-07-10 cs.CL cs.AI cs.HC cs.IR 新提交 73%

Where do LLMs Fall Short in CBT-Guided Affective Reasoning?

大语言模型在认知行为疗法引导的情感推理中存在哪些不足?

Vaishnavi Sinha, Pooja Guttal, Pranay Deep Reddy Katike, Vishal Sinha, Gerald Ndawula, Lira Yoon, Andrea Kleinsmith, Manas Gaur

机构 * UMBC(美国马里兰大学) UC Irvine(美国加州大学 Irvine 分校)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在认知行为疗法引导的情感推理中的不足,采用知识引导框架,将用户叙述分解并基于临床概念验证,用协议杠杆力衡量引导效果,发现单链思维提示无效,多链思维能更好引导策略选择但效果有限。

Comments 12 pages, 7 figures, accepted for publication in Affective Computing and Intelligent Interaction (ACII) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17361 2026-07-10 cs.LG cs.AI 版本更新 73%

MasFACT: Continual Multi-Agent Topology Learning via Geometry-Aware Posterior Transfer

MasFACT:基于几何感知后验转移的连续多智能体拓扑学习

Xuefei Wang, Jialu Wang, Fengbo Zhang, Yihan Hu, Di Zhang, Yutong Ye, Yikun Ban, Jun Han, Ruijie Wang

机构 * Beihang University(北京航空航天大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MasFACT框架,通过几何感知后验转移方法,解决多智能体系统中因新任务适应导致的拓扑遗忘问题,提升连续学习任务的准确性和拓扑稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02128 2026-07-10 cs.MA cs.AI cs.CL cs.ET 73%

Achieving Unanimous Consensus Through Multi-Agent Deliberation

通过多智能体辩论实现一致共识

Apurba Pokharel, Ram Dantu, Shakila Zaman, Vinh Quach, Sirisha Talapuru

机构 * University of North Texas(北卡罗来纳州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于多智能体辩论的区块链共识机制,利用大型语言模型进行结构化讨论以实现一致共识,同时保持区块链属性并处理对手行为和共识信心。

Comments 6 pages, 4 figure, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21917 2026-07-10 cs.CV cs.AI 版本更新 70%

MAVEN: A Multi-stage Agentic Annotation Pipeline for Video Reasoning Tasks

MAVEN:一种多阶段代理标注管道用于视频推理任务

Han Zhang, Wanting Jiang, Tomasz Kornuta, Tian Zheng, Vidya Murali

机构 * NVIDIA

专题命中 推理与问题求解 :language model(abstract);post-training(abstract);分类 cs.AI

AI总结 本文提出MAVEN,一种多阶段代理标注管道,通过链式推理轨迹生成多任务训练数据,用于视频事件推理任务,核心方法是多尺度时空事件描述,支持代理驱动的领域适应,通过分层细化循环改进数据质量,并在多个数据集上验证了其有效性。

Comments CVPR 2026 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26076 2026-07-10 cs.CL 版本更新 70%

IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation

IMProofBench:在研究级数学证明生成上对人工智能进行基准测试

Johannes Schmitt, Gergely Bérczi, Jasper Dekoninck, Jeremy Feusi, Tim Gehrunger, Raphael Appenzeller, Pieter Belmans, Alessio Bottini, Jim Bryan, João Camarneiro, Ana Cannas da Silva, Niklas Canova, Ana-Maria Castravet, Timo de Wolff, Claudio Fontanari, Filippo Gaia, Baran Hashemi, Daniel Holmes, David Holmes, Aitor Iribar Lopez, Victor Jaeck, Martina Jørgensen, Steven Kelk, Martijn Kool, Stefan Kuhlmann, Adam Kurpisz, Johannes Lengler, Chiara Meroni, Ingmar Metzler, Martin Möller, Samuel Muñoz-Echániz, David Muñoz-Lahoz, Robert Nowak, Georg Oberdieck, Daniel Platt, Dylan Possamaï, Gabriel Ribeiro, Aluna Rizzoli, Daria Sakhanda, Raúl Sánchez Galán, Zheming Sun, Diaaeldin Taha, Josef Teichmann, Richard P. Thomas, Henk van der Pol, Michel van Garrel, Charles Vial, Ignacio Barros, Benjamin Doerr, Peter Grünwald, Henry Liu, David Martins, Aleksandar Mijatović, Sergej Monavari, Marc Roth, Patrick Schnider, Yannik Schuler, Pim Spelier, Yuuji Tanaka, Ronald van Luijk

机构 * ETH Zurich(苏黎世联邦理工学院) Aarhus University(奥胡斯大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型数学能力评估,引入IMProofBench基准测试,由专家开发77个经同行评审问题,涵盖详细证明及子问题,模拟现实研究环境,结果显示当前LLMs能解决不少研究级问题,该基准测试将持续发展。

Comments v2: benchmark expanded from 39 to 77 problems; evaluation extended to 14 models including GPT-5.4, Gemini 3.1 Pro, and Claude Opus 4.6; new analyses (IRT-based score aggregation, inter-rater reliability, tool/token usage, non-agentic ablation); contributor author list updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03075 2026-07-10 cs.RO 版本更新 67%

A Collaborative Reasoning Framework for Anomaly Diagnostics in Underwater Robotics

水下机器人异常诊断的协作推理框架

Markus Buchholz, Niamh Ellis, Rahaf Abu Hara, Ignacio Carlucho, Yvan R. Petillot

机构 * School of Engineering & Physical Sciences, Heriot-Watt University(工程与物理科学学院,赫瑞斯泰大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究水下机器人异常诊断,提出AURA协作框架,集成大语言模型、数字孪生和人在回路交互,通过两个代理进行异常检测与诊断,经人类验证的诊断转化为训练示例完善模型,建立可信赖、不断改进的人机团队模式。

Comments Paper was submitted for ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08758 2026-07-10 cs.AI 新提交 57%

Ideas Have Genomes: Benchmarking Scientific Lineage Reasoning and Lineage-Grounded Idea Generation

思想有基因组:科学谱系推理与基于谱系的思想生成基准测试

Yifan Zhou, Qihao Yang, Yan Li, Donggang Li, Xiru Hu, Hokin Deng, Ziyang Gong, Xuanyi Zhou, Huacan Wang, Xiangchao Yan, Wanghan Xu, Wenlong Zhang, Shaofeng Zhang, Yue Zhou, Yifan Yang, Zhihang Zhong, Xue Yang

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 该研究提出IG-Bench基准测试,用于科学谱系推理与基于谱系的思想生成。围绕IdeaGene框架构建,支持两种评估。通过对14个基于大语言模型的科学家实验,发现存在组合瓶颈,最强系统谱系推理精确准确率低,结构化谱系上下文改变系统排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08724 2026-07-10 cs.LG cs.RO 新提交 57%

Latent Memory Palace: Reasoning for Control as Autoregressive Variational Inference

潜在记忆宫殿:作为自回归变分推理的控制推理

Chuning Zhu, Eva Xu, Jose Barreiros, Krishnan Srinivasan, Paarth Shah, Abhishek Gupta

机构 * University of Washington(华盛顿大学) Toyota Research Institute(丰田研究院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究将语言模型的推理能力应用于连续控制策略的问题,提出潜在记忆宫殿(LMP)方法,通过自回归潜在空间组织信息进行变分推理,推导强化学习技术优化下限,该方法在模拟和现实领域表现良好,还产生高性能动作分词器,为控制的潜在推理提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08651 2026-07-10 cs.LG cs.DC 新提交 57%

Secure Decentralized Federated Learning via Gossip and Virtual Voting

通过八卦和虚拟投票实现安全的去中心化联邦学习

Amirhossein Taherpour, Xiaodong Wang

机构 * Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 研究如何实现安全的去中心化联邦学习,提出gspDAG-FL框架,通过八卦历史达成共识,结合多种验证方法提高弹性,经实验验证其在减少协调瓶颈、提高吞吐量及检测无效起源等方面效果良好,学习质量接近基于验证的账本FL。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08288 2026-07-10 cs.CR cs.AI 新提交 57%

From Legacy Documentation to OSCAL: An MCP-Based Agent Pipeline for Threat-Informed Continuous Compliance in Critical Infrastructure

从遗留文档到OSCAL:基于MCP的代理管道,用于关键基础设施中的威胁情报驱动的持续合规性

Lea Roxanne Muth, Marian Margraf

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究针对关键基础设施运营技术环境无法主动扫描但需主动系统反馈的问题,提出基于MCP的多代理管道,将自然语言描述转换为知识图谱和OSCAL工件,架构解耦推理与检索,降低风险,在场景中取得一定召回率并生成报告,虽有错误但可人工审查。

Comments Accepted for publication at the 2026 IEEE International Conference on Cyber Security and Resilience (IEEE CSR), Lisbon, Portugal, August 3-5, 2026. 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08173 2026-07-10 cs.AI 新提交 57%

Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets

过度思考:放大推理权重以提取学习到的秘密

Jack Hopkins, Dipika Khullar, Fabien Roger

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究针对语言模型黑盒审计可能遗漏隐藏信息的问题,提出“过度思考”方法,通过特定模型构建及新策略放大推理,经实验证明该方法能更频繁揭示隐藏信息,不同秘密浮现方式有别。

Comments Accepted at ICML 2026. 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07727 2026-07-10 cs.PL cs.CL 新提交 57%

SPL: Orchestrating Workflows with Declarative Deterministic-Probabilistic Composition

SPL:使用声明式确定性-概率性组合编排工作流

Wen G. Gong

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 研究提出SPL语言统一确定性与概率性计算模式,通过共享语法等实现跨平台运行。经实验验证,求解器分支有较高机器验证正确性,对比仅用大语言模型的分支,呈现后端难度梯度,主要失败模式为求解器错误。

Comments 24 pages, 2 figures, under review at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08003 2026-07-10 physics.chem-ph cs.AI 新提交 57%

Reaction-network reasoning with frontier models for experimentally confirmed catalyst-selectivity hypotheses

使用前沿模型进行反应网络推理以获得实验证实的催化剂选择性假设

Sutanay Choudhury, Anwesha Banerjee, Udishnu Sanyal, Jorin Dawidowicz, Chiezugolum Ijeoma Odilinye, Jesun Firoz, Liney Arnadottir, Simone Raugei, Johannes Lercher, Arnab Dutta

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究复杂反应中催化剂选择性问题,利用前沿语言模型开发人机协同思考框架,通过识别控制途径竞争的物理杠杆发现新型催化剂,指导合成的催化剂使乙酸盐选择性提高三倍,转变计算范式,提供材料发现蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08127 2026-07-10 cs.CV cs.RO 新提交 50%

Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio

通过时间比率理解和缓解视频动作泛化差距

Utkarsh A. Mishra, Yongxin Chen, Danfei Xu, Yang Liu, Xi Chen, Jiayuan Mao

机构 * Georgia Tech(佐治亚理工学院) Amazon FAR(亚马逊FAR)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 研究视频动作泛化差距,引入时间比率(TR),通过TR衡量动作头对未来潜在展开的依赖程度,提出推理时自适应引导方法,利用TR特性缓解组合泛化差距。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 57 篇

2601.22588 2026-07-10 cs.CL cs.AI cs.LG 版本更新 93%

Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

重新思考大语言模型作为评判器:通过语义能力不对称利用小语言模型进行表示作为评判器

Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Daqing He

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Pittsburgh(匹兹堡大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Connecticut(康涅狄格大学)

专题命中 评测与基准 :LLM(title,abstract);language model(title,abstract);small language model(title);large language model(abstract)

AI总结 研究探讨小语言模型能否作高效评估器,基于语义能力不对称假设提出“表示作为评判器”范式,通过INSPECTOR框架实例化,实验显示其在推理基准测试中性能出色,为可扩展评估提供了更优选择。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16453 2026-07-10 cs.AI 版本更新 92%

RetailBench: Evaluating Long-Horizon Autonomous Decision-Making and Strategy Stability of LLM Agents in Realistic Retail Environments

RetailBench: 评估LLM代理在真实零售环境中的长周期自主决策与策略稳定性

Linghua Zhang, Jun Wang, Jingtong Wu, Zhisong Zhang

机构 * Ant Group(蚂蚁集团) City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RetailBench基准,用于评估LLM代理在千天级超市运营模拟中的长周期决策能力,发现当前最强模型仍远落后于最优策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25984 2026-07-10 cs.AI cs.LG 新提交 91%

InvestPhilBench: A Multi-Layer Benchmark for Evaluating Large Language Model Procedural Reasoning in Expert Investment Philosophy

InvestPhilBench: 评估大型语言模型在专家投资哲学中程序性推理的多层动态基准

Mingguang Chen, Bo Qu

机构 * University of California, Riverside (UCR)(加州大学河滨分校) Illinois Institute of Technology (IIT)(伊利诺伊理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn);分类 cs.AI、cs.LG

AI总结 提出InvestPhilBench基准,通过八层认知层级和自动化评分管道,揭示前沿LLM在投资决策程序推理中的复合评分饱和但程序性缺陷隐藏的问题。

Comments 65 pages, 6 figures, 26 tables. Benchmark, data, and code released. v0.6 release; preliminary empirical study (de-confounded multi-model leaderboard forthcoming)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11847 2026-07-10 stat.ML cs.LG 版本更新 90%

Dropping Just a Handful of Preferences Can Change Top Large Language Model Rankings

丢弃少量偏好可以改变大型语言模型的排名

Jenny Y. Huang, Yunyi Shen, Dennis Wei, Tamara Broderick

机构 * Department of Electrical Engineering and Computer Science, Massachusetts Institute of Technology(麻省理工学院电子工程与计算机科学系) MIT-IBM Watson AI Lab(MIT-IBM沃森人工智能实验室) IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.LG

AI总结 研究通过评估LLM排名系统的鲁棒性,发现丢弃少量偏好数据可显著影响模型排名,揭示MT-bench偏好更稳定的原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03378 2026-07-10 cs.CR cs.SE 版本更新 89%

ARGUS: Defending LLM Agents Against Context-Aware Prompt Injection

ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击

Shihao Weng, Yang Feng, Jinrui Zhang, Xiaofei Xie, Jiongchi Yu, Jia Liu

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07739 2026-07-10 cs.CR 新提交 89%

Controllability-Aware Adversarial Examples Against LLM-Based Network Traffic Classifiers

针对基于大语言模型的网络流量分类器的可控性感知对抗样本

Zhenpeng Li

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的网络流量分类器的对抗鲁棒性,提出可控性感知黑盒迁移框架,按通信语义划分特征组限制扰动,生成对抗样本并迁移到多个目标,发现LLM迁移漏洞及相关特性,验证跨架构迁移层次和交叉代理有效性。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08117 2026-07-10 cs.CL 新提交 89%

COALA: Robust Contextualized Speech-augmented Language Modeling for ASR via Contrastive Regularizer and Biasing Score Estimation

COALA:通过对比正则化器和偏差分数估计实现用于ASR的鲁棒上下文语音增强语言建模

Jhih-Rong Guo, Bi-Cheng Yan, Tien-Hong Lo, Berlin Chen

机构 * National Taiwan Normal University(国立台湾师范大学)

专题命中 评测与基准 :SLM(summary_cn,abstract);language model(title,abstract);分类 cs.CL

AI总结 研究旨在增强复杂多实体场景中的语音增强语言模型,提出COALA框架,通过将SLM潜在表示映射到判别空间量化匹配强度,并解决训练崩溃问题,在LibriSpeech基准上实现了卓越的上下文偏差性能。

Comments Accepted at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏