arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-30 至 2026-07-30 共收录 84 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 84 篇

2604.15336 2026-07-30 cs.HC cs.AI 版本更新 93%

Facial-Expression-Aware Prompting for Empathetic LLM Tutoring

面向情感的提示方法用于共情LLM辅导

Shuangquan Feng, Laura Fleig, Ruisen Tu, Philip Chi, Edmund Bu, Melinda Ozel, Junhua Ma, Teng Fei, Virginia R. de Sa

机构 * Neurosciences Graduate Program, University of California San Diego(加州大学圣地亚哥分校神经科学研究生项目) Department of Cognitive Science, University of California San Diego(加州大学圣地亚哥分校认知科学系) Department of Computer Science and Engineering, University of California San Diego(加州大学圣地亚哥分校计算机科学与工程系) Department of Electrical and Computer Engineering, University of California San Diego(加州大学圣地亚哥分校电气与计算机工程系) Department of Mathematics, University of California San Diego(加州大学圣地亚哥分校数学系) Face the FACS Halıcıoğlu Data Science Institute, University of California San Diego(Halıcıoğlu数据科学研究所)

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文研究了在LLM辅导中整合面部表情信号以提升共情响应的效果,通过四种不同方法对比发现,基于动作单元的条件化能提升对面部表情的共情响应,而引导峰值帧选择优于随机帧输入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26348 2026-07-30 cs.CL cs.AI cs.CY cs.HC 新提交 92%

When Synthetic Users Fail: A Cross-Domain Benchmark of LLM-Simulated Human Survey Responses

当合成用户失效时:LLM模拟人类调查回复的跨领域基准测试

Zihan Chen, Di Zhu, Lei Nico Zheng

机构 * Stevens Institute of Technology(史蒂文斯理工学院) University of Massachusetts Boston(马萨诸塞大学波士顿分校)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究构建跨领域基准与评估框架,发现LLM模拟人类调查回复存在个体表现逊于基线、过度确定人口统计特征等失效问题,且无法通过更大模型纠正,会误导细分目标决策。

Comments 19 pages, 5 figures, 4 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27155 2026-07-30 cs.AI cs.CL cs.HC 新提交 92%

OmegaUse-OfficeVal: Benchmarking LLM Agents on Long-Horizon Office-Suite Tasks with Economic Grounding

OmegaUse-OfficeVal:基于经济基准的长周期办公套件任务LLM智能体评测基准

Jingbo Zhou, Yusai Zhao, Qi Bao, Jingjia Cao, Zhenghai Chen, Chang Gao, Kaiqi Guo, Muxin Guo, Mingxuan Li, Xinjiang Lu, Yanru Ma, Yixiong Xiao, Zenghui Zhang, Le Zhang, Hua Wu

机构 * Baidu Inc.(百度公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OmegaUse-OfficeVal是带经济基准的长周期办公套件任务LLM智能体评测基准,含100项任务,评测发现前沿LLM成本低速度快但质量未达人类水平,代码与数据集已开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26100 2026-07-30 cs.SE 新提交 92%

Large Language Models for Software Engineering Diagrams: A Systematic Review of UML and ER modelling

用于软件工程图的大语言模型:UML与ER建模的系统综述

Mojdeh Rahmanian, Ashkan Sami, Yanchao Yu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 该系统综述分析64项2023-2025年研究,指出LLM在UML/ER建模中存在领域失衡、GPT依赖、评估不规范等问题,提出需标准化基准等改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.07314 2026-07-30 cs.CL cs.AI 版本更新 91%

MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications

MEDIC:对LLM在临床应用中的安全性和实用性领先指标的综合评估

Praveenkumar Kanithi, Clément Christophe, Marco AF Pimentel, Tathagata Raha, Prateek Munjal, Nada Saadi, Hamza A Javed, Svetlana Maslenkova, Nasir Hayat, Ronnie Rajan, Shadab Khan

机构 * M42

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MEDIC通过综合评估框架揭示LLM在临床应用中的安全性和实用性差异,强调需采用组合方法以应对多维度性能权衡。

Comments Published in Transactions on Machine Learning Research (06/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26317 2026-07-30 cs.CY cs.AI cs.CL 新提交 90%

Aligning LLM-Simulated and Human Examinees for Psychometric Calibration: A Cognitive Diagnostic Profiling Approach

对齐大语言模型模拟与人类应试者的心理测量校准:一种认知诊断画像方法

Wenjie Zhou, Yunting Liu, Renjiao Tang, Mark Wilson

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出认知诊断画像(CDP)零样本框架,优化LLM模拟应试者的心理测量对齐,在Tatsuoka分数减法数据集上提升了能力分布、掌握画像及题目难度与人类的匹配度,助力LLM模拟应试者用于测试开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19576 2026-07-30 cs.AI cs.CL cs.SE 版本更新 90%

Library Drift: Diagnosing and Fixing a Silent Failure Mode in Self-Evolving LLM Skill Libraries

库漂移:在自我演化的LLM技能库中诊断和修复一种无声的失败模式

Xing Zhang, Yanwei Cui, Guanghui Wang, Ziyuan Li, Wei Qiu, Bing Zhu, Peiyang He

机构 * AWS Generative AI Innovation Center(AWS生成式AI创新中心) HSBC Holdings Plc., HSBC Technology Center, China(汇丰控股有限公司,汇丰技术中心,中国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文研究了自我演化的LLM技能库中的一种无声失败模式——库漂移,通过可重复触发实验、细粒度诊断和验证修复方法,揭示了技能积累无序导致检索退化、假阳性注入和性能停滞的问题,并提出了一种经过验证的修复方案,显著提升了技能库的性能。

Comments Accepted to the ICML 2026 Workshop on Failure Modes in Agentic AI (FAGEN@ICML 2026), Seoul, South Korea. https://github.com/amazon-science/Self-Evolving-Agents-Ratchet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27100 2026-07-30 cs.CY 新提交 90%

Can Large Language Models Represent Urban Publics? Behavioral Replication and Population Mismatch in an Affordable-Housing Experiment

大语言模型能否代表城市公众?经济适用房实验中的行为复制与人口匹配问题

Yuxuan Cai, Yequan Hu, Hongqian Li, Zhanghong Ju, Shuying Guo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 该研究以美国经济适用房调查实验对比8款开放权重LLMs与843名受访者,发现LLMs虽能近似部分总体对比,却无法保留人口结构、组内异质性等关键特征,城市规划的模型评估需测试空间与社会结构的模拟保留情况。

Comments Yuxuan Cai and Yequan Hu contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26849 2026-07-30 cs.CR cs.LG 新提交 90%

ToxScreen: Detecting Whether an LLM Has Been Poisoned

ToxScreen:检测大语言模型是否被植入后门

Anthony Hughes, Nicole Xing, Collin Francel, Andy Kim, Andrew Draganov

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出ToxScreen基准,研究现实条件下防御者能否恢复LLM的后门触发器,发现令牌查找方法可有效恢复触发器,且易越狱模型是有用信号,相关模型与代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26724 2026-07-30 cs.AI 新提交 90%

UrbanDS: A Graph-Guided LLM Multi-Agent System for Data-Intensive Urban Tasks

UrbanDS:一种用于数据密集型城市任务的图引导大语言模型多智能体系统

Zhilun Zhou, Jianghao Yu, Yuming Lin, yongjun yang, Sun Yongquan, Depeng Jin, Yong Li

机构 * Tsinghua University(清华大学) Jiangmen Municipal Smart Social Governance Technology Innovation Center(江门市智慧社会治理技术创新中心)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究针对数据密集型城市任务中现有LLM智能体依赖有限数据集的问题,提出图引导多智能体系统UrbanDS,构建基准UrbanDS-Bench验证其性能,该系统已在武汉东西湖城市平台落地应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13317 2026-07-30 cs.CL 版本更新 90%

SkillCAT: Contrastive, Assessment-Augmented and Topology-AwareSkill Self-Evolution for LLM Agents

SkillCAT: 面向LLM智能体的对比评估与拓扑感知技能自进化

Kunfeng Chen, Qihuang Zhong, Juhua Liu, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Computer Science, Fudan University(复旦大学计算机学院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出SkillCAT框架,通过对比因果提取、评估增强进化和拓扑感知任务执行三阶段,实现无需训练的LLM智能体技能自进化,在多个基准上平均提升高达40.40%。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11325 2026-07-30 cs.IR cs.AI 版本更新 90%

Structured Belief State and the First Precision-Aware Benchmark for LLM Memory Retrieval

结构化信念状态与首个面向LLM记忆检索的精度感知基准

Jeffrey Flynt

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 针对现有LLM记忆系统基准仅评估答案质量而忽略检索精度的问题,提出独立于生成模型的检索精度基准PrecisionMemBench和结构化信念存储系统Tenure,实现89/89测试案例通过且平均精度1.0。

Comments v4 removes duplicate prose and adds external adoption

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25094 2026-07-30 cs.CL cs.AI 版本更新 90%

Evaluating Communicative Belief Updates in Large Language Models via Implicature Recognition and Cancellation

通过含义识别和取消评估大语言模型中的交际信念更新

Cesare Spinoso-Di Piano, Verna Dankers, Marius Mosbach, Jackie Chi Kit Cheung

机构 * Mila - Quebec AI Institute & McGill University(米拉 - 魁北克人工智能研究所和麦吉尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究通过创建首个专家注释的含义取消数据集,评估大语言模型识别和理解潜在信念及更新的能力,发现其落后于人类,成功可能源于依赖先验信念,失败取决于类型和形式,表明当前LLMs未达人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26397 2026-07-30 cs.CL cs.LG q-bio.QM 新提交 88%

Knowledge before Reasoning: EC-Reason-Bench, a Training-Free Diagnostic Benchmark for LLM Enzyme Classification

推理前的知识:EC-Reason-Bench,一种用于大语言模型酶分类的无训练诊断基准

Linyu Li, Zhi Jin, Yichi Zhang, Dongming Jin, Yuanpeng He, Huanyao Zhang, Xuan Zhang, Gadeng Luosang, Nyima Tashi

专题命中 评测与基准 :LLM(title,summary_cn);分类 cs.CL、cs.LG

AI总结 该研究针对通用LLM酶分类中EC编号二至四级准确率近乎为零的问题,提出无训练诊断基准EC-Reason-Bench,分解四个维度评估,发现外部知识优先于推理等关键结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01240 2026-07-30 cs.CL cs.AI 版本更新 88%

Prompt Framing Distorts Count Based Evaluation of LLM Error Detection: Evidence from Numeric Anchoring

提示框架扭曲了基于计数的LLM错误检测评估:来自数字锚定的证据

Dekun Yang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文发现基于计数的F1分数可能因提示中的数字锚定而虚高,与跨度定位能力脱节,提出ErrorBench压力测试协议,并建议评估时应避免预置错误计数并报告跨度感知指标。

Comments 15 pages, 6 figures, 12 tables. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15846 2026-07-30 cs.CV 版本更新 88%

A Closer Look at Dynamic Scene Graph Generation In the Era of Multimodal Large Language Models

多模态大语言模型时代的动态场景图生成研究

Xuanming Cui, Jaiminkumar Ashokbhai Bhoi, Chionh Wei Peng, Adriel Kuek, Ser Nam Lim

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 本研究针对多模态大语言模型时代动态场景图生成的局限,从任务设置优化评估指标、基于MLLM改进模型设计,在多个数据集上实现了最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26791 2026-07-30 cs.CR cs.AI cs.CL 新提交 87%

SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response

SecRespond:面向真实入侵后事件响应的AI智能体基准测试集

Lehan Wang, Boli Chen, Ruixue Ding, Pengjun Xie, Jinwei Huang, Zhendong Liu, Shuo Wang, Tao Lei, Xin Ouyang, Xiaomeng Li

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究人员推出首个入侵后事件响应AI智能体基准测试集SecRespond,评估23种前沿LLM在10个靶场的表现,发现现有智能体难以及时发现隐蔽入侵并制定全面修复计划,存在根本瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26643 2026-07-30 cs.AI cs.LG 新提交 87%

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

重新思考自进化:缓解技能过拟合的约束探索-利用过程

Hongqiang Lin, Chao Liu, Xiaofan Bai, Xuan Jin, Yuhong Li, Nenggan Zheng, Xipeng Cao

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 针对LLM智能体技能过拟合问题,提出SkillBoost三阶段框架,在23种模型-基准配置上达SOTA性能,优化后技能可跨智能体复用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26066 2026-07-30 cs.CL cs.AI cs.DL 新提交 87%

Do Methods Support the Claims? Intra-Paper Verification for Peer Review

方法是否支持其主张?用于同行评审的论文内部验证

Ranjitha Shivaprasad Ballakuraya, Arash Mahyari, Ashok Srinivasan

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对现有 LLM 评审系统忽视论文内部主张与方法学证据不匹配的问题,提出 intra-paper claim verification 框架,经实验验证其生成的评审意见与人类评审关注点高度契合。

Comments 9 pages, 8 figures. Source code, prompts, evaluation materials, and supporting data available at https://github.com/Ranjitha2493/intra-paper-claim-method-verification

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26710 2026-07-30 cs.LG 新提交 86%

PowerAtlas: Towards Electricity-Computing Co-Scheduling for Power Systems

PowerAtlas:面向电力系统的电-计算协同调度

Kaiwen Jiang, Siya Xu, Ziyue Zhu, Chao Yang, Anh Tuan Luu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Grid Liaoning Electric Power Co., Ltd.(国网辽宁省电力有限公司) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 PowerAtlas是用于电-计算协同调度的LLM智能体框架,整合多类约束生成可行方案,构建含2000个实例的ECBench基准,在11种LLM上验证了有效性。

Comments 17 pages, 9 figures, 5 tables. Code: https://github.com/JAVA-Jiang/PowerAtlas

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26314 2026-07-30 cs.CR cs.AI 新提交 86%

StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

StealthBench:衡量自主进攻性安全智能体的操作隐蔽性

Ads Dawson, Adrian Wood

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究人员推出StealthBench基准,通过含三个LLM的评判小组评估自主进攻性安全智能体的OPSEC表现,发现无模型安全成功率超54%,证实OPSEC失败具系统性,该基准用于支持相关智能体开发与监控。

Comments 29 pages, 9 tables, 1 figure, 2 appendices. Code: https://github.com/GangGreenTemperTatum/stealthbench Dataset: https://huggingface.co/datasets/0xmoose/stealthbench Website: https://stealthbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26212 2026-07-30 cs.SE cs.AI 新提交 86%

Multi-Agent Debate Strategies: Survey, Taxonomy, and Challenges

多智能体辩论策略:综述、分类与挑战

Quim Motger, Marc Oriol, Jordi Marco, Xavier Franch

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过对141项多智能体辩论研究的系统综述,提出三维分类法,揭示领域默认采用狭窄设计模式的问题,将分类法定位为研究图谱与基准框架,未来拟形式化为可执行规范以优化辩论配置。

Comments Under review at ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26067 2026-07-30 cs.CY cs.AI 新提交 86%

The Easy Trap: Why LLMs Underestimate Misconception-Driven Difficulty

易陷阱:为何大语言模型低估由误解驱动的难度

Amanda La Hadi, Muhammad Johan Alibasa, Guanliang Chen, A. Taufiq Asyhari

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究发现,用于教育评估难度估计的LLM会系统性低估由学习者误解驱动的数学题难度,提出“易陷阱”现象,其仅能捕捉难度大致排序,无法反映学生实际认知难度。

Comments This paper poster presented on 19th Educational Data Mining Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 85%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22888 2026-07-30 cs.CL cs.AI 版本更新 85%

DialectLLM: A Dialect-Aware Dialog[ue] Generation Framework Beyond Standard American English

DialectLLM:一种超越标准美式英语的方言感知对话生成框架

Jio Oh, Paul Vicinanza, Thomas Butler, Steven Euijong Whang, Dezhi Hong, Amani Namboori

机构 * KAIST(韩国科学技术院) Amazon(亚马逊)

专题命中 评测与基准 :LLM(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI

AI总结 DialectLLM通过生成多方言对话数据,解决LLM对非标准方言识别不足的问题,验证了方言特征对生成质量的影响,展示了其在对话生成中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27066 2026-07-30 cs.CV cs.AI 新提交 84%

SciFigAlign: Scoring Scientific Figures by Fine-tuned Alignment of Visuals with Manuscript Evidence

SciFigAlign:通过微调视觉内容与稿件证据的对齐来对科学图表进行评分

Chuanzhi Xu, Zihan Deng, Huiqi Liang, Chengkun Yue, Zhanlin Cui, Pengfei Ye, Weidong Cai

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 本文构建了含3857张科学图表的标注数据集,提出基于稿件证据的多模态评分器SciFigAlign,其在测试集上的MAE为0.3524,相对最佳LLM基准降低59%误差,证实需视觉与稿件证据的学习对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08543 2026-07-30 cs.CV cs.AI cs.CL cs.CY 版本更新 84%

VideoNorms: Benchmarking Cultural Awareness of Video Language Models

VideoNorms:视频语言模型文化意识基准测试

Nikhil Reddy Varimalla, Yunfei Xu, Meng Fan Wang, Arkadiy Saakyan, Smaranda Muresan

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出VideoNorms数据集评估VideoLLMs的文化规范意识,发现模型中文表现逊于英文、提供非语言证据更困难,视频模态必要且规模扩大无分类分数提升,成果助力文化导向的视频模型训练与评估。

Comments 29 pages, 6 figures, 19 tables. IC2S2 2026, C3NLP@ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27136 2026-07-30 cs.IR 新提交 83%

KAMR: Grounding Generation via Knowledge-Aligned Multi-hop Retrieval

KAMR:基于知识对齐多跳检索的接地生成

Xiaochen Wang, Yuan Zhong, Haoyu Wang, Ting Wang, Fenglong Ma

专题命中 评测与基准 :LLM(summary_cn,abstract);prompting(abstract)

AI总结 该研究针对多跳检索中三元组排序与监督缺失问题,提出KAMR知识对齐多跳检索器,通过构建部分对齐数据集优化对比目标,在多基准与LLM主干上提升了多跳检索和下游问答性能。

Comments Accepted by COLM'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15684 2026-07-30 cs.CR cs.AI 版本更新 83%

State-Dependent Safety Failures in Multi-Turn Language Model Interaction

多轮语言模型交互中的状态依赖性安全故障

Pengcheng Li, Jie Zhang, Tianwei Zhang, Han Qiu, Zhang kejun, Weiming Zhang, Nenghai Yu, Wenbo Zhou

机构 * School of Cyber Science and Technology, University of Science and Technology of China, China(中国科学技术大学信息科学与技术学院) Nanyang Technological University, Singapore(南洋理工大学) Tsinghua University, Beijing, China(清华大学) Beijing Electronic Science and Technology Institute, Beijing, China(北京电子科技研究所)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.AI

AI总结 本文从状态空间视角研究多轮交互中的安全故障,提出STAR框架分析对话历史作为状态转移操作,揭示对齐模型在多轮交互中安全边界穿越的机制。

Comments 9 pages, accepted at the International Conference on Machine Learning (ICML) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16111 2026-07-30 stat.AP cs.AI 版本更新 83%

Calibrate Globally, Measure Everywhere: Scaling LLM-Based Prevalence Measurement Across A/B Experiments

基于代理的大规模A/B测试预估测量

Zehao Xu, Tony Paek, Kevin O'Sullivan, Attila Dobi

机构 * Pinterest, Inc.(Pinterest公司)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于代理的普及率测量框架,通过离线校准和日志数据实现大规模A/B测试中的高效普及率估计。

详情

展开后加载摘要…

URL PDF HTML 收藏