arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 166 篇

2606.23667 2026-06-23 cs.DB 新提交 86%

The Table Says Otherwise: Testing LLMs with Counterfactual Relational Data

表格另有说法:用反事实关系数据测试大语言模型

Xinzhi Wang, Chunwei Liu

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出ContraTable基准,通过配对原始与反事实数据库测试LLM是否基于表格回答,发现模型在复杂推理时易依赖先验知识,强调评估应关注对提供数据的忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22783 2026-06-23 cs.IR 新提交 86%

Breaking the Evaluation Paradox: Evaluating High-Entropy Search with Computationally Irreducible Constraints

打破评估悖论:用计算不可约约束评估高熵搜索

Juntao Wu, Wei Wen, Xianting Huang, Shuai Pang, Ruizhi Qiao, Xing Sun, Ke Wang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM穷举搜索评估中因人类无法创建完整标注导致的悖论,提出VERITAS框架,通过计算不可约约束构造可验证的稀疏答案搜索任务,实现自动生成完美标注测试用例并精确控制难度。

Comments 25 pages, 5 figures, Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22247 2026-06-23 cs.SE 新提交 86%

Natural Language-Focused Software Engineering via Code-Documentation Equivalence

面向自然语言的软件工程:基于代码-文档等价性

Aryaz Eghbali, Zhongxin Liu, Michael Pradel

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出文档-代码等价性概念,通过自动生成等价文档的方法(Documentary)提升代码理解与编辑任务中LLM的准确性,实验显示准确率提升12.8-24.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14189 2026-06-23 cs.CY 版本更新 86%

AI and the Future of Academic Peer Review

人工智能与学术同行评审的未来

Sebastian Porsdam Mann, Mateo Aboy, Joel Jiehao Seah, Zhicheng Lin, Xufei Luo, Daniel Rodger, Hazem Zohny, Timo Minssen, Julian Savulescu, Brian D. Earp

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文分析同行评审的缺陷,探讨大型语言模型(LLM)如何通过监督辅助提升评审质量、减少偏见,并强调治理选择对AI辅助评审合法性的关键作用。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23285 2026-06-23 cs.CL cs.SD 新提交 85%

On the Effect of Segmentation Width and Cluster Size on Speech Resynthesis and Continuation in Generative Spoken Language Models

分割宽度和聚类大小对生成式口语语言模型中语音合成与延续的影响

Shunsuke Kando, Wataru Nakata, Shinnosuke Takamichi, Yusuke Miyao

机构 * The University of Tokyo(东京大学) Keio University(庆应义塾大学)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 研究使用离散语音表示在不同比特率下进行语音合成与延续的性能,发现较低比特率仍能生成可理解自然的语音,且延续质量稳定,表明传统设置可能冗余。

Comments Accepted to Interspeech2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20683 2026-06-23 cs.AI cs.CL 新提交 85%

From Question Answering to Task Completion: A Survey on Agent System and Harness Design

从问答到任务完成:智能体系统与执行框架设计综述

Jianyuan Guo, Zhiwei Hao, Chengcheng Wang, Cheng Fan, Tingzhang Luo, Hongguang Li, Ying Gao, Hefei Mei, Jiankun Peng, Rongjian Xu, Minjing Dong, Han Wu, Mengyu Zheng, Kai Han, Shiqi Wang, Chang Xu, Yunhe Wang

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学) Peking University(北京大学) TokenRhythm Technologies(TokenRhythm 科技公司)

专题命中 评测与基准 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文从模型-执行框架视角综述LLM智能体,分析模型瓶颈与执行框架设计,提出六组件分解法,并探讨任务完成、效率与可靠性的影响因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23676 2026-06-23 cs.LG cs.AI math.OC stat.ML 新提交 85%

Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?

开放问题:AdamW 在重尾噪声下是否有效?

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * Nanjing University(南京大学) Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出开放问题:AdamW 在重尾噪声下能否收敛?通过加权度量基准和走廊下界机制,揭示分母记忆可能隐藏大梯度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08787 2026-06-23 cs.CV 版本更新 85%

Lost in Volume: The CT-SpatialVQA Benchmark for Evaluating Semantic-Spatial Understanding of 3D Medical Vision-Language Models

迷失于体积:CT-SpatialVQA基准用于评估3D医学视觉-语言模型的语义-空间理解

Mashrafi Monon, Umaima Rahman, Asif Hanif, Numan Saeed, Mohammad Yaqub

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎德人工智能大学) New York University Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 本文提出CT-SpatialVQA基准,评估3D医学视觉-语言模型对3DCT数据的语义-空间理解能力,发现现有模型在语义-空间推理任务中表现不佳,需更深入整合体积证据以确保临床可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22676 2026-06-23 cs.AI 新提交 84%

Skin-Deep: A Geometric Diagnostic for Alignment Fragility in Large Language Model Representations

Skin-Deep: 大型语言模型表示中对齐脆弱性的几何诊断方法

Dongyub Jude Lee, Jungseob Lee, Seungyoon Lee, Seongtae Hong, Suhyune Son, Sugyeong Eo, Jaehyung Seo, Heuiseok Lim

机构 * Zoom Communications Korea University(高丽大学) Yonsei University(延世大学) Konkuk University(建国大学)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.AI

AI总结 提出Skin-Deep几何诊断方法,通过计算几何脆弱性分数(GFS)在对齐模型微调前检测其拒绝有害请求行为的脆弱性,无需运行攻击。

Comments 16 pages, 3 figures, 12 tables. The first two authors contributed equally. Code (pre-attack GFS diagnostic): https://github.com/js-lee-AI/skin-deep

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20588 2026-06-23 cs.HC cs.AI 新提交 84%

AInterviewer: A Platform for Designing and Conducting AI-led Qualitative Interviews

AInterviewer:一个用于设计和进行AI主导的定性访谈的平台

Tobias Priesholm Gardhus, Nikolas Vitsakis, Fie Lejre Frederiksen, Anna Rogers, Hjalmar Bang Carlsen

机构 * University of Copenhagen(哥本哈根大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出AInterviewer平台,通过多智能体管道结合调查软件的标准化与LLM的灵活性,实现可复现、安全、透明的AI主导定性访谈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22826 2026-06-23 cs.AI 新提交 83%

MINCE: Shrinking LLM Evaluation Datasets via Few-Model Monte Carlo Calibration

MINCE:通过少模型蒙特卡洛校准缩小LLM评估数据集

Devleena Das, Rajeev Patwari, Vikram Kumar Bukka, Nithin Kumar Guggilla, Elliott Delaye, Ashish Sirasao

机构 * Advanced Micro Devices (AMD)(超威半导体(AMD))

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 提出MINCE方法,利用少量校准模型的蒙特卡洛模拟确定最小子集大小,无需预测层,显著减少评估数据集规模,在保持精度漂移极小的同时实现数倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09416 2026-06-23 cs.CL cs.CY 版本更新 83%

Are Language Models Sensitive to Morally Irrelevant Distractors?

语言模型对道德无关干扰因素敏感吗?

Andrew Shaw, Christina Hahn, Catherine Rasgaitis, Yash Mishra, Alisa Liu, Natasha Jaques, Yulia Tsvetkov, Amy X. Zhang

机构 * University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本研究借鉴道德心理学中的“情境主义”观点,通过构建包含60种道德无关干扰因素的多模态数据集,发现这些干扰因素能使大语言模型的道德判断偏移超过30%,揭示了其道德判断的不稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17178 2026-06-23 cs.CR cs.AI cs.AR 版本更新 83%

TrojanGYM: A Detector-in-the-Loop LLM for Adaptive RTL Hardware Trojan Insertion

TrojanGYM:一种检测器在环的大语言模型用于自适应RTL硬件木马插入

Saideep Sreekumar, Zeng Wang, Akashdeep Saha, Weihua Xiao, Minghao Shao, Muhammad Shafique, Ozgur Sinanoglu, Ramesh Karri, Johann Knechtel

机构 * NYU Tandon School of Engineering(纽约大学Tandon工程学院) NYU Abu Dhabi(纽约大学阿布扎克分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 提出TrojanGYM框架,利用大语言模型智能体自动生成多样化的硬件木马,暴露基于GNN的检测器盲点,并设计鲁棒检测器Robust-GNN4TJ,在生成的基准上将检测率从0%提升至60%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22841 2026-06-23 cs.CL cs.LG 新提交 82%

IndicGuard: A Multilingual Safety Guard Model and Dataset for Indic Languages

IndicGuard:面向印度语言的多语言安全防护模型与数据集

Parth Bramhecha, Smit Deshmukh, Sairaj Bodhale, Adwait Borate, Raviraj Joshi

机构 * L3Cube-Labs, Pune(L3Cube实验室,浦那)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出IndicGuard,一个针对10种印度主要语言的多语言安全数据集和基于Gemma-3-4B-IT微调的4B参数安全防护模型,在内容审核和跨语言泛化上优于现有基线CultureGuard。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21627 2026-06-23 cs.AI cs.LG 新提交 82%

Counsel: A Meta-Evaluation Dataset for Agentic Tasks

Counsel: 面向智能体任务的元评估数据集

Sashank Pisupati, Henry Broomfield, Eujeong Choi, Antonia Calvi, Charlie Wang, Roman Engeler, Max Bartolo, Patrick Lewis

机构 * Atla AI Cohere AI Mistral AI Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 提出Counsel数据集,通过人工标注对LLM评判的智能体轨迹错误进行元评估,用于校准和改进LLM评判器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21013 2026-06-23 cs.AI cs.LG 新提交 82%

Agentic Time Machine as an Infrastructure for Future-Event Forecasting

Agentic Time Machine:未来事件预测的基础设施

Jingyi Chai, Bingyang Zheng, Xiangrui Liu, Hao Lu, Zihang Zhou, Tianchen Wang, Kemeng Zhang, Siheng Chen

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出Agentic Time Machine(TM)基础设施,通过过滤截止后内容重建历史网络状态,并基于此设计规划-求解-聚合多智能体框架,实现高效且可靠的事件预测,在FutureX排行榜上取得最佳平均排名。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16364 2026-06-23 cs.SD cs.AI cs.CL 版本更新 82%

WASIL: In-the-Wild Arabic Spoken Interactions with LLMs

WASIL:真实场景下阿拉伯语口语交互与LLMs

Zien Sheikh Ali, Hamdy Mubarak, Soon-Gyo Jung, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute, Qatar(卡塔尔计算研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WASIL数据集,包含真实阿拉伯语口语交互数据,包含音频、ASR假说、助手回复及显式喜欢/不喜欢反馈,用于评估LLMs在真实场景下的表现。

Comments Spoken Prompts, Multilingual LLMs, Speech-based Evaluation, Dialectal Speech, Low-resource Languages, Conversational AI, Speech-to-Text QA, Real-world Interaction, Spoken Language Understanding

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21478 2026-06-23 cs.CL cs.LG eess.AS 版本更新 82%

TaigiSpeech: A Low-Resource Real-World Speech Intent Dataset and Preliminary Results with Scalable Data Mining In-the-Wild

TaigiSpeech: 一个低资源真实世界语音意图数据集及基于可扩展野外数据挖掘的初步结果

Kai-Wei Chang, Yi-Cheng Lin, Huang-Cheng Chou, Wenze Ren, Yu-Han Huang, Yun-Shao Tsai, Chien-Cheng Chen, Yu Tsao, Yuan-Fu Liao, Shrikanth Narayanan, James Glass, Hung-yi Lee

机构 * Massachusetts Institute of Technology, USA(麻省理工学院) National Taiwan University, Taipei, Taiwan(国立台湾大学) National Taiwan University Artificial Intelligence Center of Research Excellence, Taipei, Taiwan(国立台湾大学人工智能研究中心) Academia Sinica, Taiwan(台湾“中央”研究院) National Yang Ming Chiao Tung University, Taiwan(阳明交通大学) Signal Analysis and Interpretation Laboratory (SAIL), University of Southern California, USA(信号分析与解释实验室(SAIL),南加州大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.CL、cs.LG

AI总结 针对低资源台语,构建包含21位老年人3000条话语的语音意图数据集,并探索关键词匹配与LLM伪标注、音视频框架两种数据挖掘策略,以解决标注数据稀缺问题。

Comments Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23629 2026-06-23 cs.HC 新提交 82%

Why Machines Misread Pedagogical Quality: Human-Machine Alignment in LLM-Based Pretest Question Evaluation

为什么机器误读教学质量:基于LLM的前测问题评估中的人机对齐

Pei-Yu Tseng, Mahir Akgun, Peng Liu

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对大规模前测问题设计挑战,提出AI辅助工作流,通过2x2实验发现人机分歧具有系统性,且评分标准修订比对齐效果更大,两者互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21852 2026-06-23 cs.DC 新提交 82%

Rethinking Burst Buffer Optimization: Enabling Layout Heterogeneity via Hybrid Analysis and LLM Guidance

重新思考突发缓冲区优化:通过混合分析和LLM指导实现布局异构性

Yuhan Cai, Huijun Wu, Zhuo Tang, Kehua Guo, Wenzhe Zhang, Zhenwei Wu, Zhouyang Jia, Ruibo Wang, Yong Dong

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出Proteus系统,通过结合静态代码结构和轻量级运行时信号重建I/O意图,在无需训练或详尽分析的情况下优化突发缓冲区的数据布局,实现高达3.24倍和2.9倍的写密集和元数据密集工作负载加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17710 2026-06-23 cs.CV cs.AI cs.CL cs.LG 新提交 82%

Vision-language models for chest radiography do not always need the image

胸部X光片的视觉-语言模型并不总是需要图像

Mahshad Lotfinia, Sebastian Ziegelmayer, Lisa Adams, Daniel Truhn, Andreas Maier, Soroosh Tayebi Arasteh

机构 * Pattern Recognition Lab, Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔朗根-纽伦堡大学模式识别实验室) Department of Diagnostic and Interventional Radiology, TUM University Clinic, School of Medicine and Health, Klinikum rechts der Isar, Technical University of Munich(慕尼黑工业大学医学院与健康学院伊萨尔河右岸医院诊断与介入放射学系) Lab for AI in Medicine, RWTH Aachen University(亚琛工业大学医学人工智能实验室) Department of Diagnostic and Interventional Radiology, University Hospital RWTH Aachen(亚琛工业大学医院诊断与介入放射学系)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过因果审计方法,发现许多医学视觉-语言模型在胸部X光片任务中依赖文本先验而非图像,纯文本模型与多模态模型性能接近,并提出了基于图像依赖性的评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21050 2026-06-23 cs.SD 版本更新 82%

ERM-MinMaxGAP: Benchmarking and Mitigating Gender Bias in Multilingual Multimodal Speech-LLM Emotion Recognition

ERM-MinMaxGAP:多语言多模态语音-LLM情感识别中的性别偏见基准测试与缓解

Zi Haur Pang, Xiaoxue Gao, Tatsuya Kawahara, Nancy F. Chen

机构 * Kyoto University, Japan(京都大学,日本) Agency for Science, Technology, and Research (A*STAR), Singapore(科技研究局(A*STAR),新加坡)

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 针对多语言语音大模型在情感识别中的性别偏见问题,提出基于MELD-ST的多语言多模态基准,并设计ERM-MinMaxGAP训练目标,通过自适应公平权重和MinMaxGAP正则化器,在英日德三种语言上提升性能并缩小性别差距。

Comments This paper has been accepted for presentation at INTERSPEECH 2026 and as non-archival paper at ICML 2026 Workshop on Machine Learning for Audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22657 2026-06-23 cs.LG cs.AI 新提交 82%

Foundation Models for Epileptogenic Zone Identification in Drug-Resistant Epilepsy

药物难治性癫痫中致痫区识别的基础模型

Thi Kieu Khanh Ho, Thomas Lai, Petr Klimes, Jan Cimbalnik, Martin Pail, Milan Brazdil, Birgit Frauscher, Narges Armanfard

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(米拉-魁北克人工智能研究所) Montreal Neurological Institute and Hospital, McGill University(蒙特利尔神经学研究所与医院,麦吉尔大学) Institute of Scientific Instruments, The Czech Academy of Sciences(捷克科学院科学仪器研究所) Brno Epilepsy Center, Department of Neurology, St Anne’s University Hospital(布尔诺癫痫中心,圣安妮大学医院神经内科) Faculty of Medicine, Masaryk University(马萨里克大学医学院) Duke University Medical Center(杜克大学医学中心) Duke Pratt School of Engineering(杜克普拉特工程学院)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出EpiiSLM双基础模型系统,通过信号基础模型和语言基础模型整合sEEG与临床信息,在接触级PPV上超越传统方法15.1%,仅需一夜发作间期睡眠数据。

Comments Keywords: drug-resistant epilepsy, epileptogenic zone, stereo-electroencephalography, signal foundation models, language foundation models

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23416 2026-06-23 cs.CR cs.AI 新提交 81%

Detecting Malicious Agent Skills in the Wild using Attention

利用注意力机制检测野外恶意智能体技能

Bacem Etteib, Daniele Lunghi, Tégawendé F. Bissyandé

机构 * University of Luxembourg(卢森堡大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM技能市场中的恶意技能注入攻击,提出Locate-and-Judge两阶段检测器,通过注意力定位和审查实现高效全市场扫描,大幅降低成本并保持高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22613 2026-06-23 cs.AI 新提交 81%

SkillAudit: From Fixed-Suite Benchmarking to Skill-Centered Assessment

SkillAudit:从固定套件基准测试到以技能为中心的评估

Dexu Yu, Youhua Li, Zhaoyang Guan, Xianhao Lin, Jining Luan, Zihao Rao, Xuanqi Lan, Yang Ran, Bo Lan, Nai-Xin Zhai, Hanwen Du, Junchen Fu, Wenhao Deng, Yongxin Ni, Chunxiao Li

机构 * Northeastern University(东北大学) City University of Hong Kong(香港城市大学) Northwestern University(西北大学) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学) Santa Clara University(圣克拉拉大学) Fenz AI Ohio State University(俄亥俄州立大学) University of Glasgow(格拉斯哥大学) National University of Singapore(新加坡国立大学) DeciLix Lab(DeciLix实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,自动生成技能的多维度评估报告,涵盖效用、效率/成本和安全性,通过基线比较和两阶段检测解决固定套件评估的不足。

Comments Preprint. Project page: https://skillaudit.github.io/. Code and evaluation artifacts: https://github.com/SkillAudit/skillaudit

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22610 2026-06-23 cs.AI 新提交 81%

PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement

PaperClaw:利用智能体实现自主研究与人在回路精炼

Weiwei Ye, Hangchen Liu, Dongyuan Li, Renhe Jiang

机构 * Open scholarly indexes(开放学术索引) Priem et al.(Priem 等) Lo et al.(Lo 等) Si et al.(Si 等) Baek et al.(Baek 等) Wang et al.(Wang 等) Yang et al.(Yang 等) Wei et al.(Wei 等) Yao et al.(Yao 等) Shinn et al.(Shinn 等) Madaan et al.(Madaan 等) Packer et al.(Packer 等) Park et al.(Park 等) Zhong et al.(Zhong 等) Huang et al.(Huang 等) Ji et al.(Ji 等) Min et al.(Min 等)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PAPERCLAW多智能体系统,从研究领域到论文完成全自主,支持人在回路精炼,通过迭代假设验证生成可检验论文。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22470 2026-06-23 cs.AI 新提交 81%

PRIME: Evaluating Prompt Resolution Under Incompatible Instructions in LLMs

PRIME: 评估大语言模型在不兼容指令下的提示解决能力

Tehreem Javed, Shumaim Fatimah, Masooma Bakhtiari, Gibrail Islam, Mehwish Fatima

机构 * School of Electrical Engineering Computer Science (SEECS), National University of Sciences

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出PRIME框架,通过生成校准冲突(响应长度、输出格式、推理)并采用确定性行为分类法,分析大语言模型处理冲突指令的行为,发现冲突类型比模型规模对行为影响更大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21559 2026-06-23 cs.CL 新提交 81%

Rubric-as-Experts: Case-Specific MQM Rubrics for Translation Quality Evaluation

Rubric-as-Experts: 面向翻译质量评估的案例特定MQM评分标准

Weilu Xu, Yunzhi Shen, Xinye Wang, Ranfei Dang, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出案例特定动态评分标准框架,根据翻译实例自适应选择MQM子类型空间和评估粒度,在WMT跨度级QE基准上提升MCC并减少误报。

Comments 18 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15549 2026-06-23 cs.CR cs.AI 新提交 81%

One Goal, Many Commands: Characterizing Denylist Fragility in AI Agents

CmdNeedle: 衡量AI智能体命令黑名单的不完备性

Chuyang Chen, Zhiqiang Lin

机构 * The Ohio State University(俄亥俄州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对终端AI智能体命令黑名单的脆弱性问题,提出LLM驱动的检测流水线CmdNeedle,发现69.0-98.6%的黑名单存在可绕过漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22043 2026-06-23 cs.AI cs.CV cs.LG 新提交 81%

When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR

视频语言模型何时停止观看?多模态RLVR中视觉捷径的形成与逆转受奖励强度控制

Zekun Xu

机构 * Zekun Xu(徐泽坤)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究多模态强化学习中视觉捷径的形成与逆转机制,发现惩罚强度可控制其出现和消除,且存在关键干预窗口。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏