arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 644 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 163 篇

2606.15122 2026-06-16 cs.SE 新提交 80%

The Hitchhiker's Guide to Program Analysis, Part III: Mostly Harmless LLMs

程序分析漫游指南,第三部分:基本无害的LLMs

Haonan Li, Tianyang Zhou, Manu Sridharan, Hang Zhang, Zhiyun Qian

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出Evident系统,将LLM用于构建分析框架,后端形式化验证错误状态不可达,在151个真实警告中正确分类,未漏报任何确认漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15385 2026-06-16 cs.AI 新提交 79%

Reward Hacking in Language Model Agents: Revisiting AI Safety Gridworlds

语言模型智能体中的奖励黑客:重新审视AI安全网格世界

Ömer Veysel Çağatan, Xuandong Zhao

机构 * KUIS AI Center, Koç University(科奇大学KUIS人工智能中心) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本研究将AI安全网格世界框架改编为文本评估套件,发现语言模型在零样本下出现规范博弈,通过直接奖励优化扩大观察与隐藏奖励差距,且标准缓解措施无效。

Comments 28 pages, 16 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11349 2026-06-16 cs.AI cs.HC 新提交 79%

Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents

知道何时提问:分层语言代理的自门控澄清机制

Aijing Gao, Yiming Kang, Mengdie Flora Wang, Jae Oh Woo

机构 * Amazon Web Services(亚马逊云科技)

专题命中 评测与基准 :language agent(title);LLM(abstract_cn);分类 cs.AI

AI总结 提出ACTION-RATING框架,将澄清请求纳入代理的动作空间,与导航共享序数尺度,在分层推理中实现自门控澄清,通过强制性和机会性两种信息寻求模式提升决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17742 2026-06-16 eess.SP cs.AI cs.HC 版本更新 79%

EEG-FM-Bench: A Comprehensive Benchmark for the Systematic Evaluation and Diagnostic Analyses of EEG Foundation Models

EEG-FM-Bench:脑电图基础模型系统评估与诊断分析的综合基准

Wei Xiong, Jiangtong Li, Jie Li, Kun Zhu, Changjun Jiang

机构 * School of Computer Science and Technology, Tongji University, Shanghai, China(同济大学计算机科学与技术学院,上海,中国) Translational Research Center, Shanghai Yangzhi Rehabilitation Hospital (Shanghai Sunshine Rehabilitation Center), China(上海杨氏康复医院(上海阳光康复中心)转化研究中心,中国)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 提出EEG-FM-Bench统一基准,整合14个数据集和10种范式,通过多种微调策略和诊断分析揭示多任务学习可缓解过拟合、预训练效率受梯度冲突限制、模型规模非唯一决定因素等关键发现。

Comments 36 pages, 30 figures, Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17588 2026-06-16 cs.CV cs.CL 版本更新 79%

Dual-branch Prompting for Multimodal Machine Translation

双分支提示用于多模态机器翻译

Jie Wang, Zhendong Yang, Liansong Zong, Xiaobo Zhang, Dexian Wang, Ji Zhang

机构 * School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) School of Computer and Software Engineering, Xihua University(西华大学计算机与软件工程学院) School of Intelligent Medicine, Chengdu University of Traditional Chinese Medicine(成都中医药大学针灸推拿学院)

专题命中 评测与基准 :prompting(title,abstract);分类 cs.CL

AI总结 提出基于扩散模型的双分支提示框架D2P-MMT,利用重建图像过滤视觉噪声,通过分布对齐损失提升鲁棒翻译性能。

Comments This manuscript has been fully accepted and published by ACM Transactions on Multimedia Computing, Communications, and Applications (ACM TOMM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15663 2026-06-16 cs.CV 新提交 78%

OneFocus: Enabling Real-World X-ray Security Screening with a Unified Vision-Language Model

OneFocus: 实现基于统一视觉语言模型的真实世界X光安检

Jiali Wen, Hongxia Gao, Litao Li, Yixin Chen, Kaijie Zhang, Qianyun Liu, Xiaoqin Wen

专题命中 评测与基准 :language model(title,abstract)

AI总结 针对X光违禁品检测中新型违禁品适应难和视觉理解不足的问题,提出MMXray数据集和统一视觉语言模型OneFocus,支持问答、定位、分类和图像理解四项核心任务,达到最先进性能。

Comments 17 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14114 2026-06-16 eess.SP 新提交 78%

Digital Twin-Based Channel Generation Toolchain and Foundation Model for Low-Altitude XL-MIMO

基于数字孪生的低空XL-MIMO信道生成工具链与基础模型

Mengyuan Li, Yu Han, Jiachen Tian, Chao-Kai Wen, Shi Jin

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 针对低空经济中XL-MIMO系统因3D移动性和近场传播导致的高保真无线数据集获取困难,提出基于数字孪生的工具链LAETwin-XL和条件去噪扩散隐式模型(CDDIM)基础模型,实现从部分信道观测中生成完整信道表示,并支持零样本外推和高效迁移学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00873 2026-06-16 cs.MM cs.AI cs.CV 版本更新 77%

BRITE: A Benchmark for Reliable and Interpretable T2V Evaluation on Implausible Scenarios

BRITE:面向不可信场景的可靠可解释文本到视频评估基准

Advait Tilak, Jiwon Choi, Nazifa Mouli, Wei Le

机构 * Department of Computer Science, Iowa State University, Ames, Iowa, USA(计算机科学系,爱荷华州立大学,爱荷华州阿姆斯,美国)

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 提出BRITE基准,通过人工参与协议统一不可信提示、细粒度音视频一致性评估和可解释QA评估,揭示现有模型在对象-动作绑定和音视频同步上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12670 2026-06-16 cs.AI 版本更新 77%

SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks

SkillsBench: 基准测试智能体技能在不同任务中的有效性

Xiangyi Li, Yimin Liu, Wenbo Chen, Bingran You, Zonglin Di, Yifeng He, Shenghan Zheng, Kyoung Whan Choe, Jiankai Sun, Shuyi Wang, Chujun Tao, Binxu Li, Xuandong Zhao, Hejia Geng, Xiaojun Wu, Junwei Zhou, Xiaokun Chen, Hanwen Xing, Yubo Li, Qunhong Zeng, Di Wang, Yuanli Wang, Roey Ben Chaim, Penghao Jiang, Haotian Shen, Luyang Kong, Xinyi Liu, Runhui Wang, Xuanqing Liu, Jiachen Li, Xin Lan, Yueqian Lin, Wengao Ye, Junwei He, Songlin Li, Yue Zhang, Yipeng Gao, Yijiang Li, Ze Ma, Liqiang Jing, Tianyu Wang, Kaixin Li, Yiqi Xue, Haoran Lyu, Yizhuo He, Yuchen Tian, Shutong Wu, Bowei Wang, Yixuan Gao, Bo Chen, Litong Liu, Sikai Cheng, Jiajun Bao, Shuaicheng Tong, Shuwen Xu, Terry Yue Zhuo, Tinghan Ye, Qi Qi, Miao Li, Longtai Liao, Zelin Tan, Chang Shi, Xilin Tang, Srinath Tankasala, Boqin Yuan, Yaoyao Qian, Jianhong Tu, Chenguang Wang, Yizhou Sun, Wei Wang, Aaron Taylor, Ziyue Yang, Changkun Guan, Zhikang Dong, Xinyu Zhang, Steven Dillmann, Han-chung Lee, Dawn Song

机构 * BenchFlow OSU Amazon UC Berkeley UC Santa Cruz UC Davis Dartmouth RLWRLD Independent Princeton University Oxford University Stanford University USC CMU Foxconn Zenity UNSW UT Austin MSU Duke University ByteDance UT Dallas UC San Diego Columbia University University of Rochester Cornell Tech Georgia Tech Cornell University NEU UCLA Snap Inc. Fanshawe College University of Science and Technology of China HKUST(GZ) Anyscale

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SkillsBench基准,包含8领域87个任务,通过配对评估证明技能提升平均通过率16.6个百分点,小模型配备技能可匹敌大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19697 2026-06-16 cs.SE cs.AI 版本更新 77%

AlignCoder: Aligning Retrieval with Target Intent for Repository-Level Code Completion

AlignCoder: 为目标意图对齐检索以实现仓库级代码补全

Tianyue Jiang, Yanli Wang, Yanlin Wang, Daya Guo, Ensheng Shi, Yuchi Ma, Jiachi Chen, Zibin Zheng

机构 * School of Software, Sun Yat-sen University(中山大学软件学院) Sun Yat-sen University(中山大学)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对仓库级代码补全中检索与目标代码不匹配及无法利用推理信息的问题,提出AlignCoder框架,通过查询增强和基于强化学习的检索器训练,在CrossCodeEval上EM分数提升18.1%。

Comments To appear at ASE'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14820 2026-06-16 cs.SD cs.AI cs.CL eess.AS 新提交 76%

Spectro-Temporal Interference Confounds Phase Encoding in Spatial Audio Foundation Models

频谱-时间干扰混淆空间音频基础模型中的相位编码

Yuxuan Chen, Haoyuan Yu, Peize He

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Jilin University(吉林大学) Hunan University(湖南大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 评测与基准 :foundation model(title);分类 cs.CL、cs.AI

AI总结 提出基于双耳掩蔽级差的心理声学基准,评估空间自监督音频模型对微秒级耳间相位精细结构的编码能力,发现通用双耳SSL模型依赖频谱-时间干扰纹理而非真实相位计算。

Comments Accepted to INTERSPEECH 2026; 6 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07226 2026-06-16 cs.LG cs.AI cs.CL 版本更新 75%

DEFINED: A Data-Efficient Computational Framework for Fine-Grained Creativity Assessment in Debate Scenarios

DEFINED: 辩论场景中细粒度创造力评估的数据高效计算框架

Tongzhou Yu, Mingjia Li, Hong Qian, Wenkai Wang, Zongbao Zhang, Yaoyu Jiang, Xiangfeng Wang, Aimin Zhou, Jiajun Guo

机构 * Nanjing University(南京大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DEFINED框架,通过层次化八维指标体系、预训练语言模型和混合粒度训练策略,在辩论场景中实现数据高效的细粒度创造力自动评估,优于现有方法。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16910 2026-06-16 cs.CL cs.AI 新提交 73%

IMPACTeen: Intentions, Manipulation, Persuasion, Annotations, and Consequences in Teen Communication Dataset

IMPACTeen:青少年沟通数据集中的意图、操纵、说服、标注与后果

Aleksander Szczęsny, Wiktoria Mieleszczenko-Kowszewicz, Maciej Markiewicz, Beata Bajcar, Tomasz Adamczyk, Jolanta Babiak, Grzegorz Chodak, Przemysław Kazienko

机构 * Wrocław University of Science and Technology(弗罗茨瓦夫理工大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 构建IMPACTeen数据集,包含1021个青少年社交影响场景文本,从五个视角标注,支持社交影响检测、标注者分歧及跨语言建模研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16541 2026-06-16 cs.AI cs.LG 新提交 73%

The Faithfulness Gap: Certifying Semantic Equivalence Between Natural-Language and Formal Mathematical Statements

忠实性差距:认证自然语言与形式数学语句之间的语义等价性

Noor Islam S. Mohammad, Tamim Sheikh

机构 * Department of Computer Science, Informatics Institute, Istanbul Technical University, İstanbul, Türkiye(信息学院计算机科学系,伊斯坦布尔技术大学,伊斯坦布尔,土耳其) Department of Computer Science(计算机科学系) Engineering, Jashore University of Science(工程系,贾沙尔大学科学学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出双向可证明性指纹识别框架,通过前向和后向推论邻域匹配自然语言探针,认证自动形式化翻译的忠实性,并引入反事实探针生成、等价谱、自适应探针预算分配和忠实性引导解码四个新组件,在基准上实现高检测率并减少漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15144 2026-06-16 cs.CL cs.AI 新提交 73%

PACUTE: Phonology-, Affix-, and Character-level Understanding of Tokens for Filipino

PACUTE: 面向菲律宾语的音韵、词缀和字符级词元理解

Jann Railey Montalan, David Demitri Africa, Jimson Paulo Layacan, Richell Isaiah Flores, Ivan Yuri De Leon, Lance Calvin Gamboa

机构 * AI Singapore(AI新加坡) Nanyang Technological University(南洋理工大学) UK AI Security Institute(英国人工智能安全研究所) Ateneo de Manila University(马尼拉雅典耀大学) University of Birmingham(伯明翰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出PACUTE基准,包含4600个任务,通过六层诊断框架评估大语言模型在菲律宾语中的形态理解,发现开放权重模型在语素分解上接近随机,前沿模型在组合任务上远低于字符级上限。

Comments Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13608 2026-06-16 cs.AI cs.LG 新提交 73%

AgentBeats: Agentifying Agent Assessment for Openness, Standardization, and Reproducibility

AgentBeats:面向开放性、标准化和可复现性的智能体评估代理化

Xiaoyuan Liu, Jianhong Tu, Yuqi Chen, Siyuan Xie, Sihan Ren, Tianneng Shi, Gal Gantar, Evan Sandoval, Donghyun Lee, Daniel Miao, Peter J. Gilbert, Nick Hynes, Mauro Staver, Warren He, David Marn, Andrew Low, Xi Zhang, Elron Bandel, Michal Shmueli-Scheuer, Siva Reddy, Alexandre Drouin, Alexandre Lacoste, Ramayya Krishnan, Elham Tabassi, Yu Su, Victor Barres, Chenguang Wang, Wenbo Guo, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) Purdue University(普渡大学) University of Ljubljana(卢布尔雅那大学) University of Washington(华盛顿大学) Oasis Labs University of Maryland(马里兰大学) IBM Research(IBM研究院) Mila McGill University(麦吉尔大学) ServiceNow Research(ServiceNow研究院) Carnegie Mellon University(卡内基梅隆大学) National Institute of Standards and Technology(美国国家标准与技术研究院) The Ohio State University(俄亥俄州立大学) University of Cambridge(剑桥大学) University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出代理化智能体评估(AAA)框架,通过标准化协议(A2A和MCP)统一评估接口,实现开放、可复现的多智能体评估,并基于AgentBeats系统通过大规模竞赛和案例研究验证其覆盖性、实用性和保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02668 2026-06-16 cs.AI cs.LG 版本更新 73%

SorryDB: Can AI Provers Complete Real-World Lean Theorems?

SorryDB: AI证明者能完成现实世界的Lean定理吗?

Austin Letson, Leopoldo Sarra, Auguste Poiroux, Oliver Dressler, Paul Lezeau, Dhyan Aranha, Frederick Pu, Aaron Hill, Miguel Corredera Hidalgo, Julian Berman, George Tsoukalas, Lenny Taelman

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出动态更新的基准SorryDB,包含78个GitHub上的现实形式化项目,评估AI证明者在复杂依赖下的能力,发现当前方法互补,基于Gemini Flash的智能体方法表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06445 2026-06-16 cs.CL cs.AI cs.CR 版本更新 73%

A Survey on Agentic Security: Applications, Threats and Defenses

关于智能体安全的综述:应用、威胁与防御

Asif Shahriar, Md Nafiu Rahman, Sadif Ahmed, Farig Sadeque, Md Rizwan Parvez

机构 * BRAC University(布拉克大学) Qatar Computing Research Institute (QCRI)(卡塔尔计算研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文首次全面综述智能体安全领域,围绕应用、威胁与防御三大支柱,分类260余篇论文,分析攻击入口、防御策略及生命周期覆盖,指出智能体系统默认结构脆弱,需全生命周期防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05287 2026-06-16 cs.LG cs.AI 版本更新 73%

FlowState: Sampling-Rate-Equivariant Time-Series Forecasting

FlowState: 采样率等变的时间序列预测

Lars Graf, Thomas Ortner, Stanisław Woźniak, Angeliki Pantazi

专题命中 评测与基准 :foundation model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出FlowState架构,通过状态空间模型编码器和函数基解码器实现采样率等变预测,无需重新训练即可适应不同采样率和预测长度,在GIFT-Eval基准上取得最优结果。

Comments Proceedings of the 43 rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026. Copyright 2026 by the author(s)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17005 2026-06-16 cs.AI stat.ME 新提交 70%

Bayesian Inference and Decision Audits for Public Archives of Frontier AI Evaluations

前沿AI评估公共档案的贝叶斯推断与决策审计

Yanan Long

机构 * Yanan Long

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过贝叶斯推断和审计方法,分析公共AI评估档案中的选择性报告和缺失数据,发现单一终端记录与多种历史路径兼容,并验证了审计门限对虚假声明的过滤作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16560 2026-06-16 cs.CL 新提交 70%

The BD-LSC Dataset: Facilitating the Benchmarking of Models for Lexical Semantic Change Detection in Slang and Standard Usage

BD-LSC数据集:促进俚语与标准用法中词汇语义变化检测模型的基准测试

Afnan Aloraini, Viktor Schlegel, Goran Nenadic, Riza Batista-Navarro

机构 * The University of Manchester(曼彻斯特大学) Qassim University(卡西姆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对词汇语义双向变化及俚语与标准用法混合的挑战,构建BD-LSC和ST-WSD两个基准数据集,评估多种方法,发现稀有俚语义项仍是核心难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16408 2026-06-16 cs.LG 新提交 70%

MUNI: Multimodal Unified Latent Diffusion for Coherent Any-to-Any Generation

MUNI:面向连贯任意到任意生成的多模态统一潜在扩散

Kyeongmin Yeo, Yunhong Min, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出MUNI框架,通过端到端多模态潜在扩散和路由训练目标,实现任意到任意生成,在条件生成上匹配或超越基线,并在无条件连贯性上取得最大优势。

Comments Project page: https://muni-proj.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16092 2026-06-16 cs.CV cs.AI 新提交 70%

VinQA: Visual Elements Interleaved Long-form Answer Generation for Real-World Multimodal Document QA

VinQA:面向真实世界多模态文档问答的交错视觉元素长文本答案生成

Young Rok Jang, Hyesoo Kong, Kyunghwan An, Jae Sub Huh, Gyeonghun Kim, Stanley Jungkyu Choi

机构 * LG AI Research(LG AI研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出VinQA数据集和两种编码方法(页面编码与模态编码),用于生成交错引用视觉元素的长文本答案;通过M-GroSE评估框架和微调Qwen2.5-VL模型,显著缩小与专有模型的性能差距。

Comments Accepted to CVPR 2026. Main paper: 5 figures, 4 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15971 2026-06-16 cs.CL 新提交 70%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG: 查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出SAG架构,通过SQL查询动态构建局部超边索引,避免全局图维护,在多跳推理基准上达到最优召回率,支持亿级数据生产部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15888 2026-06-16 cs.SD cs.AI eess.AS 新提交 70%

NVMOS: Non-Verbal Vocalization Quality Assessment in Speech

NVMOS:语音中非语言发声质量评估

Jialong Mai, Jinxin Ji, Xiaofen Xing, Wencui Liu, Xiangmin Xu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对非语言发声(如笑声、叹息)的感知质量评估空白,构建NV-MOS数据集,提出首个专用模型NVMOS,通过局部聚焦模块达到专家级评估一致性。

Comments 6 pages. Code and model: https://github.com/yongaifadian1/NVMOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15640 2026-06-16 cs.LG 新提交 70%

Multi-Agent Framework for Audit Risk Assessment with Explicit Uncertainty and Evidence Conflict Modeling

具有显式不确定性和证据冲突建模的审计风险评估多智能体框架

Yuhan Wang, Manqing Wang, Yixuan Lu, Zhaoyue Peng, Shengda Lin

机构 * Columbia University(哥伦比亚大学) Trine University(特林大学) University of Sofia(索菲亚大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Westcliff University(韦斯特克莱夫大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出UMAR框架,通过三个专业智能体独立评估风险并校准不确定性,利用Dempster-Shafer理论融合分数并测量冲突,在SEC 10-K数据集上优于基线模型,提供可解释的风险信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15483 2026-06-16 cs.CL 新提交 70%

Evaluative Judgement in Teaching AI-based Translation: A Class-room Case Study of AI-Mediated Translation and Post-Editing

基于AI的翻译教学中的评价判断:AI中介翻译与译后编辑的课堂案例研究

Gokhan Dogru

机构 * Universitat Pompeu Fabra Barcelona(巴塞罗那庞培法华大学)

专题命中 评测与基准 :LLM(summary_cn);分类 cs.CL

AI总结 通过分析23个学生项目,研究结构化比较通用LLM和在线MT系统如何激发AI中介翻译中的评价判断,发现学生不盲从自动指标,而是基于充分性、流畅性等理由选择译后编辑输出。

Comments Workshop on Teaching AI-based Translation and Technologies (TAITT 2026) - EAMT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15349 2026-06-16 cs.CY cs.AI 新提交 70%

LearnOpt: Recovering the Latent Cognitive Structure of Standardized Examinations via Knowledge Graphs and Constrained Optimization

LearnOpt: 通过知识图谱和约束优化恢复标准化考试的潜在认知结构

Joy Bose, Om Thomas

机构 * Independent Researchers(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出LearnOpt框架,利用知识图谱和约束优化从历史试题中恢复潜在认知结构,生成个性化学习计划;在NEET和JEE Advanced考试数据上验证了潜在结构的稳定性和可检测的转变。

Comments 26 pages, 2 figures, 6 tables. Code, data, and calibration tooling: https://github.com/joyboseroy/learnopt. Datasets on HuggingFace: joyboseroy/neet-skill-tags-2016-2024, joyboseroy/jee-advanced-skill-tags-2016-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15242 2026-06-16 cs.CR cs.AI 新提交 70%

Benign in Isolation, Harmful in Composition: Security Risks in Agent Skill Ecosystems

孤立无害,组合有害:智能体技能生态系统中的安全风险

Yi Xie, Jiawei Du, Yu Cheng, Jiuan Zhou, Zhaoxia Yin

机构 * East China Normal University(东华大学) Centre for Frontier AI Research A*STAR(前沿人工智能研究中心A*STAR) Shanghai Innovation Institute(上海创新研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出技能组合风险(SCR)概念,通过SCR-Bench基准测试发现,多个技能在共享上下文中组合执行时,攻击成功率显著高于孤立评估,强调应基于激活路径评估技能安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15191 2026-06-16 cs.CL 新提交 70%

AmchiBias: Measuring Stereotypical Bias in Goan Identity Groups with a Minimal Pair Dataset in English and Konkani

AmchiBias:基于英语和孔卡尼语的最小对数据集测量果阿身份群体的刻板偏见

Michelle Barbosa, Sebastian Padó, Franziska Weeber

机构 * Institute for Natural Language Processing, University of Stuttgart(斯图加特大学自然语言处理研究所)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 提出AmchiBias基准,通过313个最小对评估多语言编码器对果阿身份群体的刻板偏见,发现模型在孔卡尼语上表现接近随机,英语查询反映泛印度偏见而非本地文化知识。

Comments The 1st Workshop on Stereotypes Across Cultures in Language Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏