arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-23 至 2026-06-23 共收录 778 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 166 篇

2606.10466 2026-06-23 cs.LG cs.AI 新提交 81%

UPLOTS: A Unified Pretrained Language Model for Constrained Time-series Generation

UPLOTS: 一种用于约束时间序列生成的统一预训练语言模型

Du Yin, Hao Xue, Jinliang Deng, Yang Yang, Shuang Ao, Arian Prabowo, Flora Salim

机构 * University of New South Wales(新南威尔士大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出UPLOTS,一种基于统一预训练语言模型和提示引导的框架,通过动态多数据集损失重加权和提示到模式映射,实现跨领域约束时间序列生成,在四个基准上验证了其泛化性和数据增强效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23339 2026-06-23 cs.RO 新提交 80%

When Robots Rate Their Own Interactions: Engagement Validity and the Strangeness Failure

当机器人评价自身交互:参与度有效性及陌生感失败

Victor Lockwood, Hasan Mahmud, Mohammad Javad Khojasteh, Prabu David, Jamison Heard

机构 * Rochester Institute of Technology(罗切斯特理工学院)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 提出LLM驱动的机器人从自身视角完成标准化问卷的逆向评价方法,发现机器人在参与度维度与人类一致,但系统性地反转了舒适/陌生感维度,表明当前机器人缺乏评估陌生感所需的内在情感状态。

Journal ref IEEE RO-MAN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22918 2026-06-23 cs.CV cs.GT 新提交 80%

Each Judge Its Own Yardstick: Discovering Per-VLM Taxonomies for Physical Video Evaluation

各有所尺:发现用于物理视频评估的每VLM分类体系

Yu Cao, Ziquan Liu, Zhensong Zhang, Jiankang Deng, Shaogang Gong, Jifei Song

机构 * Queen Mary University of London(伦敦玛丽女王大学) Huawei Darwin Research Center(华为达尔文研究中心) Imperial College London(伦敦帝国理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract)

AI总结 提出JudgeFit方法,通过迭代优化为每个视觉语言模型发现其专属的物理视频评估分类体系,在16个VLM上平均相对提升约32%,并揭示模型特定盲点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22399 2026-06-23 cs.SD 新提交 80%

ATCCaps: A Call-Sign-Aware Speech Dataset for Air Traffic Control Recognition

ATCCaps: 一个面向空中交通管制识别的呼号感知语音数据集

Dongdong Li, Jianwei Song, Jianwei Wang, Zhe Wang

机构 * East China University of Science and Technology(华东理工大学)

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 本文提出ATCCaps,一个基于真实无线电通话构建的呼号感知语音数据集,包含202.94小时音频和17万条话语,通过结合置信度感知的转录解析、ADS-B呼号元数据、规则过滤和LLM辅助字幕生成,支持ASR评估、呼号匹配和音频-文本检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21926 2026-06-23 cs.SE 新提交 80%

A11YRepair: Bridging Web Accessibility Barriers via Knowledge-Enhanced Divide-and-Conquer Repair

A11YRepair: 通过知识增强的分治修复弥合网络无障碍障碍

Kai Huang, Ling Zhu, Jian Zhang, Xiaofei Xie, Chunyang Chen

专题命中 评测与基准 :LLM(summary_cn,abstract)

AI总结 针对网络无障碍违规修复问题,提出基于LLM的分治框架A11YRepair,通过聚类关联违规并引入WCAG领域知识,实现多文件协调修复,在60个真实项目中优于现有方法。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21377 2026-06-23 cs.CR 新提交 80%

ARENA: An Architecture for Measuring the Transferability of Autonomous Cyber Defense

ARENA: 一种衡量自主网络防御可迁移性的架构

Sidnei Barbieri, Ágney Lopes Roth Ferraz, Wagner Comin Sonaglio, Gioliano de Oliveira Braga, Henrique Curi de Miranda, Lourenço Alves Pereira Júnior

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对生产环境安全运营中心数据难以公开的问题,提出一种从私有生产数据中提取、匿名化、结构化并验证SIEM数据的方法,在保护隐私的同时保留任务相关结构,并通过两个应用案例验证了隐私-效用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14837 2026-06-23 cs.CV 版本更新 80%

DamageArbiter: A Multimodal Arbitration Framework for Disaster Damage Assessment from Street-View Imagery

DamageArbiter:一种基于街景图像进行灾害损伤评估的多模态仲裁框架

Yifan Yang, Lei Zou, Wenjing Gong, Kani Fu, Zongrong Li, Siqin Wang, Bing Zhou, Heng Cai, Hao Tian

机构 * organization= Department of Geography, Texas A\&M University , city= College Station , country= USA organization= Department of Landscape Architecture \& Urban Planning, Texas A\&M University , city= College Station , country= USA organization= Department of Industrial Systems Engineering, University of Florida , city= Gainesville , country= USA organization= Spatial Sciences Institute, University of Southern California , city= Los Angeles , country= USA organization= Department of Geography Sustainability, University of Tennessee , city= Knoxville , country= USA

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DamageArbiter多模态仲裁框架,通过轻量级逻辑回归元分类器仲裁单模态与多模态模型预测分歧,在2556张街景图像上将准确率提升至75.85%,MCC达0.6188,并将过度自信误差从70.58%降至16.45%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23583 2026-06-23 cs.CL 新提交 79%

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

评估意识并非单一能力:来自开放语言模型的证据

Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal, Shivani Anilkumar, Sankaran Vaidyanathan, David A. Nader Palacio, Reshmi Ghosh, Soundararajan Srinivasan

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Microsoft Corp.(微软公司)

专题命中 评测与基准 :language model(title);instruction tuning(abstract);分类 cs.CL

AI总结 通过37个开放权重模型实验,发现语言模型对评估线索的检测、行为变化和表征可控性三个维度弱耦合,表明评估意识是多维的,单一分数无法可靠预测部署安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22188 2026-06-23 cs.LG 新提交 79%

Bayesian Adaptation Gym: A Benchmark for the Bayesian Low-Rank Adaptation of Multi-Modal Language Models

贝叶斯适应健身房:多模态语言模型贝叶斯低秩适应的基准

Colin Samplawski, Ramneet Kaur, Manoj Acharya, Anirban Roy, Adam D. Cobb

机构 * Neuro-Symbolic Computing and Intelligence Research Group(神经符号计算与智能研究组) Computer Science Laboratory(计算机科学实验室) SRI International(SRI国际)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 提出贝叶斯适应健身房(BAG)基准,用于评估多模态语言模型的贝叶斯低秩适应方法,涵盖校准、分布偏移鲁棒性和主动学习下的不确定性决策。

Comments Oral Paper at UAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22181 2026-06-23 cs.LG 新提交 79%

Residue-Level Attributions in Protein Language Models Do Not Recover Allergen Epitopes

蛋白质语言模型中的残基级归因不能恢复过敏原表位

Jianzhou Yao, Anxiong Song, Katja Baerenfaller, Damir Zhakparov

机构 * Swiss Institute of Allergy and Asthma Research, Davos, Switzerland(瑞士过敏与哮喘研究所,达沃斯,瑞士) ETH Zurich, Zurich, Switzerland(苏黎世联邦理工学院,苏黎世,瑞士) Swiss Institute of Bioinformatics, Lausanne, Switzerland(瑞士生物信息学研究所,洛桑,瑞士)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本研究通过引入表位基准,评估蛋白质过敏原性模型的可解释性,发现分类器残基级归因与注释表位对齐不显著,模型可能依赖理化特征而非表位特异性机制。

Comments Accepted at the ICML 2026 Mechanistic Interpretability Workshop (peer-reviewed)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22166 2026-06-23 cs.DL cs.AI cs.LG 新提交 79%

Rebuttals Move Peer-Review Scores, but Initial-Review Structure Bounds the Movement

反驳会改变同行评审分数,但初始评审结构限制了变化幅度

Mathieu Louis, Tibo Vanleke, Vincent Ginis, Andres Algaba

机构 * Data Analytics Lab, Vrije Universiteit Brussel(自由大学布鲁塞尔数据分析实验室) imec-SMIT, Vrije Universiteit Brussel(imec-SMIT,自由大学布鲁塞尔) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.AI、cs.LG

AI总结 利用ICLR 2024-2025的73,000条评审轨迹,结合LLM分析,发现反驳能改变分数,但初始评审结构已预测大部分变化,且可测量的交换信号多为反驳失败模式。

Comments 26 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09178 2026-06-23 cs.CL cs.AI 新提交 79%

Culturally-Adapted Red-Teaming Across East and Southeast Asian Contexts: A Methodological and Comparative Analysis

跨东亚和东南亚语境的文化适应红队测试:方法论与比较分析

Hyeji Choi, Yongtaek Lim, Minwoo Kim

机构 * University of California, Berkeley(加州大学伯克利分校) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型的多语言安全评估,通过构建直接翻译与文化适应数据集,发现文化适应提示的攻击成功率平均提升9.3个百分点,直接翻译低估风险,且文化深度评分显著低于文化适应版本,表明适应文化语境对有效评估至关重要。

Comments Accepted to ICML 2026 Workshop on Culture X AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06676 2026-06-23 cs.CL cs.AI cs.HC 版本更新 79%

One Interaction Is Worth a Thousand Guesses: Benchmarking the Interactive Capabilities of Deep Research Agents

一次交互胜过千次猜测:深度研究代理的交互能力基准测试

Yingchaojie Feng, Qiang Huang, Xiaoya Xie, Zhaorui Yang, Jun Yu, Wei Chen, Anthony K. H. Tung

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Intelligence Science and Engineering, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)智能科学与工程学院) Zhejiang University(浙江大学) State Key Lab of CAD&CG, Zhejiang University(浙江大学计算机辅助设计与图形学国家重点实验室)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出IDRBench基准,通过交互式框架和用户模拟器评估深度研究代理的交互能力,实验表明交互能提升研究质量和鲁棒性。

Comments 17 pages, 9 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23139 2026-06-23 eess.AS 新提交 78%

Audio Editing in the Era of Foundation Models: A Survey

基础模型时代的音频编辑:综述

Changhao Pan, Yifei Fan, Fan Zhuo, Yifu Chen, Wenxiang Guo, Yu Zhang, Ruiqi Li, Zhiyuan Zhu, Rui Yang, Shengpeng Ji, Chenyuhao Wen, Jiayang Xu, Ke Lei, Xiaoda Yang, Jingyu Lu, Zhou Zhao

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文综述了基础模型时代音频编辑的研究进展,提出了统一的任务分类法,总结了基于训练和免训练的编辑范式,并讨论了数据集、评估协议等资源及未来方向。

Comments 23 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21861 2026-06-23 cs.CV 新提交 78%

Zero-Shot Vision-Language Models for Classroom Engagement Recognition: A Benchmark Study of Prompt Sensitivity and Cross-Dataset Generalization

零样本视觉语言模型用于课堂投入度识别:提示敏感性与跨数据集泛化的基准研究

Aman Goyal, Kshama Nitin Shah, Kemmannu Vineet Venkatesh Rao

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校) Magna International(麦格纳国际)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本研究系统评估五种视觉语言模型在零样本条件下识别课堂投入度的表现,发现三个主要失败模式:个体学生识别近乎随机、类别崩溃和极端提示敏感性,但场景级分类效果较好。

Comments 11 pages, 6 figures, including supplementary material. Presented as a non-archival paper at the CV4Edu Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21787 2026-06-23 cs.SE 新提交 78%

Towards Imputation of Pre-Trained Language Model Metadata using Semantic Fingerprinting

基于语义指纹的预训练语言模型元数据插补方法

Adekunle Ajibode, Oussama Ben Sghaier, Keheliya Gallaba, Bram Adams, Ahmed E. Hassan

专题命中 评测与基准 :language model(title,abstract)

AI总结 提出语义指纹(SemFin)方法,利用Hugging Face配置文件和仓库标签自动插补缺失的PTLM元数据并重建模型谱系,在317,133个模型上相比基线提升预测准确率最高31.4%,并成功处理16.6%的孤立模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22793 2026-06-23 cs.AI 新提交 77%

A Formula-Driven Survey and Research Agenda for On-Policy Distillation

基于公式驱动的在线策略蒸馏综述与研究议程

Bowen Zhang

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本文提出一种公式驱动的分类法,将在线策略蒸馏(OPD)视为反馈到更新的问题,区分直接分布损失和策略梯度式对数比更新,并揭示状态兼容性、支持构建、时间信用、词汇路由等关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22442 2026-06-23 cs.AI 新提交 77%

Efficient Multimodal Clinical Question Answering for Pulmonary Embolism Risk Assessment

用于肺栓塞风险评估的高效多模态临床问答

Xiangyuan Xue, Yang Yu, Yan Gao, Junyan Wang, Bin Chen, Lingyan Ruan, Ting Dang, Hong Jia

机构 * University of Auckland(奥克兰大学) University of Cambridge(剑桥大学) University of Adelaide(阿德莱德大学) University of Melbourne(墨尔本大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究构建了基于INSPECT数据集的肺栓塞多模态基准,通过结构化问答任务评估高效多模态大模型在CTPA和EHR输入下的诊断与预后性能,发现Gemma4模型在结合CTPA+EHR时表现更优,且诊断任务优于预后任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00710 2026-06-23 cs.AI 版本更新 77%

Learning More from Less: Unlocking Internal Representations for Benchmark Compression

从更少中学习更多:解锁内部表示以实现基准压缩

Yueqi Zhang, Jin Hu, Shaoxiong Feng, Peiwen Yuan, Xinglin Wang, Yiwei Li, Jiayi Shi, Chuyi Tan, Ji Zhang, Boyuan Pan, Yao Hu, Kan Li

机构 * School of Computer Science, Beijing Institute of Technology(北京理工大学计算机科学学院)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出RepCore方法,通过对齐异构隐藏状态构建代表性核心集,仅需少量源模型即可精确估计大语言模型在完整基准上的性能,显著优于基于输出的基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15378 2026-06-23 cs.CL 版本更新 77%

AlgoSimBench: Identifying Algorithmically Similar Problems for Competitive Programming

AlgoSimBench: 识别算法相似问题的竞赛编程基准

Jierui Li, Raymond Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AlgoSimBench基准,通过对抗性设计的多选题评估大语言模型识别算法相似问题的能力,并引入尝试解决方案匹配方法提升准确率。

Comments 14 pages, accepted to IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22000 2026-06-23 cs.AI cs.CL cs.LG cs.SE 新提交 75%

CFAgentBench: A Reproducible Environment and Benchmark for Autonomous Construction-Finance Agents

CFAgentBench:面向自主建筑金融智能体的可复现环境与基准测试

Rishi Srivastava

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出CFAgentBench,一个可复现的建筑金融智能体基准,包含1014个任务、35个模拟应用,通过功能正确性评分,强调资金流动防护,实验表明单次准确率高估了部署能力。

Comments 28 pages, 2 figures, 13 tables. Benchmark, environment spec, and app contract released. First open-weight three-model sweep (k=5) on a 40-task oracle-validated executable suite; frontier-model leaderboard committed in the roadmap

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21810 2026-06-23 cs.SE 新提交 75%

GitReq: A Gold Standard Dataset for Software Quality Requirements

GitReq:软件质量需求的金标准数据集

Farha Kamal, Md Humaun Kabir, Md Rakibul Islam

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出GitReq数据集,包含6302条专家验证的软件质量需求,覆盖8个ISO/IEC 25010:2011质量类别,通过三重信号挖掘和人工标注构建,零样本评估GPT-5.2达到最高宏平均F1为0.641。

Comments Accepted at The 24th IEEE/ACIS International Conference on Software Engineering Research, Management and Applications

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16584 2026-06-23 cs.CL cs.AI cs.LG 版本更新 75%

Measuring Intent Comprehension in LLMs

测量LLMs中的意图理解

Nadav Kunievsky, James A. Evans

机构 * Knowlesdge Lab, University of Chicago, Chicago, Illinois, USA(知识实验室,芝加哥大学,芝加哥,伊利诺伊州,美国) Knowledge Lab, Data Science Institute, Department of Sociology, University of Chicago, Chicago, Illinois, USA(知识实验室,数据科学学院,社会学系,芝加哥大学,芝加哥,伊利诺伊州,美国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一个形式化框架,通过方差分解评估LLMs对用户意图的理解能力,发现更大模型通常将更多输出方差归因于意图差异,表明意图理解更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23042 2026-06-23 cs.CY cs.AI cs.CL stat.AP 新提交 73%

The Model as One Rater Among Several: Measuring Political Positions in Data-Sparse Regions with a Language-Model Panel

模型作为多位评估者之一:在数据稀疏区域使用语言模型面板测量政治立场

Tarek Gara

机构 * Independent researcher(独立研究者)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出将大语言模型作为面板中的一位评估者,通过多模型投票测量政治立场,在数据稀疏区域(如中东和北非)验证了可靠性,并发现分歧可提供信息。

Comments 21 pages, 1 figure, 7 tables. Dataset, rubric, and interactive tools: https://tarekgara.com/tayyar

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22811 2026-06-23 cs.CL cs.AI 新提交 73%

Bagpiper-TTS: Natural Language Guided Universal Speech Synthesis

Bagpiper-TTS: 自然语言引导的通用语音合成

Jinchuan Tian, Haoran Wang, Siddhant Arora, Takashi Maekaku, Keita Goto, Jin Sakuma, Yusuke Shinohara, Chao-Han Huck Yang, Shinji Watanabe

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) LY Corporation NVIDIA Research(英伟达研究院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出Bagpiper-TTS,通过自然语言提示推理用户意图生成丰富描述,再合成语音,支持多说话人、意图转语音、角色扮演、歌声合成等任务,在Seed-TTS-Eval上WER为1.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21685 2026-06-23 cs.CL cs.AI cs.DB 新提交 73%

TACO: Task-Aware Column Description Generation Using LLMs

TACO:使用LLMs的任务感知列描述生成

Ting Cai, Rakesh R. Menon, Yiru Chen, Zifan Liu, Yuan Tian, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sunav Choudhary, Kun Qian, Yunyao Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Purdue University(普渡大学) Adobe

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出TACO框架,通过三步流水线(缩写扩展、描述生成、描述修订)利用LLMs自动生成准确且信息丰富的列描述,在下游任务中性能提升高达32%。

Comments 15 pages, 11 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20961 2026-06-23 cs.LG cs.AI 新提交 73%

Is Our Benchmark Enough? An Analysis of Continual Learning for MLLMs

我们的基准测试足够吗?多模态大语言模型持续学习分析

Van-Tuan Tran, Shruthi Gowda, Merim Dzaferagic, Marco Ruffini

机构 * School of Computer Science and Statistics, Trinity College Dublin(都柏林圣三一学院计算机科学与统计学院) Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文质疑MR-LoRA方法对MLLM路由器的依赖,提出无训练无重放的简单原型路由方法RePRo,并指出共享专家无益,揭示MLLM-CL基准的任务高度可分离和固定顺序导致评估偏差,从而提出新基准设计。

Comments ICML 2026 Workshop "Continual Adaptation at Scale: Towards Sustainable AI"

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20255 2026-06-23 cs.CL cs.AI 新提交 73%

The Register Gap: A Meaning Intelligence Framework for Nigerian Public Discourse

语域差距:尼日利亚公共话语的意义智能框架

Celestine Achi

机构 * AGENTPR™ / AI-Powered PR / Cihan Digital Academy(AGENTPR™ / AI-Powered PR / 塞汉数字学院)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出九维意义智能框架(MIF),通过语域、真实意图等维度区分表面情感与真实交际意图,在尼日利亚公共话语数据集上使语域分类准确率提升40个百分点,复合意义智能评分提升5.4分。

Comments Preprint v2. 14 pages, 3 tables. Multi-model evaluation (Gemini 2.5 Flash, GPT-5, Gemini 2.5 Pro). Supplementary materials available from the author

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03553 2026-06-23 cs.CL cs.AI 版本更新 73%

MultiZebraLogic: A Multilingual Logical Reasoning Benchmark

MultiZebraLogic:多语言逻辑推理基准

Sofie Helene Bruun, Dan Saattrup Smart

机构 * The Alexandra Institute(亚历山大研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出多语言逻辑推理基准MultiZebraLogic,包含九种语言的高质量斑马谜题数据集,通过调整谜题大小和添加无关线索控制难度,分析语言、文化敏感性和线索类型对模型性能的影响。

Comments Camera-ready version for RESOURCEFUL 2026 at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04458 2026-06-23 cs.CL cs.IR 版本更新 70%

DoGMaTiQ: Automated Generation of Question-and-Answer Nuggets for Report Evaluation

DoGMaTiQ:面向报告评估的问答片段自动生成

Bryan Li, William Walden, Yu Hou, Gabrielle Kaili-May Liu, Dawn Lawrie, James Mayfield, Eugene Yang, Chris Callison-Burch, Laura Dietz

机构 * Google Inc.(谷歌公司) Johns Hopkins University(约翰霍普金斯大学) University of Maryland(马里兰大学) Yale University(耶鲁大学) University of Pennsylvania(宾夕法尼亚大学) University of New Hampshire(新罕布什尔大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出DoGMaTiQ流水线,通过文档锚定生成、释义聚类和基于质量准则的子选择三步自动生成高质量QA片段,实现报告的全自动评估,在跨语言任务中与人工判断高度相关。

Comments ICTIR '26

详情

展开后加载摘要…

URL PDF HTML 收藏