arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1356 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 1356 篇

2511.17649 2026-07-08 cs.CV cs.AI cs.RO 版本更新 57%

SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios

SWITCH:在长时程具身场景中评估和处理具象接口的基准测试

Juntao Cheng, Wanyue Zhang, Zhiwei Yu, Shuo Ren, Zheqi He, Shaoxuan Xie, Guocai Yao, Jieru Lin, Börje F. Karlsson, Jiajun Zhang

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 SWITCH基准测试通过1170个时间交互视频,评估具象接口在真实第一人称环境中的闭环交互推理,揭示多模态模型在细粒度视觉-时间感知、结果验证和错误恢复方面的不足。

Comments The dataset is available at https://huggingface.co/datasets/BAAI-Agents/SWITCH

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21803 2026-07-08 cs.CL 版本更新 57%

Quantifying Retriever-Generator Alignment in RAG with Local Explanations

用局部解释量化检索生成模型(RAG)中的检索器-生成器对齐

Korbinian Randl, Guido Rocchietti, Aron Henriksson, Ziawasch Abedjan, Tony Lindgren, John Pavlopoulos

机构 * Department of Computer and Systems Sciences, Stockholm University(斯德哥尔摩大学计算机与系统科学系) BIFOLD, Technische Universität Berlin(柏林技术大学BIFOLD) Department of Informatics, Athens University of Economics and Business(雅典经济与商业大学信息系) Archimedes, Athena Research Centre(雅典研究中心Archimedes)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究RAG系统中检索器与生成器交互不透明问题,提出RAG-E框架,用数学归因方法量化二者对齐,通过实验表明WARG能更好捕捉对齐情况,为审计交互提供实用框架,提升RAG系统可靠性与透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03042 2026-07-03 cs.CV cs.AI 版本更新 57%

PPTArena: A Benchmark for PowerPoint Editing

PPTArena: 一个用于PowerPoint编辑的基准测试

Michael Ofengenden, Yunze Man, Ziqi Pang, Liang-Yan Gui, Yu-Xiong Wang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出PPTArena基准,包含2125张幻灯片的1300+人工编辑任务,并设计PPTPilot智能体通过结构感知的规划-编辑-验证循环,在复合、布局敏感和跨幻灯片编辑上超越强基线10个百分点以上。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20441 2026-07-03 cs.SD cs.AI 版本更新 57%

UniSE: A Unified Framework for Decoder-Only Autoregressive LM-Based Speech Enhancement

UniSE:一种基于仅解码器自回归语言模型的统一语音增强框架

Haoyin Yan, Chengwei Liu, Shaofei Xue, Xiaotao Liang, Yinghao Liu, Yuxiang Kong, Zheng Xue

机构 * Qwen Business Unit of Alibaba, China(阿里巴巴Qwen业务单元,中国) Tongyi AI Lab of Alibaba, China(阿里巴巴通义AI实验室,中国)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出UniSE,一种统一的仅解码器LM框架,通过自回归生成离散令牌处理语音恢复、目标说话人提取和语音分离任务,并引入渐进强化学习优化质量,在多个基准上取得竞争性表现。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16432 2026-07-02 cs.CV cs.LG 版本更新 57%

IRIS: A Real-World Benchmark for Inverse Recovery and Identification of Physical Dynamic Systems from Monocular Video

IRIS:从单目视频进行物理动态系统逆恢复与识别的真实世界基准

Rasul Khanbayov, Mohamed Rayan Barhdadi, Erchin Serpedin, Hasan Kurban

机构 * Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 提出IRIS基准,包含240个4K/60fps真实视频,覆盖单体和多体动力学,提供真实参数和不确定度,定义标准化评估协议,评估多种基线方法,揭示系统失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02863 2026-07-01 cs.AI 版本更新 57%

Don't Gamble, GAMBLe: An Analytical Framework for AI-Driven Research Systems

不要赌博,GAMBLe:AI驱动研究系统的分析框架

Marquita Ellis, Paul Castro

机构 * IBM Research(IBM研究院)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 提出GAMBLe框架,通过四个参数(生成器G、评估器A、发现机制M、预算B)和一个有效景观L_eff = A ∘ G分解AI驱动研究系统行为,实验表明组件选择可显著提升性能和搜索效率。

Comments Preprint. 23 pages (10 main, 13 appendix). 6 figures (2 in main, 4 in appendix)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18197 2026-06-29 cs.AI 版本更新 57%

GAIA: A Data Flywheel System for Training GUI Test-Time Scaling Critic Models

GAIA: 用于训练GUI测试时缩放评论模型的数据飞轮系统

Shaokang Wang, Pei Fu, Ruoceng Zhang, Shaojie Zhang, Xiuwen Xi, Jiahui Yang, Bin Qin, Ying Huang, Zhenbo Luo, Jian Luan

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出GAIA数据飞轮系统,通过训练直觉评论模型(ICM)评估GUI代理动作的正确性,利用正负样本迭代提升代理测试时性能,实验表明该方法能持续改进多种模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02340 2026-06-29 cs.AI q-bio.OT 版本更新 57%

Chronic Kidney Disease Prognosis Prediction Using Transformer

使用Transformer进行慢性肾脏病预后预测

Yohan Lee, Dong Gyun Kang, SeHoon Park, Sa-Yoon Park, Kwangsoo Kim

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出基于Transformer的ProQ-BERT框架,利用多模态电子健康记录预测CKD进展,在9万余名患者数据上实现高达0.995的ROC-AUC。

Comments 5 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23842 2026-06-25 cs.CL 版本更新 57%

How Pragmatics Shape Articulation: A Computational Case Study in STEM ASL Discourse

语用如何塑造发音:STEM ASL 话语的计算案例研究

Saki Imai, Lee Kezar, Laurel Aichler, Mert Inan, Erin Walker, Alicia Wooten, Lorna Quandt, Malihe Alikhani

机构 * Northeastern University(东北大学) Gallaudet University(盖尔道特大学) University of Pittsburgh(匹兹堡大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 通过采集 STEM 领域美国手语对话的运动捕捉数据,量化分析对话、独白和翻译场景中手语发音的时空变化,发现对话中手语持续时间显著缩短,并评估了手语嵌入模型对 STEM 手语的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21481 2026-06-24 cs.CL 版本更新 57%

Preferences of a Voice-First Nation: Large-Scale Pairwise Evaluation and Preference Analysis for TTS in Indian Languages

语音优先的印度语言国家偏好:面向印度语言TTS的大规模成对评估与偏好分析

Srija Anand, Ashwin Sankar, Ishvinder Sethi, Aaditya Pareek, Kartik Rajput, Gaurav Yadav, Nikhil Narasimhan, Adish Pandya, Deepon Halder, Mohammed Safi Ur Rahman Khan, Praveen S, Shobhit Banga, Mitesh M Khapra

机构 * Indian Institute of Technology, Madras, India(印度理工学院马德拉斯分校) AI4Bharat, India(AI4Bharat) Josh Talks, India(Josh Talks)

专题命中 评测与基准 :foundation model(abstract);分类 cs.CL

AI总结 本文通过大规模成对评估和分析,探讨印度语言TTS系统在多语言环境下的偏好,结合语言控制与感知注解,评估7种先进系统,揭示人类偏好与模型性能的多维关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05469 2026-06-23 cs.LG cs.IT math.IT 版本更新 57%

Let's Measure Information Step-by-Step: AI-Based Evaluation Beyond Vibes

逐步测量信息:超越情绪的AI评估

Zachary Robertson, Sanmi Koyejo

机构 * Department of Computer Science(计算机科学系)

专题命中 评测与基准 :prompting(abstract);分类 cs.LG

AI总结 本文提出基于AI的评估方法,通过战略游戏与信息损失的联系,分析对抗操纵下鲁棒的机制,证明总变差距离在对抗攻击下保持多项式保证,提升信息关系提示的鲁棒性。

Comments Accepted to TMLR (2026). Updated appendix to restore the proof of Theorem 3.3

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12911 2026-06-23 cs.CL 版本更新 57%

ViMedCSS: A Vietnamese Medical Code-Switching Speech Dataset & Benchmark

ViMedCSS:越南语医学术语代码转换语音数据集与基准

Tung X. Nguyen, Nhu Vo, Giang-Son Nguyen, Duy Mai Hoang, Chien Dinh Huynh, Inigo Jauregi Unanue, Massimo Piccardi, Wray Buntine, Dung D. Le

机构 * College of Engineering and Computer Science(工程与计算机科学学院) Center for AI Research(人工智能研究中心) College of Health Sciences(健康科学学院) University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :pretraining(abstract);分类 cs.CL

AI总结 针对越南语医学术语代码转换问题,构建了34小时语音数据集ViMedCSS,评估多种ASR模型并探索微调策略,发现越南语优化模型与多语言预训练结合效果最佳。

Comments Accepted at LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05409 2026-06-18 cs.CV cs.CL 版本更新 57%

Would you still call this Dax? Novel Visual References in VLMs and Humans

你还会称它为Dax吗?VLM与人类中的新颖视觉参照

Ada Defne Tür, Gaurav Kamath, Joyce Chai, Siva Reddy, Benno Krojer

机构 * McGill University(麦吉尔大学) Mila Quebec AI Institute(魁北克人工智能研究所) University of Michigan - Ann Arbor(密歇根大学安娜堡分校) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出新颖视觉参照数据集(NVRD),通过对比VLM和人类对新颖视觉概念的泛化能力,发现模型在矛盾先验知识时难以习得新概念,且过度泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03297 2026-06-16 cs.SD cs.LG 版本更新 57%

Contrastive Regularization for Accent-Robust ASR

对比正则化用于口音鲁棒的ASR

Van-Phat Thai, Aradhya Dhruv, Duc-Thinh Pham, Sameer Alam

机构 * Air Traffic Management Research Institute, Nanyang Technological University, Singapore(新加坡南洋理工大学航空交通管理研究所) Center of AI Research, VinUniversity, Vietnam(越南Vin大学人工智能研究中心)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 提出使用监督对比学习作为轻量级口音不变辅助目标,在CTC微调中正则化编码器表示,无需架构修改或显式口音监督,在L2-ARCTIC基准上实现高达25-29%的未见口音词错误率降低。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09329 2026-06-16 cs.LG 版本更新 57%

MacrOData: New Benchmarks of Thousands of Datasets for Tabular Outlier Detection

MacrOData:用于表格异常检测的数千个数据集的新基准

Xueying Ding, Simon Klüttermann, Haomin Wen, Yilong Chen, Leman Akoglu

机构 * Carnegie Mellon University(卡内基梅隆大学) Technical University of Dortmund(多特蒙德技术大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 提出大规模表格异常检测基准MacrOData,包含2446个数据集,覆盖真实与合成异常,支持全面鲁棒的评估。

Comments 29 pages, KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21613 2026-06-16 cs.CL cs.SD eess.AS 版本更新 57%

ChildGuard: A Specialized Dataset for Combatting Child-Targeted Hate Speech

ChildGuard:针对儿童仇恨言论的专用数据集

Gautam Siddharth Kashyap, Mohammad Anas Azeez, Rafiq Ali, Zohaib Hasan Siddiqui, Jiechao Gao, Usman Naseem

机构 * Macquarie University(麦考瑞大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) DSEU(德里国家理工学院) Department of Information and Computer Science, KFUPM(科威特石油大学信息与计算机科学系) Stanford University(斯坦福大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 针对社交媒体上针对儿童的仇恨言论问题,构建了大规模英文数据集ChildGuard,包含351,877条标注实例,覆盖三个年龄段,并评估了多种模型性能。

Comments Updated Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11201 2026-06-16 cs.DB cs.AI 版本更新 57%

Bridging the Gap: Enabling Natural Language Queries for NoSQL Databases through Text-to-NoSQL Translation

弥合差距:通过文本到NoSQL翻译实现NoSQL数据库的自然语言查询

Jinwei Lu, Jiawei Lu, Chen Zhang, Zhiqian Qin, Haodi Zhang, Yuanfeng Song, Raymond Chi-Wing Wong

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.AI

AI总结 本文研究Text-to-NoSQL任务,提出TEND基准和SAG求解器,用于将自然语言请求翻译为MongoDB聚合管道,验证了无模式文档推理的独特挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00593 2026-06-15 cs.CV cs.LG 版本更新 57%

Pix2Fact: When Vision Is Not Enough -- Benchmarking Fine-Grained VQA with Web Verification on High-Resolution Real-World Scenes

Pix2Fact: 当视觉不够时——基于网络验证的细粒度VQA基准测试

Yifan Jiang, Cong Zhang, Bofei Zhang, Qiaofeng Zheng, Yifan Yang, Bingzhang Wang, Yew-Soon Ong

机构 * GADE Union (Global AI Data Experts Union)(GADE联盟(全球人工智能数据专家联盟)) Shanghai Jiao Tong University(上海交通大学) Nanyang Technological University(南洋理工大学) New York University(纽约大学) Cambridge University(剑桥大学) The University of Hong Kong(香港大学)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 本文提出Pix2Fact基准测试,通过高分辨率真实场景中的网络验证,评估细粒度视觉问答中的专家级视觉感知和知识搜索能力,发现现有模型在复杂任务中存在显著不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11378 2026-06-15 cs.CL 版本更新 57%

An Empirical Study of Automating Agent Evaluation

自动化代理评估的实证研究

Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram, Aosong Feng, Vinayak Arannil, Muhyun Kim, Ishan Singh, Darren Wang, Zhichao Xu, Megha Gandhi, Nirmal Prabhu, Soumya Smruti Mishra, Vivek Singh, Gouri Pandeshwar, Lin Lee Cheong

机构 * AWS AI Labs(AWS人工智能实验室)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL

AI总结 本文研究了自动化代理评估的可行性,提出EvalAgent系统,通过编码技能和领域知识提升评估效率,实验显示其在评估准确性和人类偏好上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16689 2026-06-12 cs.AI 版本更新 57%

The Query Channel: Information-Theoretic Limits of Masking-Based Explanations

查询通道:基于掩码的解释的信息论极限

Erciyes Karakaya, Ozgur Ercetin

机构 * Department of Electrical and Computer Engineering, University of Maryland, College Park, USA(美国马里兰大学电气与计算机工程系) Faculty of Engineering and Natural Sciences, Sabanci University, Turkiye(土耳其萨班奇大学工程与自然科学学院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 本文提出查询通道框架,将掩码后解释建模为通信过程,推导解释率与识别容量之间的信息论极限,并证明稀疏最大似然解码器可实现可靠恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08610 2026-06-12 cs.GT cs.AI cs.CY 版本更新 57%

Competition and Diversity in Generative AI

生成式人工智能中的竞争与多样性

Manish Raghavan

机构 * MIT Sloan School of Management & Department of Electrical Engineering and Computer Science(麻省理工学院斯隆管理学院及电气工程与计算机科学系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 通过博弈论模型和Scattergories游戏实验,研究竞争如何促使生成式AI模型多样化,缓解同质化,并提升社会福利。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29588 2026-06-11 cs.CV cs.AI q-bio.NC 版本更新 57%

Brain-IT-VQA: From Brain Signals to Answers

Brain-IT-VQA: 从脑信号到答案

Roman Beliy, Matias Cosarinsky, Oliver Heinimann, Navve Wasserman, Michal Irani

机构 * Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出 Brain-IT-VQA 框架,基于 fMRI 脑信号解码语言令牌并结合语言模型进行视觉问答,在 NSD-VQA 新基准上显著优于先前方法,并用于分析脑区对视觉信息的贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07415 2026-06-10 cs.CV cs.CL 版本更新 57%

ChartREG++: Towards Benchmarking and Improving Chart Referring Expression Grounding under Diverse referring clues and Multi-Target Referring

ChartREG++:面向多样化指代线索和多目标指代的图表指代表达式定位基准与改进

Tianhao Niu, Ziyu Han, Xuan Dong, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究中心)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 针对现有图表指代表达式定位基准的局限,提出支持多种定位形式、多目标指代、多样化线索和图表类型的基准,并利用代码驱动合成流水线生成像素级实例掩码,训练实例分割模型集成到多模态定位框架,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18026 2026-06-10 cs.CL 版本更新 57%

CommonLID: Re-evaluating State-of-the-Art Language Identification Performance on Web Data

CommonLID:重新评估网络数据上最先进的语言识别性能

Pedro Ortiz Suarez, Laurie Burchell, Catherine Arnett, Rafael Mosquera-Gómez, Sara Hincapie-Monsalve, Thom Vaughan, Damian Stewart, Malte Ostendorff, Idris Abdulmumin, Vukosi Marivate, Shamsuddeen Hassan Muhammad, Atnafu Lambebo Tonja, Hend Al-Khalifa, Nadia Ghezaiel Hammouda, Verrah Otiende, Tack Hwa Wong, Jakhongir Saydaliev, Melika Nobakhtian, Muhammad Ravi Shulthan Habibi, Chalamalasetti Kranti, Carol Muchemi, Khang Nguyen, Faisal Muhammad Adam, Luis Frentzen Salim, Reem Alqifari, Cynthia Amol, Joseph Marvin Imperial, Ilker Kesen, Ahmad Mustafid, Pavel Stepachev, Leshem Choshen, David Anugraha, Hamada Nayel, Seid Muhie Yimam, Vallerie Alexandra Putra, My Chiffon Nguyen, Azmine Toushik Wasi, Gouthami Vadithya, Rob van der Goot, Lanwenn ar C'horr, Karan Dua, Andrew Yates, Mithil Bangera, Yeshil Bangera, Hitesh Laxmichand Patel, Shu Okabe, Fenal Ashokbhai Ilasariya, Dmitry Gaynullin, Genta Indra Winata, Yiyuan Li, Juan Pablo Martínez, Amit Agarwal, Ikhlasul Akmal Hanif, Raia Abu Ahmad, Esther Adenuga, Filbert Aurelian Tjiaranata, Weerayut Buaphet, Michael Anugraha, Sowmya Vajjala, Benjamin Rice, Azril Hafizi Amirudin, Jesujoba O. Alabi, Srikant Panda, Yassine Toughrai, Bruhan Kyomuhendo, Daniel Ruffinelli, Akshata A, Manuel Goulão, Ej Zhou, Ingrid Gabriela Franco Ramirez, Cristina Aggazzotti, Konstantin Dobler, Jun Kevin, Quentin Pagès, Nicholas Andrews, Nuhu Ibrahim, Mattes Ruckdeschel, Amr Keleg, Mike Zhang, Casper Muziri, Saron Samuel, Sotaro Takeshita, Kun Kerdthaisong, Luca Foppiano, Rasul Dent, Tommaso Green, Ahmad Mustapha Wali, Kamohelo Makaaka, Vicky Feliren, Inshirah Idris, Hande Celikkanat, Abdulhamid Abubakar, Jean Maillard, Benoît Sagot, Thibault Clérice, Kenton Murray, Sarah Luger

机构 * Common Crawl Foundation(Common Crawl基金会) EleutherAI Factored AI MLCommons

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 提出CommonLID基准,覆盖109种语言,通过人工标注评估8种主流LID模型,揭示现有评估高估了网络领域多语言识别准确率。

Comments 18 pages, 8 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16700 2026-06-10 cs.SE cs.AI cs.ET cs.HC 版本更新 57%

Adoption of Generative Artificial Intelligence in the German Software Engineering Industry: An Empirical Study

生成式人工智能在德国软件工程行业的采用:一项实证研究

Ludwig Felder, Tobias Eisenreich, Mahsa Fischer, Stefan Wagner, Chunyang Chen

机构 * Technical University of Munich(慕尼黑技术大学) Heilbronn University of Applied Science(海德堡应用科学大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 通过混合方法研究德国软件工程师采用生成式AI工具的情况,发现经验水平调节感知收益,组织规模影响工具选择和使用强度,项目上下文意识不足是主要障碍。

Comments Accepted at FSE '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11502 2026-06-09 cs.CL 版本更新 57%

Robust Biomedical Publication Type and Study Design Classification with Knowledge-Guided Perturbations

基于知识引导扰动的鲁棒生物医学出版物类型与研究设计分类

Shufan Ming, Joe D. Menke, Neil R. Smalheiser, Halil Kilicoglu

机构 * School of Information Sciences(信息科学学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Department of Psychiatry(精神病学系) University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出基于受控语义扰动的评估框架,通过实体遮蔽和领域对抗训练提升生物医学出版物类型分类的鲁棒性,发现通过抑制非任务定义特征可缓解鲁棒性与领域准确性之间的权衡。

Comments Accepted by IEEE ICHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19662 2026-06-09 cs.AI cs.CV 版本更新 57%

FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks

FieldWorkArena:面向真实作业任务的代理AI基准测试

Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang

机构 * Fujitsu Limited(富士通株式会社) Fujitsu Research of America(富士通美国研究部) Carnegie Mellon University(卡内基梅隆大学) Master’s Student, The University of Tokyo(东京大学硕士研究生) Agent Research Collective(代理研究集体)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。

Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10628 2026-06-09 cs.SD cs.CL cs.IR 版本更新 57%

BMdataset: A Musicologically Curated LilyPond Dataset

BMdataset:一个音乐学精心编纂的LilyPond数据集

Matteo Spanio, Ilay Guler, Antonio Rodà

机构 * Department of Information Engineering , University of Padua(信息工程系,帕多瓦大学) Boston University(波士顿大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 本文提出BMdataset,包含393个LilyPond乐谱,用于音乐理解研究,并引入LilyBERT模型,证明小规模专家编纂数据集在音乐识别任务中优于大规模噪声数据集。

Comments Submitted to SMC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05026 2026-06-09 cs.SE cs.LG cs.MA 版本更新 57%

RepoLaunch: Automating Build and Management of Code Repositories across Languages and Platforms

RepoLaunch:跨语言和平台的代码仓库构建与管理自动化

Kenan Li, Rongzhi Li, Linghao Zhang, Qirui Jin, Liao Zhu, Xiaosong Huang, Geng Zhang, Yikai Zhang, Shilin He, Chengxing Xie, Xin Zhang, Zijian Jin, Bowen Li, Chaoyun Zhang, Yu Kang, Yufan Huang, Elsie Nallipogu, Saravan Rajmohan, Qingwei Lin, Dongmei Zhang

机构 * Microsoft(微软)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 RepoLaunch通过自动化依赖解析、编译和测试结果提取,提升了多语言多平台代码仓库的构建效率,其构建成功率达78%,并展示了全自动SWE数据集创建流程。

Comments Under peer review. 22 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11238 2026-06-09 cs.CL 版本更新 57%

SurveyLens: A Discipline-Aware Benchmark for Automatic Survey Generation

SurveyLens:一个学科感知的自动综述生成基准

Beichen Guo, Zhiyuan Wen, Jia Gu, Haochen Shi, Jian Wang, Senzhang Wang, Haoyang Li, Ruosong Yang, Shuaiqi Liu

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学) Central South University(中南大学) Alibaba Cloud(阿里巴巴云)

专题命中 评测与基准 :LLM(abstract_cn);分类 cs.CL

AI总结 提出SurveyLens,首个学科感知的自动综述生成基准,包含跨10个学科的1000篇人工撰写综述数据集和双视角评估框架,发现深度研究智能体在跨学科鲁棒性上最优,而所有范式在参考文献质量上仍薄弱。

Comments 8 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏