arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-16 至 2026-06-16 共收录 644 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 163 篇

2606.15074 2026-06-16 cs.LG 新提交 70%

TriAdReview: Triangular Adversarial Review Architecture for Multi-Model Technical Document Generation

TriAdReview: 用于多模型技术文档生成的三角对抗审查架构

Zhiqiang Zhou, Junliang Dai, Xu Ling

机构 * Hunan Chemical Industry Vocational and Technical College(湖南化工职业技术学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出TriAdReview三角对抗审查架构,使用两个独立审查模型和三角判断机制迭代改进生成器输出,在五个基准任务上相比单模型基线提升10.1%,但发现对抗审查在完整性任务上存在结构偏差。

Comments 12 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09163 2026-06-16 cs.AI 版本更新 70%

FORTIS: Benchmarking Over-Privilege in Agent Skills

FORTIS:评估代理技能中的过度特权

Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt, Xiyang Hu, Philip Yu, Chaowei Xiao, Huan Zhang, Yue Zhao

机构 * University of Southern California(南加州大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Adobe Research(Adobe研究) Arizona State University(亚利桑那州立大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,当前代理技能层普遍存在过度特权问题,模型在选择和执行技能时常超出任务需求,导致性能不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18827 2026-06-16 q-bio.NC cs.AI 版本更新 70%

OmniMouse: Scaling properties of multi-modal, multi-task Brain Models on 150B Neural Tokens

OmniMouse: 基于1500亿神经令牌的多模态多任务脑模型的可扩展性

Konstantin F. Willeke, Polina Turishcheva, Alex Gilbert, Goirik Chakrabarty, Hasan A. Bedel, Paul G. Fahey, Yongrong Qiu, Marissa A. Weis, Michaela Vystrčilová, Taliah Muhammad, Lydia Ntanavara, Rachel E. Froebe, Kayla Ponder, Zheng Huan Tan, Emin Orhan, Erick Cobos, Sophia Sanborn, Katrin Franke, Fabian H. Sinz, Alexander S. Ecker, Andreas S. Tolias

机构 * Department of Ophthalmology, Byers Eye Institute, Stanford University(斯坦福大学眼科学系、比尔斯眼科研究所) Stanford Bio-X, Stanford University(斯坦福大学生物交叉学科) Wu Tsai Neurosciences Institute, Stanford University(斯坦福大学吴泰教授神经科学研究所) Institute of Computer Science and Campus Institute Data Science, University Göttingen(哥廷根大学计算机科学研究所和校园数据科学研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 利用小鼠视觉皮层31亿神经元数据,训练多模态多任务模型OmniMouse,在神经预测、行为解码等任务上达到最优,发现性能随数据量可靠提升但模型规模收益饱和,与AI领域标准扩展规律相反。

Comments Published at ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11364 2026-06-16 cs.AI 版本更新 70%

The Missing Knowledge Layer in Cognitive Architectures for AI Agents

AI智能体认知架构中缺失的知识层

Michaël Roynard

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有AI智能体认知架构(如CoALA和JEPA)缺乏独立知识层的问题,提出四层分解架构(知识、记忆、智慧、智能),各层具有不同的持久性语义,并通过Python和Rust实现验证了架构分离的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07539 2026-06-16 cs.CL 版本更新 70%

MAWARITH: A Dataset and Benchmark for Legal Inheritance Reasoning with LLMs

MAWARITH:面向大语言模型的法律继承推理数据集与基准

Abdessalam Bouchekif, Shahd Gaben, Samer Rashwani, Somaya Eltanbouly, Mutaz Al-Khatib, Heba Sbahi, Mohammed Ghaly, Emad Mohamed

机构 * Hamad Bin Khalifa University, Qatar(卡塔尔哈马德比内卡菲大学) Nazarbayev University, Kazakhstan(哈萨克斯坦纳扎尔巴耶夫大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MAWARITH数据集,包含12,500个阿拉伯语继承案例,支持端到端的伊斯兰继承推理,并设计MIR-E多阶段评估指标,实验显示商业模型达90%而开源模型低于50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18355 2026-06-16 cs.CL cs.HC cs.IR 70%

KrishokBondhu: A Retrieval-Augmented Voice-Based Agricultural Advisory Call Center for Bengali Farmers

KrishokBondhu:一种基于检索增强的语音农业咨询呼叫中心,面向孟加拉语农民

Mohd Ruhul Ameen, Akif Islam, Farjana Aktar, M. Saifuzzaman Rafat

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出KrishokBondhu,一种基于检索增强生成框架的语音农业咨询平台,通过OCR处理农业手册等资料,结合大语言模型生成回答,实现孟加拉语农民的实时农业指导。

Comments Accepted at the 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence and Networking (QPAIN 2026)

Journal ref 2026 IEEE 2nd International Conference on Quantum Photonics, Artificial Intelligence & Networking (QPAIN)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17990 2026-06-16 cs.AI 版本更新 70%

WorkflowPerturb: Calibrated Stress Tests for Evaluating Multi-Agent Workflow Metrics

WorkflowPerturb:用于评估多智能体工作流度量的校准压力测试

Madhav Kanda, Sharad Agarwal, Rodrigo Fonseca, Alok Gautam Kumbhare, Pedro Las-Casas

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出WorkflowPerturb基准,通过对黄金工作流施加分级扰动来评估多智能体工作流度量,揭示度量分数校准不良问题,支持变更管理中的严重性感知解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13725 2026-06-16 cs.CR cs.AI 版本更新 70%

Can We Stop Malicious AI? KILLBENCH: A Benchmark for External AI Kill Switch Feasibility

我们能阻止恶意AI吗?KILLBENCH:外部AI终止开关可行性基准

Sechan Lee, Hyounghun Kim, Sangdon Park

机构 * Graduate School of Artificial Intelligence, POSTECH(POSTECH人工智能研究生院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出Killbench基准,通过外部信号(如输入文本)评估终止恶意AI代理行为的方法,无需访问内部参数,实验表明在多种模型上外部终止开关具有可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00176 2026-06-16 cs.CV cs.AI 70%

Waste-Bench: A Comprehensive Benchmark for Evaluating VLLMs in Cluttered Environments

Waste-Bench: 一个用于评估在杂乱环境中视觉大型语言模型性能的综合基准

Muhammad Ali, Salman Khan

机构 * Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Waste-Bench基准,用于评估VLLMs在复杂环境中的鲁棒性和准确性,揭示了提升VLLM在复杂环境性能的必要性。

Journal ref Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025), pp. 31019-31032, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16871 2026-06-16 cs.MA 新提交 67%

Human-on-the-Bridge: Scalable Evaluation for AI Agents

Human-on-the-Bridge: 可扩展的AI智能体评估方法

Fouad Bousetouane

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出Human-on-the-Bridge (HOB)范式,通过专家预先策划可复用的评估智能体(包括领域上下文、红队陷阱、陪审员角色等),结合ProofAgent测试框架进行多轮对抗评估,实现可扩展的AI智能体行为评估。

Comments 33 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16420 2026-06-16 cs.CR 新提交 67%

Transferable Self-Evolving Playbooks for Agentic Security Auditing

可迁移的自演化剧本用于智能体安全审计

Ziyue Wang, Cheuk Wang Maurice Ng, Chenchen Yu, Strick Sheng, Kaihua Qin, Liyi Zhou

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出EvoHunt框架,通过审计、评估和修订三个智能体循环演化空剧本,自动生成安全审计程序知识,开源演化可超越商业产品,且演化后的剧本可迁移至弱智能体提升其能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16255 2026-06-16 cs.CV 新提交 67%

UniDDT: Unifying Multimodal Understanding and Generation with Decoupled Diffusion Transformer

UniDDT: 使用解耦扩散变换器统一多模态理解与生成

Shuai Wang, Liang Li, Yang Chen, Ruopeng Gao, Yao Teng, Limin Wang

机构 * Nanjing University(南京大学) ByteDance Seed(字节跳动Seed) University of Hong Kong(香港大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出UniDDT模型,通过噪声ViT编码器统一视觉语义表示,并采用解耦扩散解码器分离扩散与文本解码,平衡多模态理解与生成任务,在多个基准上取得优异性能。

Comments This work was completed in \textbf{November 2025}

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16198 2026-06-16 cs.CV 新提交 67%

GRACE: Boosting Video MLLMs with Grounded Action-Centric Evidence for Viewer Sentiment Prediction

GRACE: 基于接地动作中心证据增强视频多模态大语言模型用于观众情感预测

Ruoxuan Yang, Tieyuan Chen, Xiaofeng Huang, Haibing Yin, Jun Wang, Xiping Chen, Jun Yin, Xuesong Gao, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Hangzhou Dianzi University(杭州电子科技大学) The 52nd Research Institute of China Electronics Technology Group Corporation(中国电子科技集团公司第五十二研究所) Hangzhou Bywin Technology Co., Ltd.(杭州百威科技有限公司) Zhejiang Dahua Technology Co., Ltd.(浙江大华技术股份有限公司) School of Information Science and Engineering, Shandong University(山东大学信息科学与工程学院) Haihe Laboratory of Information Technology Application Innovation(海河信息技术应用创新实验室)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出GRACE框架,通过提取时间有序的主谓宾三元组和视觉实体裁剪,增强视频MLLM对细粒度情感线索的提取与推理,在Pitts数据集上提升Qwen2.5-VL和Qwen3-VL性能。

Comments 13 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15320 2026-06-16 cs.CV 新提交 67%

Conditional Multi-Event Temporal Grounding in Long-Form Video

长视频中的条件多事件时间定位

Yuanhao Zou, Arthad Kulkarni, Lucas Tonanez, Lincoln Spencer, Guangyu Sun, Tianxingjian Ding, Andong Deng, Yi Li, Shuangjun Liu, Yuan Li, Dashan Gao, Ning Bi, Taotao Jing, Shuai Zhang, Chen Chen

机构 * University of Central Florida(中佛罗里达大学) Qualcomm AI Research(高通人工智能研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15139 2026-06-16 cs.GT cs.RO 新提交 67%

Self-Driving Negotiator: An interactive, verifiable benchmark for social negotiation and theory of mind under hidden intent

自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准

Ashutosh Kumar

机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03788 2026-06-16 cs.CV 版本更新 67%

SLU-2K: A Question-Based Benchmark for Semantic Evaluation of Sign Language Translation

SLU-2K:基于问题的手语翻译语义评估基准

Zeno Testa, Antonino Furnari, Lorenzo Baraldi, Natalia Díaz-Rodríguez

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Catania(卡塔尼亚大学) University of Granada(格拉纳达大学) CITIC & DaSCI Institute(CITIC与DaSCI研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出SLU-2K基准,通过2350个视频问答对评估手语翻译的语义理解,揭示当前系统在语义正确性上的不足。

Comments Accepted at the GenSign Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01900 2026-06-16 cs.CV 版本更新 67%

Auteur: Language-Driven Cinematographic Framing for Human-Centric Video Generation

Auteur: 以语言驱动的电影化取景实现以人为中心的视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Xuelin Chen, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科克大学) University College London(伦敦大学学院) Adobe(Adobe公司) Hacettepe University(哈切特佩大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出Auteur方法,通过将相机运动参数化为以人为中心的取景(包括镜头尺寸、角度和构图),并利用领域特定语言(DSL)和微调的多模态大语言模型,实现语言驱动的电影化取景,在人类中心视频生成中优于现有方法。

Comments Project Page: https://cyberiada.github.io/Auteur/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16211 2026-06-16 cs.SD 版本更新 67%

NVV-SuperBench: Beyond Words, Beyond Quality-Benchmarking Nonverbal Vocalizations in Speech Generation

NVV-SuperBench:超越语言,超越质量——语音生成中非语言发声的基准测试

Liumeng Xue, Weizhen Bian, Jiahao Pan, Wenxuan Wu, Yilin Ren, Boyi Kang, Jingbin Hu, Ziyang Ma, Shuai Wang, Xinyuan Qian, Hung-yi Lee, Yike Guo

机构 * Nanjing University(南京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology Beijing(北京科技大学) Northwestern Polytechnical University(西北工业大学) Shanghai Jiao Tong University(上海交通大学) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 提出NVV-SuperBench基准,包含45类非语言发声的统一分类和多轴评估协议,用于测试语音生成系统在非语言发声控制、放置和感知显著性方面的能力,发现当前系统在低信噪比口部线索和长时情感发声方面存在瓶颈。

Comments Accepted as a long paper at INTERSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12813 2026-06-16 cs.CV cs.MM 版本更新 67%

DPC-VQA: Decoupling Quality Perception and Residual Calibration for Video Quality Assessment

DPC-VQA: 解耦质量感知与残差校准用于视频质量评估

Xinyue Li, Shubo Xu, Zhichao Zhang, Zhaolin Cai, Yitong Chen, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Baidu Inc.(百度公司) Xinjiang University(新疆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 提出DPC-VQA框架,通过冻结多模态大模型提供感知先验,轻量校准分支预测残差修正,实现低训练成本下视频质量评估,在UGC和AIGC基准上取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17334 2026-06-16 cs.SE 67%

Bridging Natural Language and Formal Specification--Automated Translation of Software Requirements to LTL via Hierarchical Semantics Decomposition Using LLMs

连接自然语言与形式规范——通过层次语义分解利用LLMs将软件需求转换为LTL

Zhi Ma, Cheng Wen, Zhexin Su, Xiao Liang, Cong Tian, Shengchao Qin, Mengfei Yang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文提出Req2LTL框架,通过层次中间表示OnionL将自然语言需求转换为LTL,实现88.4%的语义准确性和100%的语法正确性。

Journal ref 2025 40th IEEE/ACM International Conference on Automated Software Engineering (ASE), pp. 1208-1220, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17006 2026-06-16 cs.SD cs.AI cs.LG cs.MM eess.AS 新提交 62%

TuneJury: An Open Metric for Improving Music Generation Preference Alignment

TuneJury: 一种改进音乐生成偏好对齐的开放指标

Yonghyun Kim, Junwon Lee, Haiwen Xia, Yinghao Ma, Junghyun Koo, Koichi Saito, Yuki Mitsufuji, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony AI(索尼AI) Georgia Tech(佐治亚理工学院) KAIST(韩国科学技术院) Peking University(北京大学) QMUL(伦敦玛丽女王大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出TuneJury,一个开放、实例级别的成对奖励模型,用于文本到音乐生成,通过预测偏好分数支持数据筛选、后处理校准,并在推理、优化和训练中提升对齐效果。

Comments 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28734 2026-06-16 cs.CR cs.CL cs.LG 版本更新 62%

Code as a Weapon: A Consensus-Labeled Prompt Bank for Measuring Coding-Model Compliance with Malicious-Code Requests

代码即武器:用于衡量编码模型对恶意代码请求遵从性的共识标记提示库

Richard J. Young, Gregory D. Moody

机构 * University of Nevada Las Vegas(内华达大学拉斯维加斯分校) Department of Information Systems(信息系统系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过构建一个经五名评审共识标记的提示库(包含4,748个可执行恶意代码请求和1,923个有害安全知识请求),为编码模型对恶意代码请求的拒绝行为提供了可靠且可跨语料库比较的测量基准。

Comments 23 pages, 9 figures, 6 tables. Consensus-labeled prompt bank consolidating eight malicious-code corpora (ASTRA, CySecBench, AdvBench/harmful_behaviors, JailbreakBench, MalwareBench, RedCode, RMCBench, Scam2Prompt) spanning diverse elicitation paradigms; 6,675 prompts, 33,375 classification calls

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00924 2026-06-16 cs.LG cs.AI 版本更新 62%

StyleShield: Exposing the Fragility of AIGC Detectors through Continuous Controllable Style Transfer

StyleShield: 通过连续可控风格迁移揭示AIGC检测器的脆弱性

Guantian Zheng

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出StyleShield,一种基于流匹配的条件文本风格迁移框架,通过连续控制风格迁移强度,在保持语义相似度的同时实现高规避率,并引入RateAudit算法质疑基于分数的检测可靠性。

Comments 12 pages, 5 figures. Code and model weights will be released upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07343 2026-06-16 cs.CV cs.AI cs.LG cs.RO 版本更新 62%

Seeing Roads Through Words: A Language-Guided Framework for RGB-T Driving Scene Segmentation

通过文字看道路:一种语言引导的RGB-T驾驶场景分割框架

Ruturaj Reddy, Hrishav Bakul Barua, Junn Yong Loo, Thanh Thi Nguyen, Ganesh Krishnasamy

机构 * National University of Singapore(新加坡国立大学) University of Technology Sydney(悉尼科技大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出CLARITY框架,利用视觉语言模型先验动态调整RGB-T融合策略,并引入暗目标语义保留和层次化解码器,在MFNet数据集上达到62.3% mIoU和77.5% mAcc的新SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11687 2026-06-16 cs.LG cs.AI cs.NE 版本更新 62%

Learning in the Recurrent State: Gradient Descent with Linear Recurrent Networks

循环状态中的学习:线性循环网络的梯度下降

Yudou Tian, Neeraj Mohan Sushma, Harshvardhan Mestha, Nicolo Colombo, David Kappel, Anand Subramoney

机构 * Center for Cognitive Interaction Technology CITEC, Universität Bielefeld, Germany(认知交互技术中心CITEC,比勒菲尔德大学,德国) Department of Electrical and Electronics Engineering, Birla Institute of Technology and Science Pilani, India(电子与电子工程系,比拉理工科学与技术学院比兰,印度) Department of Computer Science, Royal Holloway, University of London, United Kingdom(计算机科学系,伦敦皇家霍洛威大学,英国)

专题命中 评测与基准 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种线性循环网络架构GRIL,通过乘法读出和滑动窗口交叉积自注意力更新,使其能在单次前向传播中实现任务特定线性预测器的小批量梯度下降,并在长程竞技场和语言建模中取得有效性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16826 2026-06-16 cs.RO cs.AI 新提交 57%

ATOM-Bench: A Real-World Benchmark for Atomic Skills and Compositional Generalization in Manipulation Policies

ATOM-Bench:用于操作策略中原子技能与组合泛化的真实世界基准

Zenan Wu, Bingqing Wei, Lu Liu, Zheqi He, Xi Wang, Jiakang Liu, Zehui Li, Guocai Yao, Jing-Shu Zheng, Xi Yang, Yongtao Wang

机构 * Beijing Academy of Artificial Intelligence(北京人工智能研究院) Peking University(北京大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI

AI总结 提出ATOM-Bench基准,通过分解桌面操作为原子任务和组合任务,评估操作策略的原子技能获取与组合泛化能力,发现当前策略在细粒度原子技能和组合重用上存在不足。

Comments Homepage: https://flageval-baai.github.io/AtomBenchPage

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16799 2026-06-16 cs.CV cs.AI 新提交 57%

Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment

解耦语义与失真:面向AI生成图像质量评估的多尺度双流视觉-语言对齐

Zijie Meng

机构 * Zijie Meng(孟子杰)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出MST-CLIPIQA多尺度双流框架,通过显式表示解耦实现层次化视觉-语言对齐,在五个基准上取得质量SRCC平均提升1.11%、图文对应SRCC提升2.35%的新SOTA结果。

Comments 11 pages, 2 figures Accepted by ICME2026(spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16602 2026-06-16 cs.LG cs.NA math.NA physics.comp-ph 新提交 57%

PhysGuard: Fisher-Guided Gradient Projection for Sim-to-Real Neural PDE Surrogates

PhysGuard: 面向仿真到现实神经PDE代理的Fisher引导梯度投影

Changjian Zhou, Junfeng Fang, Negin Yousefpour, Peng Wu, Bin Yan, Guillermo A Narsilio

机构 * Faculty of Engineering and IT, University of Melbourne(墨尔本大学工程与信息技术学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) Artificial Intelligence Research Institute, IFLYTEK Co., Ltd.(科大讯飞股份有限公司人工智能研究院)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 针对神经算子模型从仿真到现实迁移时的精度下降问题,提出PhysGuard框架,利用仿真数据的Fisher信息矩阵保护物理关键参数,限制微调更新方向,在严重域偏移下将低频误差降低32%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16082 2026-06-16 cs.CV cs.AI 新提交 57%

Tool-IQA: Augmenting Image Quality Assessment with Simple Tools

Tool-IQA: 利用简单工具增强图像质量评估

Guanyi Qin, Junjie Zhang, Chunming He, Yibing Fu, Jie Liang, Tianhe Wu, Lei Zhang

机构 * National University of Singapore(新加坡国立大学) OPPO Research Institute(OPPO研究院) Nanyang Technical University(南洋理工大学) Duke University(杜克大学) City University of Hong Kong(香港城市大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 提出Tool-IQA,通过为视觉语言模型配备放大镜和伽马校正器等简单工具,将被动评分转变为工具增强的工作流程,显著提升图像质量评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03297 2026-06-16 cs.SD cs.LG 版本更新 57%

Contrastive Regularization for Accent-Robust ASR

对比正则化用于口音鲁棒的ASR

Van-Phat Thai, Aradhya Dhruv, Duc-Thinh Pham, Sameer Alam

机构 * Air Traffic Management Research Institute, Nanyang Technological University, Singapore(新加坡南洋理工大学航空交通管理研究所) Center of AI Research, VinUniversity, Vietnam(越南Vin大学人工智能研究中心)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 提出使用监督对比学习作为轻量级口音不变辅助目标,在CTC微调中正则化编码器表示,无需架构修改或显式口音监督,在L2-ARCTIC基准上实现高达25-29%的未见口音词错误率降低。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏