arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2780 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2780 篇

2607.11560 2026-07-14 cs.CV cs.AI 新提交 57%

Technical Report on the CVPR 2026@AdvML Workshop Challenge

关于CVPR 2026@AdvML研讨会挑战赛的技术报告

Tianyuan Zhang, Zonglei Jing, Jiangfan Liu, Ligong Zhang, Ke Ma, Chengzhi Sun, Xiaohai Xu, Zhirui Zhang, Qianqian Xu, Qingming Huang, Hanyu Fang, Junhua Liu, Zheng Wang, Xiaoliang Liu, Yuanbo Li, Shuai Gui, Bin Wang, Menghe Zheng, Jing Nie, Hanyang Meng, Zeyang Zhang, Xiang Zhang, Yongxuan Zhu, Rui Ding, Hainan Li, Yongkang Zhang, Zhilei Zhu, Xianglong Kong, Jin Hu, Zonghao Ying, Yisong Xiao, Lei Chen, Haotong Qin, Jiakai Wang, Aishan Liu, Ruikai Li, Julia Karbing, Yinpeng Dong, Zhenfei Yin, Shao Jing, Xia Hu, Jingyi Xu, Juntao Dai, Xinyun Chen, Vishal M. Patel, Xianglong Liu, Dawn Song, Alan Yuille, Philip H. S. Torr, Dacheng Tao

机构 * Beihang University(北京航空航天大学) University of Chinese Academy of Sciences(中国科学院大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Tongji University(同济大学) iFLYTEK Co., Ltd.(科大讯飞股份有限公司) Anhui Laboratory for Safe Artificial Intelligence in the Yangtze River Delta(长三角安全人工智能安徽实验室) Wenzhou Business College(温州商学院) Jiangnan University(江南大学) Guangzhou City University of Technology(广州理工学院) Inceptio Technology(智元机器) Institute of Dataspace(数据空间研究所) Zhongguancun Laboratory(中关村实验室) Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) BAAI(北京智源人工智能研究院) Meta Johns Hopkins University(约翰·霍普金斯大学) University of California, Berkeley(加州大学伯克利分校) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :language agent(abstract);分类 cs.AI

AI总结 介绍CVPR 2026@AdvML研讨会针对自动驾驶VLAs的对抗性多模态攻击挑战赛,基于多视图视觉问答,参赛者要生成对抗图像和文本扰动。阐述任务设计等,研究领先提交作品发现后缀惩罚等模式,为多模态自动驾驶系统相关工作提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11486 2026-07-14 cs.CL 新提交 57%

Communicating Chess Strategies in Natural Language

用自然语言传达国际象棋策略

Langyuan Cui, Chun Kai Ling, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 针对人类难以理解国际象棋引擎走法背后策略的问题,提出策略语言化任务,设计了策略语言化流程与评估框架,实验表明自然语言可有效传达策略信息,还得出了关于评估、描述及评估方式的一些见解。

Comments 21 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11342 2026-07-14 cs.SE cs.AI 新提交 57%

Fail-Aware and Explainable Test Oracle Prediction

故障感知与可解释的测试预言机预测

Yue Zhao, Binish Tanveer, Jelena Zdravkovic

机构 * Department of Computer and Systems Sciences(计算机与系统科学系)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对测试预言机构建难题,提出基于代码语言模型的FOCAL方法预测测试前缀成败,通过学习带标签数据、强调失败案例损失及基于行为证据预测,相比基线方法提升了未见过项目失败案例性能并提供更丰富解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11279 2026-07-14 cs.CL 新提交 57%

FAD-SA-GRU: Enhancing Hate Speech Detection in Algerian Dialect Through Feature-Augmented Self-Attention GRU Networks

FAD-SA-GRU:通过特征增强自注意力GRU网络增强阿尔及利亚方言中的仇恨言论检测

Sara Yakoubi, Ikram Khalfallah, Kenza Khelkhal, Dihia Lanasri

机构 * USTHB(阿尔及尔科学技术大学) ATM Mobilis Algiers(阿尔及尔移动ATM公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究阿尔及利亚方言社交媒体上的仇恨言论检测,提出FAD-SA-GRU混合架构,通过多嵌入融合结合多种语义表示,经自注意力增强GRU编码器检测。实验表明该方法在多指标上优于基线,有效提升低资源方言仇恨言论检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10972 2026-07-14 cs.AI 新提交 57%

From Checker to Forecaster: Code-Owned Evaluation of Model-Generated Strategic Routes Under Delayed Ground Truth

从检查器到预测器:在延迟的地面真值下对模型生成的战略路线进行代码拥有的评估

Aleh Manchuliantsau

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究在地面真值延迟等情况下对模型生成战略路线的评估,提出RouteCast机制,通过模型提出候选路线等产生临时预测排名,后续结果评估预测,在回顾性试点中显示出一定区分能力,建立了可行性结果并揭示失败模式。

Comments 11 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10787 2026-07-14 cs.CV cs.CL 新提交 57%

Detecting AI-Generated Video: A Vision-Language Dual-View Survey

检测人工智能生成的视频:视觉-语言双视角综述

Dylan Xinming Hou, Juntian Zhang, Xu Gu, Yichen Wu, Nils Lukas, Gus Xia, Xiuying Chen, Yuhan Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院) Harvard University(哈佛大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 综述人工智能生成视频检测,将任务重定义为事实保真度验证,提出视觉-语言双视角分类法,基于对221篇论文回顾,综合生成范式、审视检测方法、回顾评估指标,讨论挑战并指出未来方向。

Comments 51 pages, accepted by ACL 2026

Journal ref Association for Computational Linguistics 2026 pages 32221 to 32255

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10380 2026-07-14 cs.CL 新提交 57%

CAFE: A Compound-AI Factorial Evaluation Framework

CAFE:一种复合人工智能因子评估框架

Fabian Lukassen, Christoph Weisser, Thomas Kneib, Alexander Silbersdorff

机构 * University of Göttingen(哥廷根大学) Bielefeld University of Applied Sciences and Arts (HSBI)(比勒费尔德应用科学与艺术大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 CAFE是开源平台,用于复合人工智能系统评估。它将管道组件设为因子构建析因设计,运行配置并用模型评判器和人工评分。能归因质量差异,报告多种结果,还能解释组件影响,在问答管道验证有效,已发布为Python包和Web应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10301 2026-07-14 cs.CV cs.CL 新提交 57%

ChartSync: A Benchmark for Visuo-Logical Cascading Chart Editing

ChartSync:视觉逻辑级联图表编辑的基准测试

Jiakang Yu, Yixuan Chai, Tianci Wang, Rihui Jin, Guangkai Xu, Hongtao Deng, Xun Zhu, Wang Gao, Xinrun Guo, Haipang Wu

机构 * Jianghan University(江汉大学) HiThink Research(海思睿研) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 研究针对生成式图像编辑模型处理结构化统计图的困难,提出视觉逻辑级联编辑任务。引入ChartSync基准测试,含多种图表类别和任务类型。通过两层框架评估模型,发现开源与专有模型能力差距,分析误差以指导多模态架构发展,数据集和代码已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09908 2026-07-14 cs.CL cs.IR 新提交 57%

RouteRec: Strict Evaluation of Recommender-Agent Selection and Aggregation

RouteRec:推荐代理选择与聚合的严格评估

Kaiji Zhou, Vladimir Kalmykov, Yue Feng

机构 * University of Birmingham(伯明翰大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL

AI总结 研究在推荐系统异构代理选择中,RouteRec框架在成本约束下比较请求级硬选与项目级学习聚合,发现在MovieLens-1M数据集上,请求级选择粗糙,项目级聚合更有前景,不同聚合方式有不同效果。

Comments 8 pages, 7 figures. Accepted at AgentSearch 2026 (The First Workshop on Indexing, Retrieval, and Ranking of AI Agents), co-located with SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09762 2026-07-14 cs.AI cs.DB 新提交 57%

BatteryLake: Agentic, Physics-Grounded Curation of Heterogeneous Battery Aging Data and Benchmarking

BatteryLake:基于物理原理的异构电池老化数据智能管理与基准测试

Tianwen Zhu, Hao Wang, Yonggang Wen

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 针对公共电池老化数据集应用受限问题,BatteryLake通过大语言模型智能体、人在回路机制等,将原始数据转化为可用于基准测试的资产,还发布了含多种任务和协议的开放基准测试。

Comments The platform, benchmark, and curation protocol are publicly available at https://tianwen1209.github.io/batterylake/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09230 2026-07-13 q-fin.TR cs.LG 新提交 57%

When Does Order Flow Matter? State-Dependent L2 Liquidity-State Transitions in Crypto Futures

订单流何时重要?加密期货中依赖状态的 L2 流动性状态转换

Joohyoung Jeon

机构 * Korea University(韩国大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 研究 2023 年至 2026 年币安加密期货,定义离散 L2 流动性状态转换任务,用事件聚类验证等评估模型。发现事件前 L2 流动性状态是重要预测信号,订单流在 L2 状态模型上分层才有价值,且不同符号表现不同,提出状态优先设计原则及评估协议。

Comments 8 pages, 2 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09456 2026-07-13 cs.LG 新提交 57%

Active rejection enables reliable generalization of universal machine-learning interatomic potentials

主动拒绝可实现通用机器学习原子间势的可靠泛化

Mingxiang Luo, Xinnan Mao, Lu Wang, Lei Bai, Feng Ding, Yuqiang Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Suzhou Laboratory(苏州实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 研究针对通用机器学习原子间势训练数据集受限问题,提出自适应多教师路由方法,通过校准预训练教师、估计结构-教师对可靠性来生成伪标签,提升模型性能和动力学鲁棒性,有效构建高保真uMLIPs数据系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09114 2026-07-13 cs.CV cs.AI cs.MM 新提交 57%

Event Stream based Multi-Modal Video Anomaly Detection: A Benchmark Dataset and Algorithms

基于事件流的多模态视频异常检测:一个基准数据集和算法

Peipei Zhu, Yueqing Niu, Lin Zhu, Guanchong Niu, Yang Yu, Zheng Li

机构 * College of Pharmaceutical Engineering of Traditional Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学中药制药工程学院) School of Artificial Intelligence, Beijing Normal University(北京师范大学人工智能学院) Guangzhou Institute of Technology, Xidian University(西安电子科技大学广州研究院) State Key Laboratory of Component-based Chinese Medicine, Tianjin University of Traditional Chinese Medicine(天津中医药大学组分中药国家重点实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI

AI总结 该研究针对视频异常检测在复杂条件下的局限性,提出EVAD框架,利用事件相机与传统视频。构建大规模基准数据集,设计对比多模态预训练框架及自适应融合模块,实验验证了该方法在现实场景中检测VAD的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08489 2026-07-10 cs.CV cs.AI cs.HC 新提交 57%

VEGAS: Human-Aligned Video Caption Evaluation via Gaze

VEGAS:通过注视进行与人类对齐的视频字幕评估

Shenghui Chen, Po-han Li, Ximeng Sun, Shijia Yang, Emad Barsoum, Zicheng Liu, Sandeep Chinchali, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) AMD(超威半导体公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究针对视觉语言模型视频字幕忽视观众注意力问题,提出VEGAS无需训练的度量标准,利用注视采样个性化文本,通过拒绝采样选字幕,实验表明其能使字幕更好对齐人类焦点,提升下游检索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07762 2026-07-10 cs.LG math.OC 新提交 57%

Trustworthy Machine Learning through the Lens of Combinatorial Optimization: Survey and Research Perspectives

从组合优化视角看可信机器学习:综述与研究展望

Thibaut Vidal, Julien Ferry

机构 * CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematics and Industrial Engineering, Polytechnique Montreal(CIRRELT与数据驱动供应链的SCALE-AI主席、数学与工业工程系,蒙特利尔大学)

专题命中 评测与基准 :post-training(abstract);分类 cs.LG

AI总结 探讨如何从组合优化视角实现可信机器学习,回顾并综合其与组合优化交叉领域进展,涵盖训练及训练后多任务,指出组合优化公式比纯启发式方法更具优势,虽有挑战,但在可信机器学习系统设计和部署中作用将增大。

Comments 67 pages, 16 mathematical highlights

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07189 2026-07-09 cs.AI 新提交 57%

Does AI Understand Imaging? A Systematic Benchmark of Agentic AI for Computational Imaging Tasks

人工智能理解成像吗?计算成像任务中智能体人工智能的系统基准测试

Ethan Chung, Chuanjun Zheng, Jasper Tan, Jingxi Li, Haopeng Zhang, Huaijin Chen

机构 * University of Hawaii at Manoa(夏威夷大学马诺阿分校) Glass Imaging(玻璃成像公司)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究人工智能在计算成像任务中的表现,提出ImagingBench基准测试,涵盖五类20个任务及三种评估设置,对多模态系统测试发现智能体模型比专门方法弱,该基准可测差距与跟踪进展。

Comments 14 pages, 11 figures. Preprint / work in progress. Paper Webpage: https://cirp-lab.github.io/imagingbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06605 2026-07-09 cs.LG stat.ML 新提交 57%

A Quiet Failure in Calibrated Virtual Screening: Marginal Conformal Prediction Under-Covers the Minority Class, and a Class-Conditional Fix Recovers It

校准虚拟筛选中的一个隐性失败:边际共形预测对少数类覆盖不足,而类条件修复方法可恢复覆盖

Muhammadjon Tursunbadalov, Mustafojon Tursunbadalov

机构 * School of Science and Technology, Champions College Prep(科学与技术学院,冠军大学预科)

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究发现在不平衡数据集上标准共形预测对少数类覆盖不足,通过守恒恒等式解释该现象。提出类条件共形预测可恢复少数类覆盖率,定位失败原因并给出诊断方法,还通过成本模型表明弃权可改变筛选效用,制定恢复可靠性的实用方案。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04758 2026-07-09 cs.AI 新提交 57%

AgenticPD: A Stage-Aware Agentic Framework for Physical Design QoR Optimization

AgenticPD:用于物理设计QoR优化的阶段感知智能体框架

Shuo Ren, Zijin Cheng, Yaohui Han, Libo Shen, Leilei Jin, Wanting Tian, Rongliang Fu, Chao Wang, Bei Yu, Tsung-Yi Ho

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 针对物理设计QoR优化难题,现有方法欠佳。提出AgenticPD框架,围绕物理设计流程阶段边界组织,利用Judge Agent引导搜索,阶段专用智能体借助本地工具做决策,提升优化效果。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31126 2026-07-09 cs.LG q-bio.QM stat.ML 新提交 57%

Can Tabular In-Context Learners Generalize to Biomolecular Property Prediction?

表格上下文学习器能否泛化到生物分子性质预测?

Davy Guan, Lu Zhang, Asiri Wijesinghe, Allen Zhu, He Zhao, Helen Power, F. Hafna Ahmed, Andrew Warden, Cheng Soon Ong, Daniel M. Steinberg

机构 * CSIRO(澳大利亚联邦科学与工业研究组织)

专题命中 评测与基准 :foundation model(abstract);分类 cs.LG

AI总结 本文研究表格基础模型(如TabPFN3和TabICL)在生物分子性质预测中的泛化能力,发现其性能取决于所使用的序列或分子表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06074 2026-07-08 cs.SE cs.AI cs.CY cs.HC 新提交 57%

Prompt Coach: An Empirical Evaluation of an Agentic Tutor for Learning Prompt Engineering in Software Development

Prompt Coach:软件开发中用于学习提示工程的智能导师的实证评估

Rohit Mehra, Kapil Singi, Vikrant Kaulgud, Vibhu Saujanya Sharma, Swapnajeet Gon Choudhury, Swati Sharma, Adam P. Burden, Majd Sakr

机构 * Accenture Labs, India(Accenture实验室,印度) Accenture, India(Accenture,印度) Accenture, USA(Accenture,美国)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究针对软件开发人员难以掌握的提示工程技能,提出智能导师Prompt Coach,通过苏格拉底式指导助其学习编写高质量代码生成提示,经实证研究,15名专业开发者参与,单次课程后有显著改进,提升了提示编写技能。

Comments 7 pages. To be published in the proceedings of 41st International Conference on Automated Software Engineering (ASE '26), October 12-16, 2026, Munich, Germany (Industry Showcase Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05478 2026-07-08 cs.LG cs.PL 新提交 57%

InvWeaver: Deductive Feedback for Invariant Synthesis in Interacting-Loop Programs

InvWeaver:交互循环程序中不变式合成的演绎反馈

Guangyuan Wu, Weining Cao, Zehui Tan, Yuan Yao, Hengfeng Wei, Taolue Chen, Xiaoxing Ma

机构 * Nanjing University(南京大学) Hunan University(湖南大学) Birkbeck, University of London(伦敦大学伯贝克学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.LG

AI总结 研究针对交互循环程序的不变式合成难题,提出神经符号框架InvWeaver,通过循环级抽象等方法揭示循环间依赖并传播证明义务,在综合基准套件上评估,其性能显著优于现有方法,能有效解决多循环问题并保持单循环任务优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05411 2026-07-08 cs.CY cs.AI 新提交 57%

The GenAI Skill Bypass: Mapping Divergent Pathways of University Students and Staff AI Literacy

生成式人工智能技能绕过:绘制大学生和教职员工人工智能素养的不同路径

Eduardo Oliveira, Narelle English, Tracii Ryan, Kamila Misiejuk, Cory dal Ponte, Sonsoles López-Pernas, Mohammed Saqr

机构 * University of Melbourne(墨尔本大学) FernUniversität(费尔大学) University of Eastern Finland(东芬兰大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.AI

AI总结 研究大学生和教职员工GenAI素养路径差异,通过心理测量分析发现学生常先掌握高级创作再获基础理解,与学者路径不同且相关性弱,挑战“一刀切”课程,为诊断驱动干预提供依据。

Comments 18 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04774 2026-07-07 cs.LG 新提交 57%

MARLIN: De Novo Molecular Structure Elucidation from Tandem Mass Spectra without a Ground-Truth Formula

MARLIN:从串联质谱中进行从头分子结构解析,无需真实分子式

Xujun Che, Xiuxia Du, Depeng Xu

专题命中 评测与基准 :language model(abstract);分类 cs.LG

AI总结 研究针对无分子式的串联质谱,提出MARLIN方法,通过自监督编码器和语言模型生成候选结构,用质量壳约束等确保准确性,在无真实分子式情况下表现出色,能可靠解析结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04537 2026-07-07 cs.SE cs.AI 新提交 57%

Obey, Diverge, Collapse: Blind Obedience to Incorrect Instructions Drives Code LLMs to Irrecoverable Code Semantic Collapse

服从、发散、崩溃:对错误指令的盲目服从驱使代码语言模型陷入无法恢复的代码语义崩溃

Raj Jaiswal, Anany Singh Divy, Savar Bhasin, Adi Bajpai, Tanuja Ganu, Rajiv Ratn Shah

机构 * IIIT Delhi(印度德里国家理工学院) IIT Kanpur(印度坎浦尔理工学院) Microsoft Research India(微软印度研究院)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究代码语言模型在指令错误时的表现,通过四个实验评估其在单步和迭代修复设置中对错误指令的应对,发现模型会盲目服从错误指令致代码语义崩溃,引入幽灵错误且无法恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04147 2026-07-07 cs.CV cs.AI 新提交 57%

HCSU: A Dataset and Benchmark for Fine-Grained Historical Calligraphy Style Understanding

HCSU:用于细粒度历史书法风格理解的数据集和基准测试

Yinsheng Yao, Yan Liu, Chen Ye

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) The Key Laboratory of Embedded System and Service Computing, Ministry of Education(教育部嵌入式系统与服务计算重点实验室)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对大视觉语言模型在书法风格细粒度理解的挑战,引入HCSU数据集,含多朝代书法家字符图像,解耦模态混合问题,提供分层审美描述及评估协议,揭示当前架构局限以推动视觉推理发展。

Comments Accepted at ECCV 2026. 17 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04139 2026-07-07 cs.LG 新提交 57%

Masked Generative-Contrastive Representation Learning for Cross-Dataset EEG-Based Emotion Recognition

用于跨数据集基于脑电图的情绪识别的掩码生成对比表示学习

Huqin Weng, Jiayang Huang, Yimin Wen, Jie Du, Chi-Man Vong, Chuangquan Chen

专题命中 评测与基准 :pretraining(abstract);分类 cs.LG

AI总结 提出掩码生成对比表示学习框架MGCRL用于跨数据集脑电图情绪识别,基于区域感知时空编码器,整合生成与对比学习,通过关键设计实现跨数据集泛化的细粒度和全局判别表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04034 2026-07-07 cs.SE cs.AI 新提交 57%

The "I Don't Know" Filter: Enhancing Agentic Reliability in Function Calling

“我不知道”过滤器:提高函数调用中智能体的可靠性

Stefan Broecker, Mason del Rosario, Boris Selitser, Thomas Strohmer

机构 * University of California, Davis, Department of Computer Science(加州大学戴维斯分校计算机科学系) Okareo, Inc.(Okareo公司) University of California, Davis, Department of Mathematics(加州大学戴维斯分校数学系)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究语言模型在函数调用基准测试中性能提升但因训练评估指标致幻觉问题。提出考虑错误函数调用负面结果的评估指标及可量化不确定性、去除有害函数调用的轻量级可训练过滤器,助力智能体知道何时说“我不知道”以提升可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03831 2026-07-07 cs.CV cs.AI 新提交 57%

How Do Diffusion Classifiers Decide? A Bias-Centric Evaluation

扩散分类器如何做出决策?以偏差为中心的评估

Saba Fathi, Fardin Ayar, Maryam Abdolali, Ehsan Javanmardi, Manabu Tsukada, Mahdi Javanmardi

机构 * K. N. Toosi University of Technology(伊朗科技大学) Amirkabir University of Technology(伊朗阿米尔卡比尔理工大学) The University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 研究扩散分类器如何决策,通过ASOB-Bench从属性绑定、大小顺序偏差和背景依赖三维度评估,发现其偏差特征与视觉语言模型不同,为构建更稳健模型提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03821 2026-07-07 cs.CR cs.AI 新提交 57%

DualView: Preventing Indirect Prompt Injection in Personal AI Agents

双视图:防止个人人工智能代理中的间接提示注入

Juhee Kim, Woohyuk Choi, Taehyun Kang, Youngmin Kim, Byoungyoung Lee

机构 * Seoul National University(首尔国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI

AI总结 研究个人人工智能代理面临的间接提示注入攻击问题,提出双视图方法,通过扩展不可信数据跟踪到用户环境,部署为插件,有效阻止攻击并保持实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03650 2026-07-07 cs.CV cs.AI 新提交 57%

ClinOCR-Bench: A Comprehensive Clinical Scanned Document Dataset for Optical Character Recognition Model Evaluation

ClinOCR-Bench:用于光学字符识别模型评估的综合临床扫描文档数据集

Enshuo Hsu, Jin Zhou, Kirk Roberts

机构 * McWilliams School of Biomedical Informatics, University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校麦威廉斯生物医学信息学学院) Enterprise Development & Integration, University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心企业开发与集成)

专题命中 评测与基准 :language model(abstract);分类 cs.AI

AI总结 针对从扫描医疗文档提取文本信息的挑战,通过发布ClinOCR-Bench数据集,用多样文档类型、覆盖扫描伪像等特性,评估基准OCR性能,为临床OCR模型评估提供公开资源。

详情

展开后加载摘要…

URL PDF HTML 收藏