arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2607.26751 2026-07-30 cs.CL cs.AI eess.SP 新提交 62%

Phoneme- vs. Character-Level Targets and Selective State-Space Models for Intracortical Brain-to-Text

用于皮层下脑机文本的音素级与字符级目标及选择性状态空间模型

Lucas Zamora Vera, Jose A. Gonzalez-Lopez

机构 * Universitat Oberta de Catalunya (UOC)(加泰罗尼亚开放大学) University of Granada(格拉纳达大学) Research Centre for Information and Communication Technologies (CITIC-UGR)(信息与通信技术研究中心(CITIC-UGR))

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究在Brain-to-Text '25基准上对比GRU与混合Mamba解码器、音素级与字符级目标的脑机文本系统,发现循环基线性能最优,混合Mamba具竞争力但未超越基线。

Comments 6 pages, 1 figure, 6 tables, submitted to IberSPEECH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25679 2026-07-29 cs.LG cs.AI cs.MM 新提交 62%

DynaBridge: Dynamic Summary-Guided Cross-Task Multimodal Fusion for DASS-Structured Mental Health Assessment

DynaBridge:用于DASS结构心理健康评估的动态摘要引导跨任务多模态融合

Shiyu Teng, Haichen Yu, Jiaqing Liu, Hao Sun, Yu Song, Shurong Chai, Ruibo Hou, Lanfen Lin, Yen-Wei Chen

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究针对心理健康评估中通用融合模型忽略问卷标签心理测量结构的问题,提出DynaBridge框架,通过编码多模态线索并结合语义摘要进行评估,在官方验证分割上优于基线和其他方法,展现了多模态融合与心理测量结构结合的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25130 2026-07-29 cs.SE cs.AI cs.HC cs.LG 新提交 62%

Learning from 53.6K Real-World Developer Edits of AI-Generated Code

从53.6K条人工智能生成代码的真实世界开发者编辑中学习

Jenny T. Liang, Mihika Bairathi, Wayne Chi, Ameet Talwalkar, Nishant Subramani, Valerie Chen

专题命中 评测与基准 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 研究人工智能生成代码的开发者编辑行为,引入DECODE数据集。通过该数据集进行数据分析及对大语言模型预测代码编辑能力的基准测试,发现多数编辑在前15分钟,且微调后开源模型表现更佳,强调以开发者为中心方法对未来AI编程助手的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23514 2026-07-28 cs.CL cs.AI cs.MM 新提交 62%

Novel Claim or Déjà Vu? Rethinking "Contamination-Free'' Dynamic Evaluation for Multimodal Automated Fact-Checking

新主张还是似曾相识?重新思考多模态自动事实核查的“无污染”动态评估

Haorui He, Xinwen Chen, Dacheng Wen, Reynold Cheng, Francis C. M. Lau, Yupeng Li

机构 * Hong Kong Baptist University(香港浸会大学) The University of Hong Kong(香港大学) Beijing Normal-Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究多模态自动事实核查中基准的污染风险,通过实证研究静态和动态基准,发现动态评估虽能减少但不能消除污染,新主张可多种方式验证,污染会致性能膨胀和排名扭曲,为可信评估提供实用指南。

Comments Accepted at ACM Multimedia (ACM MM), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23058 2026-07-28 cs.CL cs.AI 新提交 62%

ADAGE: A Language-Agnostic Pipeline for Analogical Reasoning Evaluation

ADAGE:一种用于类比推理评估的语言无关管道

Ahmed Haj Ahmed, Alvin Grissom

机构 * Haverford College(哈弗福德学院)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多语言推理评估依赖翻译基准的问题,提出ADAGE语言无关管道,结合母语者策划与大语言模型辅助生成构建基准,通过为多种语言构建基准并评估模型,发现文化推理差距,还发布了相关内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21608 2026-07-27 cs.SE cs.AI cs.CL cs.CY 新提交 62%

From Obligation to Specification: A Survey on Validating EU AI Act Requirements in RE

从义务到规范:关于在需求工程中验证欧盟人工智能法案要求的调查

T. Y. Emmy Lai, Sven Giesselbach, Matthias Koch, Héctor Allende-Cid

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究围绕欧盟人工智能法案生效后组织面临的新义务,通过混合方法探索性研究,评估组织准备及对大语言模型智能验证工具的看法,发现虽法案相关但结构化机制缺失,该工具在映射义务等方面有前景但需保障措施,还概述了闭环方法最低要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21324 2026-07-24 cs.CL cs.AI 新提交 62%

GRADRAG: Cross-Component Prompt Adaptation for Coordinated Multi-Agent RAG

GRADRAG:用于协调多智能体RAG的跨组件提示适应

Paolo Pedinotti, Enrico Santus

机构 * Bloomberg(彭博社)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多智能体RAG系统各组件孤立优化问题,提出GRADRAG框架,通过将RAG流程建模为计算图,传播评估反馈更新上游智能体,在两种检索范式基准测试中优于单步细化基线,提升了系统性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-07-24 cs.AI cs.CL 新提交 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, David R. Pugh, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19867 2026-07-23 cs.CL cs.AI cs.CE 新提交 62%

Overview of FinMMEval 2026 Task 2: Multilingual Financial Short-Answer Question Answering

FinMMEval 2026任务2概述:多语言金融简答题问答

Zhuohan Xie, Xueqing Peng, Georgi Georgiev, Dimitar Dimitrov, Yuyang Dai, Rania Elbadry, Vanshikaa Jani, Lingfei Qian, Fan Zhang, Jimin Huang, Jiahui Geng, Yankai Chen, Ye Yuan, Haolun Wu, Yuxia Wang, Ivan Koychev, Veselin Stoyanov, Mingzi Song, Yu Chen, Xue Liu, Preslav Nakov

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Fin AI(金融人工智能公司) FMI, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”金融数学与信息学系) INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学“圣克莱门特·奥赫里德斯基”信息技术与自动化研究所) University of Arizona(亚利桑那大学) The University of Tokyo(东京大学) Linköping University(林雪平大学) McGill University(麦吉尔大学) Mila, Quebec AI Institute(魁北克人工智能研究所) Meiji Gakuin University(明治学院大学)

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 FinMMEval 2026任务2聚焦多语言金融简答题问答,通过特定配对和格式让系统答题,最终测试集含256个项目分两层级,依ROUGE-1 F1排名,最强系统差距小,还记录了多种相关策略。

Comments 9 pages. Task overview paper for CLEF 2026 Working Notes (CEUR Workshop Proceedings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19386 2026-07-23 cs.LG cs.CL 新提交 62%

Building Fast, Evaluating Slow: Pipeline Choices Dominate Autointerpretability Score Variance

构建快速,评估缓慢:管道选择主导自动可解释性得分方差

Sinie van der Ben, Neele Roch, Anna Hedström, Mennatallah El-Assady

机构 * ETH Zürich(苏黎世联邦理工学院)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究稀疏自动编码器可解释性得分的跨论文比较,通过多指标、多模型及方法变化轴的实验发现方法方差主导得分方差,排名不稳定,基于得分的比较可能反映管道差异,贡献评估方法以推动可解释性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19266 2026-07-22 cs.LG cs.AI 新提交 62%

Toward Auditable Fraud Detection: Combining Graph Features, Model Explanations, and Agentic Case Investigation

迈向可审计的欺诈检测:结合图特征、模型解释和智能案例调查

Rahil Sharma

机构 * Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究欺诈检测系统,通过分层管道结合多种方法,包括梯度提升分类器等。在PaySim数据集上实验,各组件在特定条件下起作用,如校正后图特征等未提升全测试集平均精度,但在部分子集有作用,调查代理表现不佳,还标记了其错误。

Comments 14 pages, 3 figures. Code available at https://github.com/rahil1303/auditable-fraud-investigation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18615 2026-07-22 cs.CL cs.LG 新提交 62%

Stochastic Meta-Unlearning: Bridging Language Backbone and Multimodal Unlearning

随机元遗忘:连接语言主干与多模态遗忘

Zijie Liu, Jinhao Duan, Gaowen Liu, Sijia Liu, Tianlong Chen

机构 * UNC at Chapel Hill(北卡罗来纳大学教堂山分校) Cisco Research(思科研究院) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究视觉语言模型的机器遗忘问题,提出随机元遗忘框架,利用VLM级反馈学习初始化,经内、外循环更新语言主干,实验证明该方法在遗忘-保留权衡上表现最佳,能提升准确率且可迁移。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18027 2026-07-21 cs.LG cs.CL 新提交 62%

L1 Augmented Attention as an Improved Vector Similarity Metric

L1增强注意力作为一种改进的向量相似性度量

Kurt Godden

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对缩放点积注意力在Transformer模型中作为相似性度量的局限,提出L1增强注意力方法,通过减去特定头的L1距离改进相似性计算,经实验在WikiText 2上取得更好效果,揭示了各层几何作用及头级专业化,有效提升语言模型相似性计算。

Comments 16 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17962 2026-07-21 cs.LG cs.AI stat.ML 新提交 62%

Topological Signatures of Context-Level Reliability in TabPFN

TabPFN中上下文级可靠性的拓扑特征

James Hu, Mahdi Ghelichi

机构 * TD Bank(道明银行)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究TabPFN在复杂表格几何上的内部行为,用曲折持久同调将其层表示视为点云,构建合成表格任务基准。发现其内部表示几何拓扑与数据集级可靠性相关,复杂几何有双重拓扑特征,相关描述符与多种指标有关,能诊断可靠性及运行状态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16848 2026-07-21 cs.LG cs.AI 新提交 62%

Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration

超越内存排行榜:将科学记忆评估为预算上下文恢复

Maksim Sheverev, David Finkelstein, Sergey Nikolenko

机构 * Quantellence Research(Quantellence研究公司) St. Petersburg Department of the Steklov Institute of Mathematics(斯捷克洛夫数学研究所圣彼得堡分部) St. Petersburg State University(圣彼得堡国立大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究提出两个全文科学记忆基准测试PAIM和PTr,评估八个内存/检索系统,发现内存排行榜受多种因素影响,如摄取粒度等。结果显示不同系统表现因条件而异,还表明大语言模型评判排名与人工一致,应将科学记忆评估为预算上下文恢复并开源相关资源。

Comments 40 pages, 6 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14399 2026-07-17 cs.AI cs.CL 新提交 62%

Instrument Effects in Language-Model Honesty Evaluation: An Auditable Single-System Demonstration

语言模型诚实度评估中的工具效应:一个可审计的单系统演示

Justin Bronder

机构 * Corabo Inc.(科拉博公司)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型诚实度评估中的工具效应,通过构建文本冒险世界测试评估工具,发现工具选择影响行为,如扩展语法、披露标准等会改变结果,重复运行不稳定且预注册梯度被证伪,进而提出四检查完整性协议。

Comments 21 pages. Code: https://github.com/Aargau/latent-underground (tag v1.0-arxiv). Data: https://doi.org/10.5281/zenodo.21384627

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13465 2026-07-16 cs.CL cs.AI cs.HC cs.MA cs.SE 新提交 62%

DevicesWorld: Benchmarking Cross-Device Agents in Heterogeneous Environments

DevicesWorld:异构环境中跨设备智能体的基准测试

Huatao Li, Xinwei Geng, Yuheng Wang, Yutong Li, Runde Yang, Hantao Chen, Shu Yao, Jingru Fan, Xuhui Ren, Yuanyuan Zhao, Fei Huang, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Honor Device Co., Ltd(荣耀终端有限公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究针对智能体跨设备协同操作难评估的问题,引入DevicesWorld基准测试,整合多类设备环境及众多任务,通过固定评估集评估五个前沿智能体系统,发现成功率低,为可靠跨设备智能体研究提供了可执行、可重现及有诊断作用的评估。

Comments https://github.com/AgenticOrgLab/DevicesWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13396 2026-07-16 cs.AI cs.CL cs.SE 新提交 62%

Set-shifting Behavioral Test for Harnessed Agents

用于受约束智能体的集合转移行为测试

Ziwei Ye

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究当可靠工具在会话中悄然改变时语言模型智能体的工具选择,借鉴认知心理学的集合转移构建基准和评估框架,计算集合转移准确率,测试发现不同失败模式及集合框架对路由动态有影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12962 2026-07-15 cs.SE cs.AI cs.LG 新提交 62%

Form, Not Content? A Preregistered, Placebo-Controlled Evaluation of Learned Error-Conditioned Self-Repair Through Prompts and Weights in Frozen Small Code Models

形式而非内容?对冻结小代码模型中通过提示和权重进行的学习错误条件自修复的预注册、安慰剂对照评估

Mehmet Iscan

机构 * PythaLab, Yıldız Technical University, Istanbul, Turkey(PythaLab,Yıldız技术大学,伊斯坦布尔,土耳其)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究冻结小代码模型中错误条件自修复,引入PoPE方法,通过提示和权重通道对其评估,结果表明在提示通道内容消除形式安慰剂下解锁单元数有差异,权重通道各情况有不同表现,未确认内容归因优越性,PoPE是可重新测试的测量标准。

Comments 54 pages, 6 figures, 17 tables. Preregistered, placebo-controlled evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11918 2026-07-15 cs.DL cs.AI cs.CY cs.LG 新提交 62%

AAAI-26 Dual Submissions: Novel Challenges

AAAI-26双重投稿:新挑战

Kiri L. Wagstaff, Joydeep Biswas, Erich Merrill, Bo An, Ida Camacho, David J. Crandall, Matthew E. Taylor

机构 * OSU Libraries(俄勒冈州立大学图书馆) University of Texas at Austin(德克萨斯大学奥斯汀分校) Nanyang Technological University(南洋理工大学) AAAI Washington, DC(AAAI华盛顿特区) Indiana University(印第安纳大学) University of Alberta(阿尔伯塔大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 AAAI-26评审中发现双重投稿问题严重,通过标题+摘要相似性评估等方法处理,导致141篇主赛道投稿被拒稿。提醒注意双重投稿增长,其因生成式AI工具加剧,还给出更新政策、设检查工具等应对建议。

Comments 12 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11578 2026-07-14 cs.LG cs.AI cs.CV eess.SP 新提交 62%

DiffEEG: A Self-Supervised Denoising Diffusion Model for Learning EEG Generic Representations

DiffEEG:用于学习脑电通用表示的自监督去噪扩散模型

Abdulkader Helwan, Lina Abou-Abbas, Hussein El Amouri, Belkacem Chikhaoui, Khadidja Henni

机构 * Lebanese American University(黎巴嫩美国大学) Institute of Applied Artificial Intelligence, TÉLUQ University(应用人工智能研究所,泰鲁克大学)

专题命中 评测与基准 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对基于脑电的癫痫检测面临的注释稀缺和类别不平衡问题,提出DiffEEG自监督基础模型,通过去噪扩散预训练和强化学习微调学习通用神经表示,在癫痫检测中取得较好效果,证明该方法能以最少标记数据实现临床可部署监测。

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11267 2026-07-14 cs.IR cs.AI cs.CL 新提交 62%

Enhancing LLMs through human feedback: a journey towards self-improvement

通过人类反馈增强语言模型:自我提升之旅

Tatiana Pelc, Gila Kamhi, Asaf Avrahamy, Adi Fledel-Alon

机构 * Intel Corporation(英特尔公司)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究在信息检索系统中,通过整合辅助反馈RAG系统及人工参与,利用人类反馈优化主RAG系统性能,经多数据集测试验证方法有效,强调了其变革潜力,为自适应信息检索技术研究树立了先例。

Comments AIC 2025: The 10th International Workshop on Artificial Intelligence and Cognition (held as part of ECAI 2025). October 25-26, 2025. Bologna, Italy

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 62%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08374 2026-07-10 cs.CL cs.AI cs.HC cs.RO cs.SI 新提交 62%

Large-Language-Models-as-a-Judge in Theory-Agnostic Adaptive Metric-Alignment for Prototypical Networks in Personality Recognition

大语言模型作为人格识别中原型网络的理论无关自适应度量对齐的评判器

Jing Jie Tan, Ban-Hoe Kwan, Danny Wee-Kiat Ng, Yan-Chai Hum, Shih-Yu Lo, Po-An Chen, Noriyuki Kawarazaki, Kosuke Takano, Anissa Mokraoui

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对人格识别受理论依赖公式限制的问题,提出理论无关的JAM框架,通过注意力池化图原型网络和跨理论协调方法学习结构化表示并统一数据集,还用大语言模型作为评判器机制,提升了跨框架泛化能力和性能。

Journal ref IEEE Transactions on Affective Computing (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07721 2026-07-10 cs.AI cs.LG 新提交 62%

Context Graphs for Proactive Enterprise Agents

用于主动企业智能体的上下文图

Avinash Kumar

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在让企业智能体更主动,提出上下文图结构,定义相关检测引擎、评分器和呈现层,形式化组件并给出Python实现,经案例研究评估,该方法提升了Precision@5,降低误报率和平均呈现时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07478 2026-07-09 cs.LG cs.CL eess.SP 新提交 62%

FourierQK: Spectral Preprocessing of Query-Key Projections Improves Transformer Attention

FourierQK:查询-键投影的频谱预处理改进Transformer注意力

Athanasios Zeris

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究在字符级语言建模中,通过FFT对查询-键投影进行频谱预处理改进Transformer注意力,在TinyShakespeare数据集上取得显著效果,不同频率设置有不同提升,增益源于频域混合,还明确了与其他方法的架构边界。

Comments 16 pages, 2 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01420 2026-07-09 cs.CL cs.AI cs.CV 新提交 62%

MultAttnAttrib: Training-Free Multimodal Attribution in Long Document Question Answering

MultAttnAttrib:长文档问答中的无训练多模态归因

Dang Quang Thien Tran, Quang V. Dang, Vinamra Tyagi, Sai Soorya Rao Veeravalli, Trang Nguyen, Ryan A. Rossi, Franck Dernoncourt, Nedim Lipka, Koustava Goswami, Samyadeep Basu

专题命中 评测与基准 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 提出无训练归因方法MultAttnAttrib,利用模型预填充、选定注意力头和校准阈值定位证据,并构建多模态归因基准MultAttrEval,实验表明其优于多种方法,匹配GPT 5.4且延迟降低至1/7。

Comments 25 pages (8 main, 17 references + appendix), 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04690 2026-07-07 cs.CL cs.LG 新提交 62%

PAST-TIDE: Prototype-Anchored Statement Tuning with Topic-Invariant Normalization for Stance Detection

PAST-TIDE:用于立场检测的基于主题不变归一化的原型锚定语句微调

Md. Shakhoyat Rahman Shujon, MD Jahid Hasan Jim, Md. Milon Islam, Md Rezwanul Haque, Fakhri Karray

机构 * Department of Computer Science and Engineering, Khulna University of Engineering & Technology(库尔纳工程技术大学计算机科学与工程系) Department of Electrical and Computer Engineering, University of Waterloo(滑铁卢大学电气与计算机工程系) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学机器学习系)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.LG

AI总结 PAST-TIDE是用于立场检测的系统,通过语句微调,将立场重新定义为完形填空式掩码语言建模,并用原型对比学习及主题条件层归一化补充,在低资源设置中表现有竞争力。

Comments Published in The Fifteenth Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04546 2026-07-07 cs.RO cs.AI cs.CV cs.LG 新提交 62%

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM:作为可控灵巧世界模型的模拟到现实桥梁的分割掩码

Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

机构 * Soft Robotic Lab, Department of Mechanical and Process Engineering ETH Zurich, Switzerland(苏黎世联邦理工学院机械与过程工程系软机器人实验室)

专题命中 评测与基准 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出Mask2Real-WM,一种用于灵巧操纵的两阶段动作条件世界模型,将像素预测解耦为动力学和渲染模型,利用分割空间较小的模拟到现实差距,通过合成数据预训练和真实演示微调实现各自由度动作可控。

Comments 23 pages, 24 figures, 4 tables. Preprint. Project page: https://srl-ethz.github.io/Mask2Real-WM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04542 2026-07-07 cs.LG cs.AI cs.SE 新提交 62%

Auto: The AGI Compiler

自动:通用人工智能编译器

Jaber Jaber, Osama Jaber

机构 * RightNow AI(即时人工智能)

专题命中 评测与基准 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究提出通用人工智能编译器Auto,通过记录智能体行为,提取确定性部分转化为程序或专家,生成带保障的认知二进制文件。在基准测试中表现良好,还量化了失败模式,强调校准和参考保真度对正确性的决定作用。

Comments 10 pages, 4 figures, 3 tables, 1 algorithm. Code: https://github.com/RightNow-AI/auto

详情

展开后加载摘要…

URL PDF HTML 收藏