arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2608.13441 2026-08-14 cs.CV 新提交 67%

Edit2TikZ: A Comprehensive and Challenging Benchmark for Scientific Figure Editing with TikZ

Edit2TikZ:面向基于TikZ的科学图像编辑的全面且具有挑战性的基准

Zongyun Zhang, Jiacheng Ruan, Xian Gao, Ruizhu Zhou, Lingcheng Meng, Lining Hu, Ting Liu, Yuzhuo Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本文推出科学图像编辑基准Edit2TikZ,评估主流多模态大语言模型发现其性能不足,通过构建混合训练集并采用课程学习,可显著提升紧凑模型的编译成功率。

Comments 9 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13267 2026-08-14 cs.CL cs.AI cs.CV cs.LG 新提交 67%

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

视觉语言模型(VLMs)在失明或被误导时的表现如何?针对科学图表的VLMs行为评估

Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

机构 * University of Aberdeen(阿伯丁大学) International Institute of Information Technology Hyderabad(海德拉巴国际信息技术学院) University of Technology Nuremberg(纽伦堡工业大学) University of Southern California(南加利福尼亚大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究构建科学图表理解基准SciFigBench,提出A-R-I框架评估VLMs在视觉证据缺失或误导时的行为可靠性,发现高感知与推理准确性不代表行为可靠,不同模型表现存在显著差异。

Comments 25 pages including appendix. Project website: https://scifigbench.nlp4sci.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12635 2026-08-14 cs.AR 新提交 67%

GateTruth: Auditing the Rigor of RTL Design Benchmarks via Mutation Testing

GateTruth:通过变异测试审计RTL设计基准的严谨性

Meet Bhadra

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 GateTruth是用于审计RTL基准测试平台严谨性的变异测试引擎,实验显示多数RTLLM v2.0基准测试平台未达95%变异体杀伤阈值,4096-token输出上限会影响模型排名,其成果推动将变异体杀伤认证设为RTL基准的标准要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12569 2026-08-14 cs.IR 新提交 67%

Test-Time Optimization of Query Embeddings with Ranking Aware Reward Maximization

基于排名感知奖励最大化的查询嵌入测试时优化

Tianyu Chen, Jiaxing Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究提出TTT-Embed框架,将排名奖励提炼为轻量学习向量,无需访问模型权重即可优化,在多嵌入模型和MTEB任务上显著提升测试时检索效果,且具备良好泛化性,解决了灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12549 2026-08-14 cs.CV 新提交 67%

StrAD: A Streaming Method and Benchmark for Audio Description Generation for Long-form Videos

StrAD:面向长视频音频描述生成的流式方法与基准

Julian Spravil, Sebastian Houben, Sven Behnke

机构 * Fraunhofer IAIS(弗劳恩霍夫智能分析与信息系统研究所) University of Bonn(波恩大学) University of Applied Sciences Bonn-Rhein-Sieg(波恩-莱茵-锡格应用科学大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Robotics, University of Bonn(波恩大学机器人中心)

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 针对长视频音频描述生成的需求,研究提出首个流式方法StrAD,构建了涵盖多类型全长视频的基准,其微调模型在相关任务上达到先进性能,为扩大无障碍覆盖提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12216 2026-08-13 cs.HC 新提交 67%

"Pharos Night: Crown Pursuit": An AI-Native Deck-Building and Tactical Arena Game Design Based on Multi-Agent Systems

《Pharos Night:皇冠追逐》:一款基于多智能体系统的原生AI卡组构建与战术竞技场游戏设计

Ting-Chen Hsu, Jueyao Liu, Yanzi Zhou, Jiangxu Lin, Haoyu Xu, Yuwen Liu, Yanjia Liu, Bangjing Xu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究设计了基于多智能体系统的原生AI卡组构建与战术竞技场游戏《Pharos Night:皇冠追逐》,利用大语言模型实现核心功能,小规模试玩显示其能提供有策略性的游戏体验,也暴露出相关挑战,展现了多智能体生成式AI在游戏设计中的潜力。

Comments Accepted to 2026 Annual Symposium on Computer-Human Interaction in Play (CHI Play)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12051 2026-08-13 cs.CV 新提交 67%

Do Not Forget the Obvious - RISC: A Risk-Informed Slice-Coverage Protocol for Safe Autonomous Driving

勿忽视显而易见的内容——RISC:一种用于安全自动驾驶的风险感知切片覆盖协议

Fabian Hüger

机构 * CARIAD SE

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究提出RISC协议,将安全问题转化为风险切片,通过风险引导选择提升自动驾驶关键故障发现率,可应用于多类自动驾驶子系统,补充现有测试验证流程。

Comments 14 pages, 3 figures, 5 tables. Accepted at the ECCV 2026 Workshop on Safe and Defensive Autonomous Driving (SDAD). Non-archival workshop paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11200 2026-08-12 cs.CL cs.AI cs.LG 新提交 67%

ConVAWG: A Retrieval-Grounded Framework for Controlled Synthetic Dialogue Generation in Violence Against Women and Girls

ConVAWG:面向针对妇女和女孩的暴力场景下可控合成对话生成的检索驱动框架

Chen Lyu, Xingwei Tan, Simon Cullen, Shelley Wilson, Lois Arthurs, Arshad Jhumka, Gabriele Pergola

机构 * University of Sheffield(谢菲尔德大学) Forensic Capability Network(法医能力网络) University of Leeds(利兹大学) University of Warwick(华威大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对VAWG场景建模的空白,提出检索驱动框架ConVAWG,生成符合CPS标准的合成VAWG多轮对话,发布6000余个对话事件,经多类评估验证其质量与领域保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10796 2026-08-12 cs.CV 新提交 67%

E$^3$mo-Bench: A Scalable Benchmark for Multimodal Evoked and Expressed Emotion Understanding via Bayesian Pairwise Alignment

E³mo-Bench:基于贝叶斯成对对齐的可扩展多模态诱发与表达情感理解基准

Lancheng Gao, Ziheng Jia, Shengyan Li, Zixuan Xing, Jiarui Wang, Huiyu Duan, Xiongkuo Min

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对现有多模态情感理解基准的不足,推出E³mo-Bench基准,提出贝叶斯成对对齐方法与E³mo-Score智能体,验证了框架有效性并指出MLLMs在情感任务中的缺陷,为多模态情感智能发展指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10646 2026-08-12 cs.MA 新提交 67%

ASCon: A Direction-Aware Reciprocal Agent--Step Contextualization Model for Failure Attribution in Multi-Agent Systems

ASCon:面向多智能体系统故障归因的方向感知互惠智能体-步骤上下文模型

Shuyu Jiang, Yue Ran, Kaiyu Xu, Xingshu Chen, Yi Zhang, Hao Ren, Rui Tang, Tianwei Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对多智能体系统故障归因中不同目标间证据依赖关注不足的问题,提出ASCon模型,通过方向感知图注意力等技术聚合轨迹证据,提升了故障智能体、步骤、模式的检测性能及域外归因能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10396 2026-08-12 cs.CV 新提交 67%

FormStruct-Bench:A Hierarchical and Diagnostic Benchmark for Table-Form Document Structure Recognition

FormStruct-Bench:面向表格型文档结构识别的分层诊断基准

Lujie Ban, Jiangtao Zhu, Yuanheng Yu, Jiasheng Shi, Chenhao Ma

专题命中 评测与基准 :SFT(abstract,abstract_cn)

AI总结 该研究提出FormStruct-Bench基准,通过分层评估表格型文档结构识别,发现现有系统在细粒度结构恢复上远弱于内容读取,为相关任务提供诊断依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10882 2026-08-12 cs.SE quant-ph 新提交 67%

From Pattern Detection to Composition Analysis in Quantum Software

从量子软件中的模式检测到组合分析

Neilson Carlos Leite Ramalho, Erico Augusto da Silva, Anthony Accioly, Higor Amario de Souza, Marcos Lordello Chaim

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本研究扩展了量子模式挖掘工具,经评估其在Qrisp上准确率提升,构建了模式组件调用组合图并发布相关流水线、知识库与数据集,支持量子模式采用与演化的可复现研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09552 2026-08-11 cs.DL 新提交 67%

Does ChatGPT score research quality differently by gender?

ChatGPT是否会按性别对研究质量给出不同评分?

Kayvan Kousha, Mike Thelwall

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究利用REF2021的近9万篇论文,发现ChatGPT对男性第一作者论文的评分略高于女性,此差异在部分学科更明显,提示AI研究评估需谨慎。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09294 2026-08-11 cs.HC 新提交 67%

Graphing the Everyday: A Neurosymbolic Approach to Eliciting Routines for Just-In-Time Adaptive Interventions

描绘日常:用于触发即时自适应干预的神经符号方法

Shakyani Jayasiriwardene, Blake Mountford, Meican Ma, Niels van Berkel, Nicholas Koemel, Matthew Ahmadi, Jorge Goncalves, Emmanuel Stamatakis, Zhanna Sarsenbayeva

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 本研究结合LLMs与Neo4j知识图谱的神经符号管道,针对JITAIs面临的对话转日程难题,发现心智模型差距与生态不匹配问题,提出设计启发法以构建支持健康行为改变的主动智能体。

Comments Accepted at OzCHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09147 2026-08-11 cs.CV 新提交 67%

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

RefineAny3D:作为语义对齐的深度细化用于单目3D检测

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09097 2026-08-11 cs.CV 新提交 67%

SI-Edit: Toward Sketch-Instruction Guided Local Image Editing with Pixel-Level Precision

SI-Edit:面向草图-指令引导的像素级精度局部图像编辑

Weixin Ye, Wei Wang, Hongguang Zhu, Xuecheng Nie

机构 * Institute of Information Science, Beijing Jiaotong University(北京交通大学信息科学研究所) City University of Macau(澳门城市大学) Meitu Inc(美图公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对基于草图的图像编辑缺乏像素级精度及对应数据集、评估指标的问题,提出SI-Edit框架,构建SI-Data数据集并建立评估指标,实现更可靠的结构控制与像素级局部编辑效果。

Comments accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07993 2026-08-11 cs.CV 新提交 67%

MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval

MRBench:用于人体动作-文本检索的综合基准

Fulong Liu, Liang Xu, Chengqun Yang, Yuhao Zhang, Yichao Yan, Xiaokang Yang

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出综合动作-文本检索基准MRBench,针对现有基准缺陷构建,提出轻量级粒度感知模型,提升混合粒度检索效果,为动作-语言对齐评估提供测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07036 2026-08-10 cs.SE cs.CV 新提交 67%

CAS2UML: A Handwritten Sketch-to-PlantUML Dataset for Class and Activity Diagrams

CAS2UML:用于类图和活动图的手绘草图到PlantUML数据集

Simon Scholz, Mersedeh Sadeghi

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 CAS2UML是含557幅手绘类图与活动图及对应PlantUML代码的公开数据集,配套验证工具与脚本,可实现草图转UML方法的可复现基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06908 2026-08-10 cs.CL cs.AI cs.CY cs.LG 新提交 67%

Calibrating WEAT Against Anisotropy: ZCA Whitening as a Geometric Pre-Processing Step for Embedding Association Tests

针对各向异性校准WEAT:将ZCA白化作为嵌入关联测试的几何预处理步骤

Seitaro Ono, Senna Ross, Jun Saiki

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出将ZCA白化作为预处理步骤校准WEAT,可降低嵌入空间各向异性,超30%WEAT结果显著性改变,提升语义相似度,为相关偏差测量提供更可靠基础。

Comments Extended version (with appendices) of a paper accepted at the 9th AAAI/ACM Conference on AI, Ethics, and Society (AIES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06620 2026-08-10 cs.SE 新提交 67%

Understanding the Energy Impact of Software Refactoring: A Workload-Aware Study of Controlled Examples and Real-World Commits

理解软件重构的能源影响:一项针对受控示例与真实提交的工作负载感知研究

Haibo Wang, Heng Li, Shin Hwei Tan

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究通过微基准与真实世界基准的大规模实证分析,发现重构的能源影响受工作负载显著影响,现有方法无法可靠识别重构引发的能源回归,需开发更准确的预测技术。

Comments This manuscript is currently under review at ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05507 2026-08-07 eess.AS 新提交 67%

AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks

AffectDF:针对情感表达型攻击的最全面语音深度伪造检测基准

Aurosweta Mahapatra, Xiutian Zhao, Shreeram Suresh Chandra, Zihan Zhang, Zongyang Du, Ismail Rasim Ulgen, Kong Aik Lee, Nicholas Andrews, Carlos Busso, Berrak Sisman

专题命中 评测与基准 :language model(abstract);prompting(abstract)

AI总结 该研究提出涵盖多类情感表达型语音伪造攻击的AffectDF基准,实验发现常规训练的SDD系统在该基准上鲁棒性严重下降,为开发更鲁棒的检测模型提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05495 2026-08-07 cs.CR cs.HC 新提交 67%

PromptShield Home: Ambient Multimodal Prompt Injection Defense for Smart-Home Agents

PromptShield Home:面向智能家居智能体的环境多模态提示注入防御方案

He Zhang, Feilong Li, Dingning Long, Yilin Cui, Peijun Zhang, Yuewen Zhang, Qianyao Xu, Xinyi Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究针对智能家居智能体的提示注入安全问题,构建了现实场景基准测试PromptShield-Home,对比了三类防御层的性能,发现多智能体调解的上限性能最优,提出应采用学习路由与传感器融合方案保障安全。

Comments This work has been accepted as a poster to UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05223 2026-08-07 cs.SE cs.CR 新提交 67%

Towards a Risk Assessment of Malicious Skill Files in Coding Agents

面向编码智能体中恶意技能文件的风险评估

Rui Yang, Michael Fu, Kla Tantithamthavorn, Chetan Arora, Joey Chua

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对编码智能体技能接口的恶意文件风险,提出对抗性技能合成方法与评估流水线,发现企业级智能体易被恶意技能利用,仅少数运行有明确安全识别,呼吁企业提前评估风险。

Comments 29 pages, 6 figures, 6 tables. Preprint; under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05222 2026-08-07 cs.SD eess.AS 新提交 67%

Diff-Symbo: Text-Controlled Long-Duration Symbolic Music Generation Using Autoregressive Latent Diffusion Model

Diff-Symbo:基于自回归潜在扩散模型的文本控制长时长符号音乐生成

Zhiwei Lin, Jun Chen, Boshi Tang, Weihao Wu, Yang Jing, Yaolong Ju, Fan Fan, Zhiyong Wu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 Diff-Symbo借助LDM与自回归方法,结合含19345个文本模板的数据集,实现了文本控制的长时长高质量符号音乐生成,在多项指标上优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05215 2026-08-07 cs.RO cs.CV 新提交 67%

VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances

VLAff:用于统一可操作 affordance 的视觉-语言-affordance 模型

Jihoon Oh, Kento Kawaharazuka, Kei Okada

机构 * University of Tokyo(东京大学)

专题命中 评测与基准 :language model(abstract);foundation model(abstract)

AI总结 本研究提出 VLAff 模型,结合 EgoAffordance 数据集,解决人类与机器人 embodiment 不匹配问题,实现视觉 affordance 预测及真实机器人零样本操作等应用。

Comments 8 pages, 5 figures. Accepted to IEEE/RSJ IROS 2026. Project page: https://ojh6404.github.io/vlaff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05180 2026-08-07 cs.CY 新提交 67%

The Nuclear Decision-Making Benchmark: Evaluating Frontier LLMs on Nuclear Tendencies

核决策基准:评估前沿大语言模型的核倾向

Benjamin Jensen, Ian Reynolds, Yasir Atalan, Martin Pollack, Austin Woo, Robert Sincero

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 该研究推出核决策基准(NDM Bench),评估7种前沿大语言模型在核相关场景的表现,发现模型间核倾向差异显著,不同模型的行动偏好、一致性及对国家和措辞的响应均存在差异。

Comments 34 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05175 2026-08-07 cs.CY 新提交 67%

Teaching Intro AI When the Tools Can Do the Homework: A Course Redesign and a Student Bill of Rights

当工具能完成作业时教授人工智能入门课程:课程重新设计与学生权利法案

Yusuf Pisan

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大型语言模型可完成AI入门课程作业的问题,华盛顿大学博塞尔分校重新设计CSS 382课程,保留经典核心、新增大模型构建模块,重构评估体系,还通过学生参与制定教师AI使用规范。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04523 2026-08-06 cs.CR cs.SE 新提交 67%

Checked-In Secret Detection: Strings Are All You Need

签到式密钥检测:字符串即你所需

Zhengdong Huang, Kevin Li, Jinqiu Yang, Yepang Liu, Lili Wei

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 该研究针对源代码硬编码密钥检测的现有方法局限,提出基于StringGroup的上下文提取算法及Secretron工具,在SecretBench数据集上F1值达98.74%,可高效检测未知密钥。

Journal ref The ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04482 2026-08-06 cs.IR 新提交 67%

Skills Know Their Neighbors: Cluster-Contrastive Capability Pages for Skill Retrieval

技能了解其邻居:用于技能检索的聚类对比能力页面

Zifei Wang, Wei Wen, Qiang Ji, Ruizhi Qiao

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对大语言模型智能体技能检索中仅改进检索器无法消除的文档导致的误差,提出聚类对比的能力页面,在SRA-Bench等数据集上显著提升了召回率与任务成功率。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03734 2026-08-05 cs.SE 新提交 67%

We Must Have Missed This Comment: Detecting and Repairing Stale Function References in Linux Kernel Comments

我们一定漏掉了这条注释:检测和修复 Linux 内核注释中的过时函数引用

Kexin Sun, Yunbo Lyu, Xutong Ma, Hongyu Kuang, Ratnadira Widyasari, He Zhang, Xiaoxing Ma, Julia Lawall, David Lo

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 针对 Linux 内核注释中因函数变更导致的过时引用问题,提出三阶段方法 ReCite 检测并修复此类引用,在 v6.18-rc1 上检测到 869 个过时引用,其修复建议准确率高,提交的 75 个补丁中有 50 个被接受。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏