arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2747 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2747 篇

2608.02878 2026-08-05 cs.AI 新提交 70%

VeriTrace: Human-Like Temporal Exploration Completes Agentic Action Space

VeriTrace:类人时间探索完成智能体动作空间

Yu-Tung Liu, Cunxi Yu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 VeriTrace是一种多智能体系统,通过赋予Inspector智能体完整调试动作空间实现类人时间探索,在VerilogEval-V2基准测试上首次达到100% Pass@1,准确率较最强复现基线提升5.1%。

Comments ICLAD 2026, Long Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02604 2026-08-05 cs.AI cs.IR 新提交 70%

ISEE: Interactive Semantic Enrichment for Database Fields

ISEE:数据库字段的交互式语义丰富

Yuan Tian, Yiru Chen, Rakesh R. Menon, Zifan Liu, Ting Cai, Fei Wu, Anudeep Chimakurthi, Prashanthi Ramamurthy, Sridevi Aishwariya Ganesan, Kun Qian, Yunyao Li

机构 * Purdue University(普渡大学) Adobe(奥多比公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出ISEE系统,通过评分、收集领域知识并与用户协作丰富数据库字段语义,可降低认知负荷、提升描述质量并增强下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02569 2026-08-04 cs.AI cs.DC cs.OS 新提交 70%

AtumAI: A Principled Framework for Agentic Generation of Datacenter Control-Plane Policies

AtumAI:一种用于智能体生成数据中心控制平面策略的原则性框架

Qiushi Lin, Chaojie Zhang, Íñigo Goiri, Aditya Akella, Ricardo Bianchini, Jovan Stojkovic

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 AtumAI是一种用于智能体生成数据中心控制平面策略的框架,通过任务编译器和进化设计循环实现形式化、可迁移、系统化的策略生成,其生成的策略在三类任务上均优于专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02372 2026-08-04 cs.CL 新提交 70%

PredAct-Bench: Benchmarking Tool-Augmented Dialogue under Controlled Tool Noise

PredAct-Bench:可控工具噪声下的工具增强对话基准

Abdulrahman AlRabah, Xiaocheng Yang, Dilek Hakkani-Tür, Abdussalam Alawini

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究推出PredAct-Bench基准,以教育为测试平台评估带噪声工具的对话智能体,扩展信任校准指标并评估13种LLMs,发现当前模型无法在工具噪声下为教师提供足够可见性,助力构建更优AI决策支持系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01715 2026-08-04 cs.SE cs.AI 新提交 70%

Coding Agents as Test-Suite Auditors: Finding What Official Suites Miss While Approaching What They Catch

编码智能体作为测试套件审计器:在接近官方测试套件检测能力的同时发现官方套件遗漏的问题

Shuyang Xie, Shuxiao Xie, Feng Zhu, Yanli Ji, Wangmeng Zuo

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出编码智能体作为测试套件审计器,结合认证链识别官方套件遗漏的缺陷提交,在接近官方套件覆盖度的同时,无官方套件时其构建的套件表现最优。

Comments 24 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01690 2026-08-04 cs.RO cs.AI 新提交 70%

ProtoAct: Turning Wet-Lab Protocols into Embodied Robotic Actions

ProtoAct:将湿实验室协议转化为具身机器人动作

Zhe Liu, Jiaming Gu, Zhaohui Du, Zhe Wang, Huanbo Jin, Quan Lu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对湿实验室协议难转化为机器人动作的问题,提出ProtoAct框架,结合ProtoRAG、RefineChecker、ActSchema处理协议,引入BioP2E数据集,经多模型评估与消融实验验证,可实现仿真及真实机器人的协议执行。

Comments 15 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01377 2026-08-04 cs.AI 新提交 70%

CraftAlign: Feature-Grounded Evaluation and Revision Guidance for AI Stories

CraftAlign:面向AI故事的基于特征的评估与修订指导

Yang Yang, Boyun Xu, Shaofeng Liang, Yun Han, Zining Zhong, Songning Lai, Kaishen Yuan, Yutao Yue

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CraftAlign是对齐AI故事与人类叙事技巧的框架,含特征估计器与能量模型,可评估写作模式并生成修订指导,实验显示其区分能力及指导效果优于基线。

Comments 17 pages, 5 figures, includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01149 2026-08-04 cs.AI 新提交 70%

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

PATH-Bench:面向终身智能体的路径依赖评估基准

Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01085 2026-08-04 cs.MA cs.LG 新提交 70%

When Collaboration Becomes a Trigger: Collective Evidence-Threshold Backdoors in Multi-Agent Systems

当协作成为触发因素:多智能体系统中的集体证据阈值后门

Jia-Hao Xiao, Lei Feng, Min-Ling Zhang

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 针对多智能体系统的新型集体证据阈值后门威胁,提出BCBI注入后门、LATTE防御方法,在基准测试中实现高效后门激活与低干扰防御效果。

Comments 26 pages,11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00877 2026-08-04 cs.LG 新提交 70%

GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMs

GeoArbiter:面向遥感多模态大语言模型的可验证性导向 grounding 方法

Xuechen Li

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究针对遥感多模态大语言模型的事实断言问题,提出无需训练的 GeoArbiter 流程,通过仅注入图像无法验证的地理事实,有效降低了模型的断言级幻觉并提升了对冲突记录的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00832 2026-08-04 cs.LG 新提交 70%

AdvPlan-Bench: Adversarial Evaluation of Structured Plan-Generation Agents

AdvPlan-Bench:结构化计划生成智能体的对抗性评估基准

Alina Kapanova, Arun Kanhai, Natan Vidra, Spurthi Setty

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出AdvPlan-Bench,这一结构化计划生成智能体的对抗性评估离线基准,通过多维度指标开展实验验证,为相关研究提供可复现的基准支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00366 2026-08-04 cs.SE cs.AI 新提交 70%

Artificial Intelligence and Modeling & Simulation: An Overview

人工智能与建模及仿真:概述

Niclas Feldkamp, Philippe J. Giabbanelli, Istvan David

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本报告概述人工智能与建模及仿真的交叉领域,阐述二者双向促进关系,沿建模及仿真各阶段展示大语言模型等技术的应用,提供概念路线图助力领域探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00106 2026-08-04 cs.LG 新提交 70%

Learning Compositional Meta-Routing for Agentic Workflows: An Executable Benchmark

面向智能体工作流的组合式元路由学习:一个可执行基准

Natan Vidra, Alina Kapanova, Arun Kanhai, Spurthi Setty

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出一个智能体工作流的可执行基准和感知预算的组合式元路由器,在保留测试集上实现100%成功率,成本比静态策略低43%,但在词汇偏移挑战任务上表现不佳,凸显词汇泛化是主要限制。

Comments 7 pages, 1 figure; AAAI 2027 anonymous submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00149 2026-08-04 cond-mat.soft cs.AI 新提交 70%

A Synthetically-accessible Universe of Chemically Recyclable Polymers

可化学回收聚合物的合成可及宇宙

Anagha Savit, Wei Xiong, Harikrishna Sahu, Shivank S. Shukla, Will R. Gutekunst, Rampi Ramprasad

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本研究结合VFS与polyBART、POLYT5模型生成100万个可合成的ROP聚合物结构数据集,经严格筛选后可作为下游可持续应用的宝贵资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28662 2026-08-03 cs.AI 新提交 70%

An Ontology-Guided, Deduplication-Aware Extraction Layer for Knowledge Graph Construction from Heterogeneous Documents

面向异构文档知识图谱构建的本体引导、去重感知抽取层

Vaibhav Dangaich, Kevin Lewis, Kundeshwar Pundalik

机构 * Konectu(科内克图)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一套本体引导的去重感知抽取层,用Qwen3.5-9B模型从异构文档抽取实体与关系,经五阶段优化后,在情报语料上使搜索召回率从70%升至95%且修正多类质量缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28481 2026-07-31 cs.AI 新提交 70%

A Fuzzy Rule-based Neuro-Symbolic Approach for Pipe Severity Prediction in Sewer Networks

用于污水管网管道严重程度预测的基于模糊规则的神经符号方法

Ngoc Thai Le, Thanh Ma, Umberto Straccia

机构 * Can Tho University(芹苴大学) Istituto di Scienza e Tecnologie dell’Informazione, CNR - ISTI(意大利国家研究委员会信息科学与技术研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出一种基于模糊规则的神经符号框架,将神经感知与符号推理解耦,结合Swin Transformer、Weka J48算法和模糊逻辑,在污水管网管道严重程度预测任务中,较仅图像分类提升了多项关键指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27929 2026-07-31 cs.AI 新提交 70%

Meta-Task: Turning Terminal Task Synthesis into a Terminal Task for Scalable Agent Training

元任务:将终端任务综合转化为可扩展智能体训练的终端任务

Zhihong Pan, Jiyuan He, Kai Zhang, Yupeng Han, Ze Liu, Yuze Zhao, Yongcong Ye, Zhaohua Yang

机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(中国科学技术大学) Meituan(美团)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 Meta-Task框架将终端任务综合转化为Terminal-Bench格式任务,通过多阶段机制等提升任务质量,生成3221条轨迹微调Qwen3系列模型,效果优于同期方法且训练数据更少。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27895 2026-07-31 cs.AI cs.CV 新提交 70%

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

MMHBench:用于长视频心理健康理解的多视角基准测试集

Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li, Peipei Song, Xun Yang, Meng Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27849 2026-07-31 eess.SY cs.LG cs.SY 新提交 70%

Safety-Gated Agentic Supervisory Control on a Coupled Distillation Benchmark: Regime Map, Auditable Gate, and Co-Design Findings

耦合精馏基准上的安全门控智能体监督控制:工况图、可审计门与协同设计发现

Christian Rosenthal

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究针对耦合精馏基准,提出基于规则的分叉孪生反事实安全门控机制,结合DeepSeek-V4-Flash等模型,在目标获取、扰动抑制等任务上优于基准方法,可有效遏制有害操作。

Comments 31 pages, 8 figures. Code and data: https://github.com/cgncro-cyber/IndustrialAI. Sole author; independent research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27687 2026-07-31 cs.AI 新提交 70%

Rehearse: Stepping Back from the Confidence Cliff in Self-Improving Autoresearch

Rehearse:从自改进自动研究中的置信度悬崖后退

Jiazhen Ji, Shouhong Ding

机构 * Tencent(腾讯)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究发现自动研究中存在置信度悬崖问题,提出Rehearse方法通过聚焦过往尝试结果记忆提升判断准确率,在三个任务的4000次训练运行预算下改善了终点性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27556 2026-07-31 cs.AI cs.MA 新提交 70%

Evaluating Agentic Bioinformatics through Function, Evidence, and Validation

通过功能、证据和验证评估智能体生物信息学

Phuc Pham, Truong-Son Hy

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出FEV框架评估智能体生物信息学,梳理多领域128篇文献后发现规划等进展快于科学验证相关环节,主张应基于工作流正确性评估这类系统

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27499 2026-07-31 cs.AI 新提交 70%

A dataset of rated conceptual arguments

已标注评分的概念论证数据集

Emery Cooper, Caspar Oesterheld, Linh Chi Nguyen, Alexander Kastner, Ethan Perez

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究构建了含多维度专家评分的概念论证数据集,提出两种评分函数并基准测试多模型,发现模型性能与通用能力排名相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 70%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27022 2026-07-30 cs.CL 新提交 70%

Evaluating Regional Bias in LLMs From Abstract Stereotype to Concrete Social Decision-Making

评估大型语言模型(LLMs)中从抽象刻板印象到具体社会决策的区域偏差

Jiayuan Di, Haoyi Yang, Yufei Luo, Jiahui Qu, Yiming Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究提出S2D框架,评估6个LLMs在34个中国省级行政区的区域偏差,发现其普遍存在且具系统性,推动相关评估与缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26652 2026-07-30 cs.LG 新提交 70%

AIGen: Automating AI Bill of Materials Generation Through Hybrid MLOps Integration

AIGen:通过混合MLOps集成实现AI物料清单的自动化生成

Federica Pepe, Daniele Bifolco, Costantino Martignetti, Aureliano D'Amici, Fabiano Izzo, Damian A. Tamburri, Massimiliano Di Penta

机构 * University of Sannio(萨尼奥大学) Smart Shaped s.r.l.(Smart Shaped有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出AIGen,一种基于MLflow框架、结合挖掘启发式方法与大语言模型的模块化AIBoM生成器,可生成符合SPDX 3.0标准的AI构件清单,助力AI供应链治理合规。

Journal ref 41st IEEE/ACM International Conference on Automated Software Engineering (ASE26) Munich, Germany during October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26604 2026-07-30 cs.CL 新提交 70%

WikiLoop: Jointly Learning to Build and Navigate Agent-Native Wikis with Downstream Feedback

WikiLoop:基于下游反馈联合学习构建与智能体原生Wiki导航

Haoliang Ming, Feifei Li, Wenhui Que

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 WikiLoop是反馈耦合框架,以Qwen3.5-9B为主干,联合学习构建与导航智能体原生Wiki,在AuthTrace等数据集上提升答案正确性,整合两种角色能力且无需特定数据集训练。

Comments 13 pages, 2 figures, 12 tables. Includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26355 2026-07-30 cs.CL 新提交 70%

Symphony of Bias: Exploring Gender Associations with Musical Instruments in Multimodal LLMs

偏见交响曲:探索多模态大语言模型(LLMs)与乐器的性别关联

Farhan Farsi, Shayan Bali, Mohammad Heydari Rad, Negar Heidary, Donya Rooein

机构 * Amirkabir University of Technology(阿米尔卡比尔理工大学) King’s College London(伦敦国王学院) University of Tehran(德黑兰大学) Bocconi University(博科尼大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究推出多模态数据集Symphony-Bias,评估多模态模型在乐器性别关联上的偏见,发现多数结果符合社会研究,契合度随文本、视觉、音频依次减弱。

Comments 32 pages, 23 figures, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26307 2026-07-30 cs.AI cs.SE 新提交 70%

TraceCoder: Explainable and Auditable Code Generation with Position-Key Snippet Versioning

TraceCoder:基于位置键代码片段版本控制的可解释可审计代码生成

Rwaida Alssadi, Muntaser Syed, Balaji Kasula, Lamine Deen, Majed Alotaibi, Mohammed Alghamdi, Tyler Ton, Ali Alqarni, Marius Silaghi

机构 * Florida Institute of Technology(佛罗里达理工学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 TraceCoder通过三种机制实现可解释可审计代码生成,在30项算法编程任务上Mean Chg%达30%,使自动代码生成的内部叙事可审计复现,保障生产部署的信任与问责。

Comments Submitted Version (version submitted on May deadline to AGENTICS 2026). Version of Record to appear in AGENTICS proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26221 2026-07-30 cs.CL 新提交 70%

Characterizing Human-Likeness in AI Generated Poetry: A Zero-shot Classification Study

AI生成诗歌的类人特性表征:一项零样本分类研究

A. N. Biswas, T. Tabassum, A. A. Shohid, R. M. Mou, A. A. Esha, F. Sadeque, A. Ahmed

机构 * BRAC University(BRAC大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出零样本检测流水线,结合人类与AI诗歌数据集,推导影响诗歌分类及误分类的属性,为诗歌可区分性主张提供证据,同时减少训练需求并强化GenAI检测流水线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26200 2026-07-30 cs.CL 新提交 70%

Choosing Where and How to Moderate: End-to-End Trade-offs in Filter Placement and Response Rewriting

选择 moderation 的位置与方式:过滤点与响应重写的端到端权衡

Mengya Hu, Susie Park, Suzana Ilic, Qiong Wei, Sandeep Atluri, Myra Deng, Tucker Fross, Curt Tigges

机构 * Microsoft Responsible AI(微软负责任人工智能部门) Goodfire(古德法尔公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究针对内容审核部署中的过滤点与响应方式,对比不同方案的有用性、有害暴露等指标,发现响应重写可平衡流量恢复与安全,支持按部署约束选择审核配置。

详情

展开后加载摘要…

URL PDF HTML 收藏