arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2707 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 2707 篇

2607.20498 2026-07-24 cs.AI 新提交 77%

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试

Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li

机构 * Renmin University of China(中国人民大学) Anhui University(安徽大学) Z-Lab Z.ai Tsinghua University(清华大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。

Comments 9 pages, accepted by KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20474 2026-07-24 cs.AI 新提交 77%

VeriSimpl: Robust Optimization Modeling from Natural Language using Simplification-based Verification

VeriSimpl:基于简化验证的自然语言鲁棒优化建模

Sumaya Abdul Rahman, Seckhen Ariel Andrade Cuellar, Ghani Raissov, Mohammad Raza

机构 * Gurobi(古罗比) IBM(国际商业机器公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究自然语言到优化建模问题,核心方法是基于简化验证理念,利用优化求解器生成诊断查询让大语言模型推理公式正确性,主要贡献是在优化基准测试中提升准确性并提供高精度自验证信号。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17963 2026-07-21 cs.AI 新提交 77%

OntoExtend: A Framework for Requirement-driven and Scalable Ontology Extension with LLMs

OntoExtend:一个用于基于需求驱动和可扩展的大语言模型本体扩展框架

Anna Sofia Lippolis, Mohammad Javad Saeedizade, Stefan Schmid, Simon Blattner, Robin Keskisärkkä, Aldo Gangemi, Eva Blomqvist, Andrea Giovanni Nuzzolese

机构 * Linköping University(林雪平大学) University of Bologna(博洛尼亚大学) Bosch(博世公司) ISTC-CNR(意大利国家研究委员会信息科学与技术研究所)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究基于需求驱动的本体扩展问题,提出用检索增强生成的OntoExtend框架,通过在相关输入本体和需求上应用该框架,在两个用例的能力问题上评估,结果显示其可作为现实场景中本体扩展起草助手,对问题特异性和建模概要敏感。

Comments Accepted in research track of Semantics 2026: https://2026-eu.semantics.cc/page/accepted_research

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17828 2026-07-21 cs.CL 新提交 77%

When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs

当一个名字并非名字时:低资源语言模型中文化纠缠的孟加拉语同形异义词的基准数据集和提炼推理

Md. Asaduzzaman Shuvo

机构 * United International University(联合国际大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);prompting(abstract);分类 cs.CL

AI总结 研究针对低资源语言模型中孟加拉语同形异义词文化纠缠问题,构建基准数据集。发现模型有主导意义偏差,特定模型失败。提出对比性思维链提示及提炼文化解释,能减少偏差,让小模型正确推理,提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17173 2026-07-21 cs.CL 新提交 77%

KyrgyzLLM-Bench: Benchmarking Kyrgyz Language Understanding

吉尔吉斯语大语言模型基准测试:吉尔吉斯语理解的基准测试

Timur Turatali, Aida Turdubaeva, Rustem Izmailov, Anton M. Alekseev, Sergey I. Nikolenko

机构 * Institute of IT, Kyrgyz State Technical University named after I. Razzakov(以I. 拉扎科夫命名的吉尔吉斯国立技术大学信息技术学院) School of Computer Science, University of Windsor(温莎大学计算机科学学院) St. Petersburg Department of the Steklov Math. Institute, RAS St. Petersburg State University(俄罗斯科学院斯捷克洛夫数学研究所圣彼得堡分部,圣彼得堡国立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 针对吉尔吉斯语大语言模型评估难的问题,利用KyrgyzLLM - Bench基准套件,包含两个本地数据集及多个翻译编辑后的数据集,在零样本和少样本设置下评估26个模型,分析性能等,发布相关资源以支持吉尔吉斯语NLP研究。

Comments Preprint; manuscript currently under consideration at a journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17152 2026-07-21 cs.CR cs.CL 新提交 77%

How Jailbreak Attacks Inform Safety Alignment: A Defender-Centric, Shapley-Based Evaluation of Jailbreak Contributions

越狱攻击如何为安全对齐提供信息:以防御者为中心、基于Shapley值的越狱贡献评估

Yukai Zhou, Feiyang Lu, Xiaokai Mao, Jinfei Liu, Wenjie Wang

机构 * ShanghaiTech University(上海科技大学) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究以防御者为中心评估越狱攻击,提出A - MESS框架,通过AttackSHAP估计攻击效用,在不同场景下实验发现攻击成功率排名与防御者效用弱对齐,有限查询能准确估计,直接优化子集安全效用更强,建议将越狱攻击视为安全改进资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17122 2026-07-21 cs.CL 新提交 77%

Scope3Trace: Evidence-Based Identification and Extraction of Scope 3 GHG Emissions from Sustainability Reports

Scope3Trace:基于证据的可持续发展报告中范围三温室气体排放识别与提取

Siyuan Zheng, Yifan Duan, Chao Xue, Flora D. Salim

机构 * UNSW Sydney(新南威尔士大学悉尼分校)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对范围三温室气体排放分析难题,提出Scope3Trace框架,集成多种技术从ESG和可持续发展报告中提取相关信息,并构建多模态数据集,实现了异构可持续发展披露信息可靠提取与透明整合,且提取精度高。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16175 2026-07-20 cs.CR cs.AI 新提交 77%

Evaluating Open-Weight LLMs for Generating Structured Threat Information for Autonomous Vehicle Vulnerabilities

评估开放权重语言模型用于生成自动驾驶车辆漏洞的结构化威胁信息

Md Erfan, Ahmed Ryan, Md Kamal Hossain Chowdhury, Md Rayhanur Rahman

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 研究自动驾驶车辆漏洞相关结构化威胁信息生成问题,利用开放权重语言模型,通过构建CAV-STIXGen数据集评估11个模型,分析CWE和MITRE ATT&CK共现,展示AI辅助转换可自动化威胁情报并优先防御运输安全。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16001 2026-07-20 cs.CL 新提交 77%

BayesPO: Bayesian Prompt Optimization via Parallel-Tempered Gradient-Guided Discrete MCMC

BayesPO:通过并行回火梯度引导离散MCMC进行贝叶斯提示优化

Junjie Zhou, Zhijian Ou

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究将提示优化作为离散提示令牌上的贝叶斯后验采样问题,提出BayesPO框架,结合任务似然项与语言模型先验定义后验分布,用马尔可夫链蒙特卡罗实例化,实验表明其能发现有意义提示、逃离局部最优并提高准确率,同时揭示了两个主要局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15560 2026-07-20 cs.NE cs.AI 新提交 77%

Evolutionary Algorithm-Guided LLMs for Physics-Informed Neural Network Design

用于物理信息神经网络设计的进化算法引导的大语言模型

Xu Yang, Mingyang Yu, Jing Xu, Keqian Li

机构 * Shanghai Institute of Intelligent Education, East China Normal University, Shanghai(上海智能教育研究所,华东师范大学,上海) College of Artificial Intelligence, Nankai University(人工智能学院,南开大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对物理信息神经网络(PINNs)设计敏感的问题,提出用进化算法引导大语言模型跨代生成可执行配置,经一维波动方程实验验证可行性,能降低均方误差,还揭示了低解误差与高PDE残差可共存等情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15216 2026-07-17 cs.CV cs.AI 新提交 77%

Symbal: Detecting Systematic Misalignments in Model-Generated Captions

Symbal:检测模型生成字幕中的系统性对齐错误

Maya Varma, Jean-Benoit Delbrouck, Sophie Ostmeier, Akshay Chaudhari, Curtis Langlotz

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 研究多模态大语言模型生成图像字幕时的系统性对齐错误检测问题,提出利用现成基础模型的结构化双阶段设置的Symbal方法,引入SymbalBench基准,Symbal在基准上表现出色,可辅助审核MLLM生成的字幕。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15205 2026-07-17 cs.SE cs.AI 新提交 77%

MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization

MM-IssueLoc:用于评估多模态仓库级问题定位中视觉证据的可控基准

Shaoxiong Zhan, Shi Hu, Boyu Feng, Hai Lin, Andrew Gong, Zhengda Zhou, Jiaying Zhou, Yunyun Hou, Hao Su, Hai-Tao Zheng

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究针对仓库级问题定位多为文本任务,视觉证据作用不明的情况,引入MM-IssueLoc基准和评估协议,含多语言实例与标注等。评估LLM和检索系统,发现现有系统距可靠多模态定位有差距,该基准让视觉证据成评估变量,助于后续研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14818 2026-07-17 cs.LO cs.AI 新提交 77%

Can LLMs Build a MaxSAT Solver from Papers? The CoreForge Experience

大语言模型能否根据论文构建最大可满足性求解器?CoreForge 经验

Ruben Martins

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究利用大语言模型从论文构建无权重 MaxSAT 求解器,采用结合论文讨论、代码实现及审核修订的迭代流程,评估特定配置,发现虽未现错误答案,但性能低于手工设计求解器,总结了相关经验教训。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14309 2026-07-17 cs.AI cs.CY 新提交 77%

Traccia: An OpenTelemetry-Based Governance Platform for AI Systems

Traccia:一个基于OpenTelemetry的人工智能系统治理平台

Nutan Kumar Naik, Aditya Kumar Saroj, Vijay Prasad Poudel, Saurav Samantray, Abhishek Patel

机构 * National Institute of Technology Rourkela(鲁尔基国立技术学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型和人工智能驱动智能体发展带来的软件治理问题,提出基于OpenTelemetry构建多层次人工智能治理堆栈Traccia,通过添加遥测数据等解决对齐问题,自动创建合规证据包,为企业管理自主人工智能系统创建机器可读基础。

Comments 26 pages, 2 figures, 3 tables, Declaration of generative AI and AI-assisted technologies in the writing process, Declaration of competing interest

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12619 2026-07-15 cs.AI cs.ET 新提交 77%

Agentic Service-Oriented Computing: A Manifesto for the Next Frontier of Service-Oriented Computing

面向智能体的面向服务计算:面向服务计算新前沿宣言

Amin Beheshti, Rong N. Chang, Boualem Benatallah, Fabio Casati, Schahram Dustdar, Geoffrey Fox, Quan Z. Sheng, Yan Wang, Jian Yang, Albert Zomaya

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 研究LLM驱动的智能体融入复杂工作流面临的挑战,提出面向智能体的面向服务计算(ASOC)。阐述其六个基本原则,组织五维研究议程,旨在将智能体AI从零散演示转变为可靠的基于服务的系统,为新兴领域提供支撑。

Comments Accepted at the 2026 IEEE International Conference on Web Services (ICWS); Corresponding author: Prof. Amin Beheshti; DOI 10.1109/ICWS72778.2026.00163

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11437 2026-07-14 cs.CL 新提交 77%

Relational Positioning as a Measurable Risk Object: History-Carried Lock-in and Self-Confabulation in Multi-Turn Human-AI Dialogue

作为可测量风险对象的关系定位:多轮人机对话中的历史锁定和自我虚构

Jihong Chen

机构 * Beijing Etown Academy(北京亦庄实验中学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究多轮人机对话中大语言模型的关系定位,定义并验证关系定位度量D1,刻画其立场,揭示历史携带锁定和自我虚构两种关系失败模式,通过控制门控和标尺证实,为相关研究提供新认知。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11042 2026-07-14 cs.SE cs.AI 新提交 77%

BackendForge: Benchmarking Agentic End-to-End Code Generation with Backend Services

BackendForge:使用后端服务对智能端到端代码生成进行基准测试

Yuzhe Guo, Mengzhou Wu, Yuan Cao, Jialei Wei, Dezhi Ran, Wei Yang, Tao Xie

机构 * Key Lab of HCST (PKU), MOE(北京大学计算机科学与技术国家重点实验室;软件学院,北京大学) SCS, Peking University(北京通明湖信息技术应用创新中心) Beijing Tongming Lake Information Technology Application Innovation Center (TLAIC)(复旦大学高级计算系统研究所) Fudan University Institute of Systems for Advanced Computing(上海开放计算系统研究所) Shanghai Institute of Systems for Open Computing

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究智能端到端代码生成评估问题,引入BackendForge基准,给定规范和契约让大语言模型生成容器化服务,用测试和代码代理共同进化测试预言机和参考服务,发现当前大语言模型虽能实现部分API行为,但生成完整后端服务仍有困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11026 2026-07-14 cs.CL 新提交 77%

Dimensionality in Satisfaction Ratings

满意度评级中的维度

Andrew Hong, Jason Potteiger

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究用大语言模型注释消费品公司对话文本,分解客户服务满意度为多轴,验证注释与客户自评的关系,发现轴间相关性及共线性,指出分解价值在于归因和覆盖,能识别对话数据中细微的客户体验驱动因素。

Comments 25 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10768 2026-07-14 cs.AI 新提交 77%

Opti-Agent-Bench: Benchmarking End-to-End Optimization R&D Agents on Real-World Business Problems

Opti-Agent-Bench:在实际业务问题上对端到端优化研发智能体进行基准测试

Yongchang Fu, Xinjie Huang, Chengjun Dai, Chengzhe Feng, Junshao Zhang, Hong Zhu

机构 * Ding Talk, Alibaba Group(钉钉,阿里巴巴集团) Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型解决优化问题的现有不足,引入Opti-Agent-Bench基准测试,通过业务语义真实性、模块化评估、ORAC双层有效性框架,在多工业规模任务中揭示当前模型关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10647 2026-07-14 cs.CL 新提交 77%

Knowledge Distillation for Automated AI Tutor Evaluation

用于自动评估人工智能导师的知识蒸馏

Tahmid Al Hannan, Diego Garcia, Alex Njoroge, Suha Al Juboori, Tarek Sakakini

机构 * Folsom Lake College(福尔松湖学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 大语言模型融入教育但缺乏教学质量评估方法,研究引入FATE模型评估人工智能导师,利用前沿大语言模型的知识蒸馏生成额外监督提升评估性能,通过基准测试证明了FATE作为自动评估器的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09510 2026-07-13 cs.SE cs.AI 新提交 77%

Failure as a Process: An Anatomy of CLI Coding Agent Trajectories

失败作为一个过程:CLI编码代理轨迹剖析

Xiangxin Zhao, Han Li, Shuaiting Li, Tianyi Zhao, Earl T. Barr, Federica Sarro, He Ye

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究CLI编码代理失败轨迹,引入面向过程框架,收集并标注大量执行轨迹,发现失败多由认知错误驱动,起始于最初几步且常隐藏,提出提高编码代理可靠性需早期验证和干预,而非仅靠最终结果评估。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08346 2026-07-10 cs.CL q-fin.GN 新提交 77%

Grounded Event Extraction from SEC 8-K Filings with a Fine-Grained Taxonomy

基于细粒度分类法从美国证券交易委员会8-K文件中提取有依据的事件

Rian Dolphin, Joe Dursun, Jarrett Blankenship, Katie Adams, Quinton Pike

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对美国证券交易委员会8-K文件项目代码粗略问题,提出两阶段系统按119种事件类型分类法标记文件。通过模糊n-gram验证和重新评分产出有依据事件标签,经实验验证该系统能有效区分经济上不同的事件,提升事件提取精度。

Comments 9 pages, 8 figures, 1 table. Full dataset and taxonomy available at https://massive.com/docs/rest/stocks/filings/8-k-disclosures?utm_source=research&utm_campaign=8k_tags

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07946 2026-07-10 cs.SE cs.LG 新提交 77%

DeepSWE: Measuring Frontier Coding Agents on Original, Long-Horizon Engineering Tasks

DeepSWE:在原始的、长周期工程任务上评估前沿编码智能体

Wenqi Huang, Charley Lee, Leonard Tng, Serena Ge

机构 * Datacurve

专题命中 评测与基准 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.LG

AI总结 研究针对编码智能体评估,指出多数基准测试存在的问题。提出DeepSWE基准测试,其任务从零编写,用手写验证器评分,能避免相关问题,在区分智能体等方面表现出色,还发布了基准测试等相关内容。

Comments 32 pages, 10 figures. Code and data: https://github.com/datacurve-ai/deep-swe ; https://deepswe.datacurve.ai/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07881 2026-07-10 cs.SE cs.CR cs.LG 新提交 77%

Functional and Secure Code Generation with Task Vectors

使用任务向量进行功能和安全代码生成

Felix Wang, Anudeep Das, Mei Nagappan, N. Asokan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究旨在解决大语言模型生成安全功能代码的问题,提出SecVecCoder方法,利用任务向量生成可信代码,在CodeGuard+基准测试中提升了可信代码完成率,且解码延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06127 2026-07-10 cs.CL 新提交 77%

Measuring the practice of shared-decision making (OPTION12): An Investigation into Open-sourced Smaller LLMs (OS-sLLMs) for Better Privacy and Sustainability

衡量共享决策的实践(OPTION12):对用于更好隐私和可持续性的开源小型语言模型(OS - sLLMs)的调查

Tamara Wit, Lifeng Han, Carly Heipon, David Lindevelt, Anne Stiggelbout, Suzan Verberne

机构 * Leiden University Medical Centre(莱顿大学医学中心) The Leiden Institute of Advanced Computer Science(莱顿高级计算机科学研究所)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 研究利用Observer OPTION12框架,对开源小型语言模型进行共享决策自动评估,聚焦隐私保护与本地部署。通过专家注释临床咨询评估多个模型,发现通用领域模型表现更好,还引入共识框架,为隐私保护的人在回路SDM评估提供基础。

Comments Pilot study. Preliminary findings on open-source smaller LLMs for OPTION12 shared decision-making assessment

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02615 2026-07-10 cs.CR cs.AI cs.SE 新提交 77%

TAG: A Lightweight Framework for Test-Driven Agentic Artifact Generation

代理创建,我们验证:用于代理工件生成的轻量级框架

Yaniv Melamed, Yoni Zukerman, Michal Shechter, Miri Weissler, Ashwin Patil, Hani Neuvirth-Telem

机构 * Microsoft(微软)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究如何用大语言模型生成结构化工件并使其可靠用于生产部署。核心方法是基于“LLMs生成,我们验证”原则构建轻量级框架,贡献是提出含三关键属性的框架并在安全领域验证,还可用于其他工件生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06713 2026-07-09 cs.SE cs.AI 新提交 77%

Reliable and Developer-Aligned Evaluation of Agents for Software Engineering

软件工程中智能体的可靠且与开发者一致的评估

Razvan Mihai Popescu

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对大语言模型驱动智能体评估技术的局限,提出基于实际软件开发实践的综合评估方法,通过污染感知、实际行为评估及轨迹感知基准指标,来弥合差距,实现可靠且与开发者一致的评估。

Comments International Conference on the Foundations of Software Engineering '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05202 2026-07-07 cs.AI 新提交 77%

EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer

EvoAgentBench:通过能力迁移评测智能体自进化的基准平台

Xingze Gao, Chuanrui Hu, Hongda Chen, Pengfei Yao, Zhao Wang, Yi Bai, Zhengwei Wu, Yunyun Han, Xiaofeng Cong, Jie Gui, Yafeng Deng, Teng Li

机构 * Anhui University(安徽大学) EverMind, Shanda Group(盛趣游戏灵眸智能科技) Southeast University(东南大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对现有评测无法分离大语言模型智能体程序性经验迁移的问题,提出跨四领域的EvoAgentBench基准,可将自进化评测转为对经验编码、路由与吸收的细粒度诊断。

Comments 15 pages, 2 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04433 2026-07-07 cs.IR cs.CL 新提交 77%

Autonomous Information Seeking: A Roadmap for Agentic Recommender Systems

自主信息寻求:智能推荐系统路线图

Xinyu Lin, Yashar Deldjoo, Sunhao Dai, Honghui Bao, Xiaopeng Ye, Fatemeh Nazary, Wenjie Wang, Tommaso Di Noia, Jun Xu, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Polytechnic University of Bari(巴里理工大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 综述基于大语言模型的智能体融入推荐系统带来的转变,介绍基于自主性水平的分类法及三种核心范式,分析各范式采用的架构和智能体对关键组件的增强,探讨评估方法及未解决问题,指出开放挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03702 2026-07-07 cs.AI 新提交 77%

Agent Reinforcement Learning via Pivotal-Aware Self-Feedback Retry

通过关键感知自反馈重试的智能体强化学习

Weiyang Guo, Zesheng Shi, Longhui Zhang, Zeen Zhu, Min Zhang, Jing Li

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型智能体在处理失败轨迹时的问题,提出PivoARL框架,通过结构化反思识别关键错误转向并局部重试,减少冗余交互,设计关键感知信用分配机制,实验证明该方法能显著提升性能。

Comments 26pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏