arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-07-24 至 2026-07-24 共收录 37 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 37 篇

2607.21019 2026-07-24 cs.AI cs.CL cs.HC cs.MA cs.SE 新提交 85%

HiMe: Real-Time Self-Hosted Personal Agent Platform for Health Insights with Wearable Devices

HiMe:用于健康洞察的实时自托管个人代理平台与可穿戴设备

Wei Liu, Siya Qi, Linhai Zhang, Lorainne Tudor Car, Yulan He

机构 * King’s College London(伦敦国王学院) The Alan Turing Institute(艾伦·图灵研究所)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 针对传统可穿戴健康信号分析的局限,HiMe提出本地可部署、隐私至上的代理平台,遵循数据库为一等组件等原则,能与多种可穿戴设备实时健康数据生态系统兼容,实现个人持续、个性化健康监测以提升幸福感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20478 2026-07-24 cs.SE cs.AI 新提交 84%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20527 2026-07-24 cs.AI 新提交 83%

Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis

评估和保障智能科学合成中的引用忠实性

Taewan Goo, Junsik Kim, Kyulhee Han, GwonYul Jo, Jong-Soo Kim, Tae-Hyung Kim

机构 * Seoul National University(首尔国立大学) BioNexus(生物 Nexus)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究智能语言模型系统引用答案检查的可靠性问题,提出黄金锚定评估协议和可部署防护措施,能验证验证者、测量重新归因,为无支撑引用设限,经多模型和管道验证后作为单GPU工具包发布。

Comments 20 pages, 5 figures. Includes supplementary material (Appendices S1-S6). Open single-GPU reproducibility kit included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20468 2026-07-24 cs.AI 新提交 83%

InferenceBench: A Benchmark for Open-Ended LLM Inference Optimization by AI Agents

InferenceBench:用于通过人工智能代理进行开放式大语言模型推理优化的基准测试

Jehyeok Yeon, Ben Rank, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen, Max Planck Institute for Intelligent Systems, Tübingen AI Center(图宾根ELLIS研究所、马克斯·普朗克智能系统研究所、图宾根人工智能中心)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 研究旨在为开放式大语言模型推理优化建立基准测试InferenceBench,让代理部署推理服务器优化推理速度。通过多种场景和配置测试,发现代理虽能提升性能,但仍有局限,瓶颈在于提出多样配置等能力,反映了代理在开放式环境中的操作能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11666 2026-07-24 cs.CL cs.AI cs.LG 版本更新 82%

Playing Along: Learning a Double-Agent Defender for Belief Steering via Theory of Mind

扮演:通过理论思维学习双代理守护者以实现信念引导

Hanqi Xiao, Vaidehi Patil, Zaid Khan, Hyunji Lee, Elias Stengel-Eskin, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 本文提出ToM-SB挑战,通过强化学习训练双代理模型以提升信念引导和理论思维能力,结果显示结合两者奖励的模型在对抗任务中表现更优。

Comments First two authors contributed equally. Code: https://github.com/The-Inscrutable-X/AIDoubleAgentDefenders

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15114 2026-07-24 cs.MA 版本更新 82%

From Who They Are to How They Act: Behavioral Traits in Generative Agent-Based Models of Social Media

从他们是谁到他们如何行动:生成式基于代理的社会媒体模型中的行为特征

Valerio La Gatta, Gian Marco Orlando, Marco Perillo, Ferdinando Tammaro, Vincenzo Moscato

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract)

AI总结 本文提出通过行为特征显式表征代理行为,以生成更真实的社交媒体参与模式和内容传播动态。

Comments Accepted at The International AAAI Conference on Web and Social Media (ICWSM) 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20498 2026-07-24 cs.AI 新提交 81%

AISE-Bench: A Full-Cycle Curated Benchmark for Information Seeking on Academic Knowledge Graphs

AISE-Bench:用于学术知识图谱信息检索的全周期精选基准测试

Fanjin Zhang, Zhengyang Wang, Ruixuan Huang, Kefan Zhang, Amy Xin, Yuanchun Wang, Shu Zhao, Evgeny Kharlamov, Jie Tang, Juanzi Li

机构 * Renmin University of China(中国人民大学) Anhui University(安徽大学) Z-Lab Z.ai Tsinghua University(清华大学) Bosch Center for AI(博世人工智能中心) University of Oslo(奥斯陆大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);planning(abstract);workflow(abstract)

AI总结 研究针对学术知识图谱信息检索基准测试不足的问题,引入AISE-Bench,通过定制工作流程和综合评估协议构建基准测试,为多步API使用的大语言模型智能体提供新测试平台,助力评估与改进。

Comments 9 pages, accepted by KDD 2026

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD '26), August 09-13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20911 2026-07-24 cs.CL cs.SE 新提交 81%

Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

腾讯工作伙伴基准测试:一个具有抗污染任务构建的多领域编码智能体基准测试

Tencent WorkBuddy Bench Team, Siqi Cai, Shaopeng Chen, Xiang Fei, Yong Mao, Zihan Xu, Zhiheng Lyu, Zhijian Shao, Yuchen Shi, Shuwen Zhang, Chaofan Qiu, Linjie Che, Xiaoxi Zhao, Feng Wu, Kai Zhang, Chaofan Zhu, Yubin Qi, Xiaoyun Liang, Peijie Dong, Yunhao Zhang, Yuanjie Zhu, Ling Jiang, Xianjun Zhang, Zhehang Chu, Anyuan Sang, Zhen Feng, Sen Nie, Shi Wu, Yuanzhen Xu, Xin Li, Ning Yang, Zhiqiang Dong, Hande Dong, Qiang Lin, Yi Liu, Yunsheng Wu, Ke Li, Xing Sun

机构 * Tencent(腾讯) Youtu Lab(腾讯优图实验室) Keen Security Lab(腾讯安全科恩实验室) Workbuddy(腾讯工作伙伴) Yunding Security Lab(腾讯云鼎实验室)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.SE

AI总结 介绍腾讯工作伙伴基准测试这一多领域编码智能体评估套件,核心是统一评估框架,任务经反向设计防污染,数据集公开,四个子集探测工作不同方面,以统一格式和协议运行,还给出跨模型排行榜。

Comments 30 pages, 9 figures. Project page: https://workbuddybench.com/ ; code: https://github.com/Tencent/workbuddy-bench ; dataset: https://huggingface.co/datasets/tencent/workbuddy-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21051 2026-07-24 cs.CL 新提交 79%

Sample-Efficient Learning from Agent Experience

从智能体经验中进行高效样本学习

Chenhui Gou, Haoqin Tu, Yunhao Fang, Jianfei Cai, Hamid Rezatofighi

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 研究现实世界中智能体学习受环境交互限制的问题,提出“经验蒸馏”,开发无需额外环境交互的实现方法,实验表明该方法能高效保留上下文学习收益,相比经典方法减少环境样本使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20518 2026-07-24 cs.AI 新提交 79%

CANN Bench: Benchmarking Agent Generated Kernels against Real NPU and Algorithmic Limits

CANN基准测试:针对真实NPU和算法限制对代理生成的内核进行基准测试

Xue-Jian Gao, Deng Pan, Yueming Su, Jiasheng Li, Bin Du, Fengming Zhu, Chengdi Ma, Junyi Fan, Qichen Liao, Chengqiu Hu, Xinxian Chen, Lingchao Zheng, Jun Li, Jiwei Yang, Yuwei Fan

机构 * Huawei(华为)

专题命中 Agent评测 :agent(title);AI agent(abstract);分类 cs.AI

AI总结 研究针对人工智能代理生成的算子内核在Ascend NPU上缺乏通用评估基线的问题,提出CANN Bench基准测试,涵盖多算子和测试用例,采用三维加权综合评分,为Ascend生态系统提供评估算子编写能力的标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20121 2026-07-24 cs.CL 版本更新 79%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11149 2026-07-24 cs.AI 版本更新 79%

The Hidden Footprint: Making Storage a First-Class Metric for LLM Agent Evaluation

隐藏的足迹:使存储成为大语言模型智能体评估的头等指标

Chenglin Yu, Hongquan Gui, Ying Yu, Tao Zeng, Ming Li

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI

AI总结 研究大语言模型智能体运行后磁盘持久数据评估问题,引入AgentFootprint基准测试,通过序列化感知度量套件测量多方面指标,解决测量陷阱,给出不同配置差异及存储优化结果,确立持久存储为资源指标。

Comments 17 pages, 5 figures; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20845 2026-07-24 math.OC 新提交 78%

Mean field and N-agent games for optimal relative consumption-investment with jump risk and common noise

具有跳跃风险和共同噪声的最优相对消费-投资的平均场和N-主体博弈

Yiming Jiang, Fuxing Li, Yawei Wei, Zimeng Zheng

专题命中 Agent评测 :agent(title,abstract)

AI总结 研究N主体博弈中的最优消费-投资问题,利用随机最大值原理刻画平均场均衡,通过数值实验说明结果及金融含义,还基于此构建N主体博弈的近似纳什均衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20531 2026-07-24 cs.AI 新提交 77%

DynamicMCPBench: A Trace-Grounded, Effect-Scored Benchmark for LLM Agents over Live MCP Servers

DynamicMCPBench:用于实时MCP服务器上的大语言模型智能体的基于轨迹的效果评分基准测试

Jerzy Kamiński, Ilya Galyukshev, Artem Kuznetsov, Sergey Chuprin, Kirill Redko, Aidar Shumbalov, Anna Kalyuzhnaya

机构 * ITMO University(俄罗斯圣彼得堡国立信息技术机械与光学大学)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);agentic(abstract);分类 cs.AI

AI总结 研究针对LLM智能体在MCP服务器上的评估基准问题,提出DynamicMCPBench框架,能生成目标、追踪轨迹并按效果评分。大规模测试发现智能体处理长多步任务能力不足,且该框架可重复运行,人工验证其自动评分可靠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22952 2026-07-24 cs.SE 版本更新 77%

Sifting the Noise: A Comparative Study of LLM Agents in Vulnerability False Positive Filtering

筛选噪声:LLM代理在漏洞假阳性过滤中的比较研究

Yunpeng Xiong, Ting Zhang

专题命中 Agent评测 :agent(abstract,abstract_cn);agentic(abstract);分类 cs.SE

AI总结 本文比较了三种先进的LLM代理框架在漏洞假阳性过滤中的性能,展示了LLM代理在减少SAST噪声方面的有效性,但指出其效果依赖于模型和漏洞类型,且存在计算成本差异。

Comments To appear in Proceedings of the 35th ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20505 2026-07-24 cs.RO cs.LG 新提交 70%

HERMES: Heterogeneous Edge-Relational Multi-Head Embedded SSM Attention for Traffic Conflict Prediction at Signalized Intersections

HERMES:用于信号交叉口交通冲突预测的异构边缘关系多头嵌入式SSM注意力模型

Md Monzurul Islam, Subasish Das

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.LG

AI总结 研究针对交通冲突预测,提出HERMES异构边缘关系图神经网络,利用特定关系注意力等方法,在多指标上表现优异,优于基线模型,联合训练提升目标站点性能,为信号交叉口路边安全监测提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20645 2026-07-24 cs.CL cs.AI cs.LG 新提交 67%

Frontier Financial Judgement: Can agents tell what might move a stock?

前沿金融判断:智能体能否判断哪些因素会推动股票走势?

Joshua Harris

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究引入前沿金融判断基准,结合多种文章创建评估项目,让智能体区分金融信息。最强智能体匹配率仅52.4%,智能体在误报率等方面有显著差异,且在多方面存在权衡,阻碍新闻流过滤在实践中的可靠部署。

Comments 19 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21533 2026-07-24 quant-ph 新提交 67%

Benchmarking Agents for Proving Theorems in Quantum Algorithms and Quantum Information

量子算法和量子信息定理证明智能体的基准测试

Lei Zhang, Yusheng Zhao, Yimeng Cao, Ranyiliu Chen, Mingrui Jing, Jizhe Lai, Ziao Tang, Jingu Xie, Hongshun Yao, Xuanqiang Zhao, Guocheng Zhen, Chengkai Zhu, Xin Wang

专题命中 Agent评测 :AI agent(abstract);agentic(abstract)

AI总结 研究人工智能智能体在量子算法和信息定理证明的能力,引入两个Lean 4基准测试,在通用框架下评估四个模型,发现LAD可提升性能,揭示智能体证明弱点及模型成本差异,为开发更优证明智能体提供基线。

Comments 22 pages, including appendix; 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20510 2026-07-24 cs.AI cs.CL 新提交 62%

Telco-GAIA: Bilingual Benchmark for Agents in Telecom Domain

电信-GAIA:电信领域智能体的双语基准测试

Dmitrii Khizbullin, Zaid Alyafeai, Abdelrahman Eldesokey, Nourah AlSultan, Raghad Alshalan, David R. Pugh, Bernard Ghanem

机构 * King Abdullah University of Science and Technology (KAUST)(阿卜杜拉国王科技大学) stc(沙特电信公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 介绍电信-GAIA双语多模态基准测试,含100个人工验证问答任务,需多跳推理,跨越多种异构源。以沙盒化Docker环境提供,通过规范化精确字符串匹配评分。评估发现其具有挑战性,为企业智能体提供测试平台和构建基准测试的模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20465 2026-07-24 cs.LG cs.CL 新提交 62%

DataPrep-Bench: Benchmarking LLMs as Training Data Preparators

数据准备基准:评估作为训练数据准备者的大语言模型

Hao Liang, Qifeng Cai, Yibo Lin, Jianzhuo Du, Qifeng Xia, Sizhe Qiu, Linzhuang Sun, Meiyi Qiang, Zhaoyang Han, Xiaochen Ma, Bohan Zeng, Ruichuan An, Conghui He, Wentao Zhang

机构 * Peking University(北京大学) Institute for Advanced Algorithms Research(先进算法研究院) OriginHub Technology(源创科技)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 研究LLMs作为训练数据准备者的表现,引入DataPrep - Bench统一基准,涵盖数据构建与质量评估,在多领域和模型上评估,发布相关智能体和评估器,为衡量LLM驱动数据准备能力提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21400 2026-07-24 cs.RO cs.AI 新提交 57%

VoLN: Vision-Only Long-Horizon Navigation---Paradigm, Benchmark, and Method

VoLN:仅视觉的长距离导航——范式、基准和方法

Jiabin Lou, Haopeng Wang, Yuanshuai Wang, Xinyu Liu, Xuxin Lv, Yuxin Guo, Lei Huang, Rongye Shi, Wenjun Wu

机构 * Beihang University(北京航空航天大学) Hangzhou International Innovation Institute, Beihang University(北京航空航天大学杭州国际创新研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究提出仅视觉的长距离导航(VoLN)范式,通过VoLN-UAV基准及VoLN-MLLM基线进行实例化。在五个环境测试未见分割中评估,揭示了长距离导航在证据整合、目标匹配和闭环稳定性方面的挑战。

Comments 10 pages, 7 figures, 2 tables. Project page: https://admire-ljb.github.io/VoLN-UAV/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20916 2026-07-24 cs.AI cs.DL 新提交 57%

Traceable Scholarship: Page Anchors and Ariadne's Thread for Humanistic Inquiry in the Age of Generative AI

可追溯的学术研究:生成式人工智能时代人文探究的页面锚点与阿里阿德涅之线

Deyu Jing

机构 * Fudan University(复旦大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对生成式人工智能时代人文研究中解释缺乏明确依据的问题,提出可追溯学术研究,介绍页面锚点等方法及AIH-Infra参考实现,通过案例研究展示其作用,确保人文研究在该时代保持公开可反驳。

Comments 33 pages, 8 tables. This paper proposes a normative and infrastructural framework for traceable, AI-assisted humanistic research and presents an auditable Kant case study

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20872 2026-07-24 cs.CL 新提交 57%

LegalCiteTrust: Benchmarking Citation Trustworthiness in Chinese Long-Form Legal Research Reports

LegalCiteTrust:评估中文长篇法律研究报告中引用可信度的基准

Yunhan Li, Mingjie Xie, Zeyang Shi, Gengshen Wu, Min Yang

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Southern University of Science and Technology(南方科技大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 研究旨在评估中文长篇法律研究报告引用可信度,引入LegalCiteTrust基准,含72个任务并从三个维度评估。通过实验发现不同系统表现各异,检索工具与基于E/F/A的修订效果不同,强调可靠法律研究生成需检索后的引用感知证据治理。

Comments 8 pages, 21 pages with appendix, 26 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20549 2026-07-24 cs.LG cs.RO cs.SY eess.SY 新提交 57%

SevDiff: Severity-Conditioned Diffusion for Long-Tail Conflict Trajectory Generation

SevDiff:用于长尾冲突轨迹生成的严重程度条件扩散

Eni Solomon Laughter

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 研究针对ADAS评估中冲突轨迹罕见及现有方法不足的问题,提出SevDiff严重程度条件扩散模型,以TTC值为调节信号生成配对轨迹,经训练在不同TTC目标下有高命中率,生成特征物理合理,命中率下降模式可精确表征生成器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20528 2026-07-24 cs.AI 新提交 57%

PromptPack: Scaling LLM Annotation Agents for Online Recommendation

PromptPack:扩展用于在线推荐的大语言模型注释代理

Sebastian Koralewski, Merwan Barlier, Yulia Stolin, Blaž Škrlj

机构 * Teads Inc.(缇德思公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究在线推荐平台用LLMs提取广告素材特征时按创意提示成本高的问题,提出可扩展的PromptPack代理,通过上下文内批处理等实现扩展,经实验评估,相比基线,它大幅降低成本、提高吞吐量且保留AUC。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20431 2026-07-24 cs.CL cs.IR 新提交 57%

Skill-Contracted Agents for Evidence-Aware Materials Literature Analysis

用于证据感知材料文献分析的技能收缩代理

Bixuan Li, Yu Liu, Shuo Shi, Xiaoya Huang, Peng Kang, Lei Zheng

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对材料科学文献分析难题,提出技能驱动的AlphaAgent框架,通过明确技能契约解耦任务。其含专门检索技能和报告生成技能,在盲评中显著优于基线系统,提升了文献分析效果。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19747 2026-07-24 cs.CL 版本更新 57%

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

超越以相关性为中心的检索:面向评分标准的文档集选择与排序

Kailin Jiang, Lei Liu, Jian Xi, Hui Xu, Junlin Liu, Baochen Fu, Bin Li, Vichwang, Yu Lu, Haibo Shi

机构 * University of Science and Technology of China(中国科学技术大学) Yuanbao Team, Tencent(腾讯元宝团队) University of Chinese Academy of Sciences(中国科学院大学) Shandong University(山东大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.CL

AI总结 研究针对大语言模型和人工智能代理对搜索结果质量需求,提出评估-诊断-优化框架。设计SetwiseEvalKit评估基准,评估多种重排器。在此基础上提出Rubric4Setwise方法,无需训练,能以更少文档和搜索轮次实现最佳下游生成性能,验证了闭环有效性。

Comments Project Page: https://rubric4setwise.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26856 2026-07-24 q-bio.NC cs.AI cs.RO 版本更新 57%

The Sensation Modulating Network:Haltability as the architectural ground for object-directed phenomenology

感觉调节网络:可停性作为对象导向现象学的架构基础

G. Nagarjuna, Durgaprasad Karnam

机构 * Indian Institute of Science Education and Research (IISER) Pune(印度科学教育与研究学院(IISER)浦那) Centre for Educational Technology (CET), Indian Institute of Technology Bombay(教育技术中心(CET),印度理工学院孟买)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出感觉调节网络(SMN)作为具身认知的架构,通过对手动力学和可停性机制,将对象导向现象学(胡塞尔意义)的意向性建立在身体组织的结构特征上,从而调和认知主义与4E认知的争论。

Comments 51 pages, main body 39 pages + References 6 pages, Appendices 6 pages, Tables 3, and Figures 16

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16884 2026-07-24 cs.CL 57%

Do Large Language Models know who did what to whom?

大语言模型是否知道谁对谁做了什么?

Joseph M. Denning, Xiaohan Hannah Guo, Bryor Snefjella, Idan A. Blank

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究发现大语言模型能够提取句子中的主题角色,但这种信息对它们的表示影响较弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.04584 2026-07-24 cs.AI cs.SY eess.SY 57%

Navigating Assistance System for Quadcopter with Deep Reinforcement Learning

四旋翼避障导航辅助系统基于深度强化学习

Tung-Cheng Wu, Shau-Yin Tseng, Chin-Feng Lai, Chia-Yu Ho, Ying-Hsun Lai

机构 * National Cheng Kung University(国立成功大学) Research Laboratories(研究实验室) Industrial Technology Research Institute(工业技术研究 institutes) Department of Computer Science(计算机科学系) Information Engineering(信息工程系) National Taitung University(国立台东大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出了一种基于深度强化学习的四旋翼避障导航辅助系统,通过两个功能模块分别实现路径导航和碰撞避障,实验表明该方法在500次飞行中碰撞率为14%。

Comments conference

详情

展开后加载摘要…

URL PDF HTML 收藏