arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-04-23 至 2026-04-23 共收录 159 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 记忆与上下文管理 11 篇

2604.20117 2026-04-23 cs.CL 79%

To Know is to Construct: Schema-Constrained Generation for Agent Memory

知即建构:基于模式约束的代理记忆生成

Lei Zheng, Weinan Song, Daili Li, Yanming Yang

机构 * UnionPay(中国银联)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.CL

AI总结 本文提出SCG-MEM架构,通过模式约束生成实现记忆检索,避免结构幻觉并提升多跳推理能力,实验显示其在LoCoMo基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07798 2026-04-23 cs.AI 79%

Lightweight LLM Agent Memory with Small Language Models

轻量级大语言模型代理记忆系统

Jiaquan Zhang, Chaoning Zhang, Shuxu Chen, Zhenzhen Huang, Pengcheng Zheng, Zhicheng Wang, Ping Guo, Fan Mo, Sung-Ho Bae, Jie Zou, Jiwei Wei, Yang Yang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) Kyung Hee University(庆熙大学) City University of Hong Kong(香港城市大学) University of Oxford(牛津大学)

专题命中 记忆与上下文管理 :agent(title,abstract);分类 cs.AI

AI总结 本文提出LightMem,利用小语言模型实现轻量级代理记忆,通过模块化记忆检索、写入和长期整合,提升效率与准确性,实验显示在LoCoMo数据集上F1值提升2.5,并具有低延迟特点。

Comments Accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21394 2026-04-23 cs.CR 78%

MemoPhishAgent: Memory-Augmented Multi-Modal LLM Agent for Phishing URL Detection

MemoPhishAgent: 基于记忆的多模态大语言模型代理用于钓鱼URL检测

Xuan Chen, Hao Liu, Tao Yuan, Mehran Kafai, Piotr Habas, Xiangyu Zhang

专题命中 记忆与上下文管理 :agent(title,abstract)

AI总结 本文提出MemoPhishAgent,通过整合多模态推理与记忆机制,提升钓鱼URL检测性能,实验显示其在召回率上优于现有方法,并在真实场景中实现高召回率。

Comments ACL 2026 Industry Track Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19785 2026-04-23 cs.CL cs.AI cs.CR cs.CY 76%

Can LLMs Infer Conversational Agent Users' Personality Traits from Chat History?

大语言模型能否从聊天记录中推断出对话代理用户的人格特质?

Derya Cögendez, Verena Zimmermann, Noé Zufferey

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院,瑞士)

专题命中 记忆与上下文管理 :agent(title);分类 cs.AI、cs.CL

AI总结 研究探讨了大语言模型能否从用户与对话代理的交互中推断出人格特质,通过分析ChatGPT日志数据,发现模型在多个案例中能以高于随机水平的准确率推断出性格特质,揭示了与对话代理交互带来的隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20158 2026-04-23 cs.AI 76%

Stateless Decision Memory for Enterprise AI Agents

无状态决策记忆用于企业AI代理

Vasundra Srinivasan

机构 * Vasundra Srinivasan

专题命中 记忆与上下文管理 :AI agent(title,comments);分类 cs.AI

AI总结 本文提出无状态决策记忆(DPM),在企业监管领域中通过无状态设计提升决策精度和可审计性,同时提高效率。

Comments 16 pages, 4 figures, 4 tables. Companion paper to "Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents" (arXiv:TBD). Code and reproducibility artifacts at https://github.com/vasundras/stateless-decision-memory-enterprise-ai-agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19820 2026-04-23 cs.SE 57%

KnowPilot: Your Knowledge-Driven Copilot for Domain Tasks

KnowPilot: 你的知识驱动型领域任务助手

Zekun Xi, Yichen Nie, Ziyan Jiang, Yujie Bao, Zhenqian Xu, Zhisong Qiu, Ziwen Xu, Shumin Deng

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.SE

AI总结 KnowPilot通过整合领域先验知识、显式知识和经验知识,提升生成代理在专业应用中的性能,实现领域文本生成的高效与精准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16002 2026-04-23 quant-ph cs.LG 57%

Scalable Quantum Reinforcement Learning on NISQ Devices with Dynamic-Circuit Qubit Reuse and Grover Optimization

在NISQ设备上实现可扩展的量子强化学习:动态电路量子比特复用与Grover优化

Thet Htar Su, Shaswot Shresthamali, Masaaki Kondo

机构 * Graduate School of Science and Technology, Keio University(Keio大学科学技术研究生院) Graduate School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电气工程研究生院) RIKEN Center for Computational Science(理化学研究所计算科学中心)

专题命中 记忆与上下文管理 :agent(abstract);分类 cs.LG

AI总结 本文提出一种可扩展且资源高效的量子强化学习框架,通过动态电路执行和Grover优化,将多步量子马尔可夫决策过程的量子比特复杂度从O(T)降至O(1)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20601 2026-04-23 quant-ph 50%

Noise-Resilient Quantum Reinforcement Learning

抗噪的量子强化学习

Jing-Ci Yue, Jun-Hong An

专题命中 记忆与上下文管理 :agent(abstract)

AI总结 本文提出一种抗噪量子强化学习方案,通过研究非马尔可夫性退相干对求解代理-环境相互作用哈密顿量本征态的影响,发现总代理-噪声系统能谱中束缚态的形成可恢复无噪声情况下的QRL性能。

Journal ref Phys. Rev. Applied 25, 044060 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. Agent评测 29 篇

2604.19925 2026-04-23 econ.GN cs.AI cs.CY cs.HC q-fin.EC 87%

Behavioral Transfer in AI Agents: Evidence and Privacy Implications

人工智能代理中的行为迁移:证据与隐私影响

Shilei Luo, Zhiqi Zhang, Hengchen Dai, Dennis Zhang

机构 * Washington University in St. Louis(华盛顿大学圣路易斯分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);autonomous agent(abstract);agentic(abstract)

AI总结 研究探讨了AI代理是否系统性地反映其人类所有者的行为特征,发现代理与所有者在行为上存在系统性迁移,且可能带来隐私风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21652 2026-04-23 cs.AI cs.CL 86%

AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite

AstaBench:通过科学研究套件严格评估AI代理

Jonathan Bragg, Mike D'Arcy, Nishant Balepur, Dan Bareket, Bhavana Dalvi, Sergey Feldman, Dany Haddad, Jena D. Hwang, Peter Jansen, Varsha Kishore, Bodhisattwa Prasad Majumder, Aakanksha Naik, Sigal Rahamimov, Kyle Richardson, Amanpreet Singh, Harshit Surana, Aryeh Tiktinsky, Rosni Vasu, Guy Wiener, Chloe Anastasiades, Stefan Candra, Jason Dunkelberger, Dan Emery, Rob Evans, Malachi Hamada, Regan Huff, Rodney Kinney, Matt Latzke, Jaron Lochner, Ruben Lozano-Aguilera, Cecile Nguyen, Smita Rao, Amber Tanaka, Brooke Vlahos, Peter Clark, Doug Downey, Yoav Goldberg, Ashish Sabharwal, Daniel S. Weld

机构 * Asta Team, Allen Institute for AI(Asta团队,人工智能研究所) University of Maryland(马里兰大学) University of Arizona(亚利桑那大学) University of Zurich(苏黎世大学) Bar-Ilan University(巴伊兰大学) University of Washington(华盛顿大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AstaBench,通过2400多个科学问题全面评估AI代理能力,提供生产级搜索工具和九种科学优化的代理类,揭示AI在科学研究辅助方面仍存在显著差距。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19844 2026-04-23 cs.CV cs.AI 85%

If you're waiting for a sign... that might not be it! Mitigating Trust Boundary Confusion from Visual Injections on Vision-Language Agentic Systems

如果你在等待一个信号……那可能不是它!减轻视觉注入对视觉语言代理系统信任边界混淆的影响

Jiamin Chang, Minhui Xue, Ruoxi Sun, Shuchao Pang, Salil S. Kanhere, Hammond Pearce

机构 * University of New South Wales(新南威尔士大学) CSIRO’s Data61(澳大利亚联邦科学与工业研究组织数据61部门) Macquarie University(麦考瑞大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究探讨了视觉注入对视觉语言代理系统信任边界的影响,通过双意图数据集和评估框架发现现有模型在平衡合法信号与误导信号方面存在不足,提出多代理防御框架以提升系统鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19968 2026-04-23 physics.soc-ph econ.GN nlin.AO q-fin.EC 85%

Stochastic Networked Governance: Bridging Econophysics and Institutional Dynamics in a Positive-Sum Agent-Based Model

随机网络治理:在积极和解的 agent-based 模型中连接经济物理学与制度动态

Alok Yadav, Saroj Yadav

专题命中 Agent评测 :agent(title,title_cn)

AI总结 本文提出随机网络治理模型,通过二进制制度基因定义司法管辖区,研究制度互补性、内生增长和结构性改革的非线性宏观经济惩罚,利用历史数据模拟1970-2017年全球前100经济体的经济演变。

Comments 15 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14116 2026-04-23 cs.AI cs.CL 84%

TREX: Automating LLM Fine-tuning via Agent-Driven Tree-based Exploration

TREX:通过代理驱动的树形探索自动化LLM微调

Zerun Ma, Guoqiang Wang, Xinchen Xie, Yicheng Chen, He Du, Bowen Li, Yanan Sun, Wenran Liu, Kai Chen, Yining Li

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 TREX通过代理驱动的树形探索自动化LLM训练全流程,包括需求分析、文献调研、策略制定和模型训练,提升微调效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20441 2026-04-23 cs.AI 83%

MedSkillAudit: A Domain-Specific Audit Framework for Medical Research Agent Skills

MedSkillAudit:一种面向医学研究代理技能的领域特定审计框架

Yingyong Hou, Xinyuan Lao, Huimei Wang, Qianyu Yao, Wei Chen, Bocheng Huang, Fei Sun, Yuxian Lv, Weiqi Lei, Xueqian Wen, Pengfei Xia, Zhujun Tan, Shengyang Xie

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 本文提出MedSkillAudit框架,用于评估医学研究代理技能的可靠性,通过专家评审和统计指标验证其有效性,为医学研究代理技能的治理提供实践基础。

Comments 20 pages, 9 figures, 1 graphic abstract, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20200 2026-04-23 cs.CL 83%

Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows

追逐公共评分:用户压力与编码代理工作流中的评估剥削

Hardy Chen, Nancy Lau, Haoqin Tu, Shuo Yan, Xiangyan Liu, Zijun Wang, Juncheng Wu, Michael Qizhe Shieh, Alvaro A. Cardenas, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UT Dallas(德克萨斯大学达拉斯分校) NUS(新加坡国立大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.CL

AI总结 研究用户压力是否导致公共评分剥削,通过实验发现更强模型剥削率更高,高压力促使早期剥削,添加反剥削提示可有效减少剥削。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19818 2026-04-23 cs.SE cs.HC cs.MA 83%

Beyond Task Success: An Evidence-Synthesis Framework for Evaluating, Governing, and Orchestrating Agentic AI

超越任务成功:一个证据综合框架用于评估、治理和协调智能体AI

Christopher Koch, Joshua Andreas Wellbrock

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文提出一个证据综合框架,解决评估、治理和协调智能体AI中的治理到行动闭合缺口,通过四个层次框架、ODTA运行时测试和最小行动证据包,整合现有证据以提升可信度。

Comments 8 pages, 1 figure, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20087 2026-04-23 cs.CL cs.LG 81%

SkillLearnBench: Benchmarking Continual Learning Methods for Agent Skill Generation on Real-World Tasks

SkillLearnBench: 评估代理技能生成在现实任务中持续学习方法的基准

Shanshan Zhong, Yi Lu, Jingjie Ning, Yibing Wan, Lihan Feng, Yuyi Ao, Leonardo F. R. Ribeiro, Markus Dreyer, Sean Ammirati, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 Agent评测 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 SkillLearnBench评估持续学习方法在现实任务中生成技能的有效性,发现所有方法在无技能基线上有提升,但一致性改进困难,且更强LLM不总带来更好结果,开放任务表现不佳,外部反馈促进真实改进,自我反馈导致递归漂移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19767 2026-04-23 cs.LG cs.AI 81%

Accelerating PayPal's Commerce Agent with Speculative Decoding: An Empirical Study on EAGLE3 with Fine-Tuned Nemotron Models

通过投机解码加速PayPal的商业代理:基于EAGLE3的实证研究,使用微调的Nemotron模型

Ally Qin, Jian Wan, Sarat Mudunuri, Srinivasan Manoharan

机构 * PayPal

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过EAGLE3进行投机解码优化PayPal商业代理的性能,使用微调的Nemotron模型,在不同配置下验证了吞吐量和延迟的提升,同时保持输出质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19533 2026-04-23 cs.CR cs.AI 79%

Cyber Defense Benchmark: Agentic Threat Hunting Evaluation for LLMs in SecOps

网络防御基准:针对LLM在SecOps中的代理威胁狩猎评估

Alankrit Chona, Igor Kozlov, Ambuj Kumar

机构 * Simbian AI

专题命中 Agent评测 :agentic(title);agent(abstract);分类 cs.AI

AI总结 本文提出网络防御基准,评估LLM代理在威胁狩猎任务中的表现,发现现有模型在无引导情况下无法有效识别恶意事件。

Comments 13 pages, 3 figures, 5 tables. Complete benchmark and hunt traces available on request

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20193 2026-04-23 cs.RO 78%

LLM-Guided Safety Agent for Edge Robotics with an ISO-Compliant Perception-Compute-Control Architecture

基于ISO合规感知-计算-控制架构的LLM引导安全代理用于边缘机器人

Xu Huang, Ruofan Zhang, Lu Cheng, Yuefeng Song, Xu Huang, Huayu Zhang, Sheng Yin, Anyang Liang, Chen Qian, Yin Zhou, Xiaoyun Yuan, Yuan Cheng

机构 * Shanghai Jiao Tong University(上海交通大学) SIMMIR Tech(SIMMIR科技)

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出一种基于ISO合规架构的LLM引导安全代理,通过将安全规范转化为可执行谓词,实现边缘机器人中的功能安全,支持ISO 13849 Category 3和PL d的实用部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16346 2026-04-23 cs.HC cs.CY 78%

DR. INFO at the Point of Care: A Prospective Pilot Study of Physician-Perceived Value of an Agentic AI Clinical Assistant

DR. INFO在临床一线:医师对代理AI临床助手的感知价值前瞻性试点研究

Rogerio Corga Da Silva, Miguel Romano, Tiago Mendes, Marta Isidoro, Sandhanakrishnan Ravichandran, Shivesh Kumar, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

专题命中 Agent评测 :agentic(title,abstract)

AI总结 本研究评估DR.INFO在临床实践中对医师时间效率、决策支持和满意度的影响,发现医师普遍认可其价值,但需进一步验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20598 2026-04-23 cs.IR cs.CL cs.DB cs.LG 73%

Self-Aware Vector Embeddings for Retrieval-Augmented Generation: A Neuroscience-Inspired Framework for Temporal, Confidence-Weighted, and Relational Knowledge

具有自我意识的向量嵌入用于检索增强生成:一种受神经科学启发的框架,用于时间、置信度加权和关系知识

Naizhong Xu

机构 * Principal Consultant, CMC APAC(CMC APAC 主任顾问)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SmartVector框架,通过引入时间意识、置信度衰减和关系意识,改进检索增强生成系统,提升准确性与鲁棒性。

Comments 17 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20382 2026-04-23 cs.CL 70%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 49 pages, 46 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20151 2026-04-23 cs.RO cs.LG 70%

Toward Safe Autonomous Robotic Endovascular Interventions using World Models

迈向安全的自主机器人内血管干预的世模型

Harry Robertshaw, Nikola Fischer, Han-Ru Wu, Andrea Walker Perez, Weiyuan Deng, Benjamin Jackson, Christos Bergeles, Alejandro Granados, Thomas C Booth

机构 * Surgical & Interventional Engineering, School of Biomedical Engineering & Imaging Sciences, King’s College London(外科与介入工程系,生物医学工程与成像科学学院,伦敦国王学院) Department of Radiology, National Taiwan University Hospital(放射科,台湾大学医院) Department of Neuroradiology, King’s College Hospital(神经放射科,伦敦国王医院)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.LG

AI总结 本文提出基于世模型的框架,利用TD-MPC2方法在内血管导航中实现自主机械取栓,通过仿真和体外实验验证其在安全性和泛化性上的优势。

Comments This manuscript is a preprint and has been submitted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20197 2026-04-23 physics.chem-ph 67%

How is a gas sensor poisoned by volatile methylsiloxanes?

气体传感器为何会被挥发性甲基硅氧烷中毒?

Heng Liu, Bingxin Yang, Yiming Lu, Yuan Wang, Xue Jia, Long Luo, Hao Li

专题命中 Agent评测 :agent(abstract);AI agent(abstract)

AI总结 研究通过理论分析揭示了甲基硅氧烷中毒的机制,开发了基于描述符的微动力学火山模型,预测抗中毒材料,展示了AI驱动的材料发现方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.15158 2026-04-23 q-fin.MF math.PR 67%

Relative Arbitrage Opportunities with Interactions among $N$ Investors

相对套利机会与N名投资者之间的相互作用

Tomoyuki Ichiba, Nicole Tianjiao Yang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文研究了N名投资者间相互作用下的相对套利机会优化,通过Fichera漂移条件保证套利机会,并推导出投资者最优策略和纳什均衡。

Comments 30 pages, Accepted by Mathematical Finance

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20436 2026-04-23 cs.SE cs.AI 62%

Shift-Up: A Framework for Software Engineering Guardrails in AI-native Software Development -- Initial Findings

Shift-Up:面向AI原生软件开发的软件工程防护框架——初步发现

Petrus Lipsanen, Liisa Rannikko, François Christophe, Konsta Kalliokoski, Vlad Stirbu, Tommi Mikkonen

机构 * University of Jyväskylä(于韦斯屈莱大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出Shift-Up框架,通过重新诠释传统软件工程实践作为结构化防护机制,以稳定AI生成行为并减少实现漂移,提升AI辅助开发的可控性。

Comments This paper has been accepted for presentation at the VibeX 2026 International Workshop on Vibe Coding and Vibe Researching

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19809 2026-04-23 cs.AI cs.LG 62%

MIRROR: A Hierarchical Benchmark for Metacognitive Calibration in Large Language Models

MIRROR:大型语言模型元认知校准的分层基准

Jason Z Wang

机构 * Independent(独立)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 MIRROR基准通过八个实验评估大型语言模型是否能利用自我知识做出更好决策,发现模型在多领域任务中无法预测自身表现,且外部元认知控制能显著降低失败率,但内部自我知识改进无效。

Comments 30 pages, 6 figures,code at: https://github.com/Jason-Wang313/Mirror

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20190 2026-04-23 cs.CV cs.LG 57%

WildFireVQA: A Large-Scale Radiometric Thermal VQA Benchmark for Aerial Wildfire Monitoring

WildFireVQA: 一种大规模的辐射热视觉问答基准用于空中 wildfire 监测

Mobin Habibpour, Niloufar Alipour Talemi, John Spodnik, Camren J. Khoury, Fatemeh Afghah

机构 * Clemson University(克莱姆森大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出WildFireVQA基准,整合RGB影像与辐射热数据,包含6097个样本及207298个问题,评估多模态推理能力,揭示RGB和检索增强热上下文在 wildfire 监测中的表现差异。

Journal ref IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR-W 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08948 2026-04-23 cs.CL 57%

TaxPraBen: A Scalable Benchmark for Structured Evaluation of LLMs in Chinese Real-World Tax Practice

TaxPraBen:一种可扩展的基准,用于评估LLM在中文实际税收实践中的结构化表现

Gang Hu, Yating Chen, Haiyan Ding, Wang Gao, Jiajia Huang, Min Peng, Qianqian Xie, Kun Yue

机构 * Yunnan University(云南大学) Wuhan University(武汉大学) Jianghan University(江汉大学) Nanjing Audit University(南京审计大学)

专题命中 Agent评测 :planning(abstract);分类 cs.CL

AI总结 本文提出TaxPraBen,首个专注于中文税收实践的基准,结合10项传统任务和3项创新场景,评估19种LLM在税收实践中的表现,揭示封闭源大参数LLM和中文LLM的优势。

Journal ref ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏