arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-03-31 至 2026-03-31 共收录 214 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 33 篇

2504.06188 2026-03-31 cs.AI cs.CL cs.MA 84%

SkillFlow: Scalable and Efficient Agent Skill Retrieval System

SkillFlow:可扩展且高效的智能体技能检索系统

Fangzhou Li, Pagkratios Tagkopoulos, Ilias Tagkopoulos

机构 * University of California, Davis(加州大学戴维斯分校) USDA/NSF AI Institute for Next Generation Food Systems(美国农业部/国家科学基金会下一代食品系统人工智能研究所) Process Integration and Predictive Analytics(过程集成与预测分析)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI、cs.CL

AI总结 SkillFlow通过多阶段检索流程提升智能体技能检索效率,实现在SkillsBench上Pass@1提升78.3%,但Terminal-Bench显示检索效果受限于技能库质量

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26710 2026-03-31 cs.IR cs.AI cs.CL cs.MA 84%

Agentic AI for Human Resources: LLM-Driven Candidate Assessment

面向人力资源的代理AI:基于大语言模型的候选人评估

Kamer Ali Yuksel, Abdul Basit Anees, Ashraf Elneima, Sanjika Hewavitharana, Mohamed Al-Badrashiny, Hassan Sawaf

机构 * aiXplain, Inc.(aiXplain公司)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一个模块化且可解释的框架,利用大语言模型自动化招聘中的候选人评估。系统整合多种来源生成结构化评估报告,采用LLM生成的评分标准和多代理架构进行细粒度评估,输出透明、可审计的评估报告和推荐。

Comments Published in 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026)

Journal ref 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26682 2026-03-31 cs.HC cs.AI cs.CY 83%

Operationalizing Perceptions of Agent Gender: Foundations and Guidelines

将智能代理性别感知操作化:基础与指南

Katie Seaborn, Madeleine Steeds, Ilaria Torre, Martina De Cet, Katie Winkle, Marcus Göransson

机构 * Institute of Science Tokyo(东京科学大学) University of Cambridge(剑桥大学) University College Dublin(都柏林大学学院) Chalmers University of Technology and University of Gothenburg(查尔姆斯理工大学与哥德堡大学) Uppsala University(乌普萨拉大学)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract);分类 cs.AI

AI总结 本文探讨智能代理性别感知的操作化方法,提出理论驱动的框架以提高研究严谨性和包容性,解决现有标准缺失的问题。

Journal ref CHI 2026 Full Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26908 2026-03-31 cs.CV 82%

FusionAgent: A Multimodal Agent with Dynamic Model Selection for Human Recognition

FusionAgent:一种具有动态模型选择的多模态代理用于人体识别

Jie Zhu, Xiao Guo, Yiyang Su, Anil Jain, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 Agent评测 :agent(title,abstract);agentic(abstract)

AI总结 FusionAgent通过动态模型选择提升人体识别鲁棒性,利用多模态大语言模型进行样本特定的模型选择,结合ACT分数融合方法,实验表明其在效率和性能上优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28662 2026-03-31 cs.LG cs.AI 81%

AMIGO: Agentic Multi-Image Grounding Oracle Benchmark

AMIGO:代理多图像接地 oracle 评估基准

Min Wang, Ata Mahjoubfar

机构 * Target Corporation(塔吉特公司)

专题命中 Agent评测 :agentic(title,abstract);分类 cs.AI、cs.LG

AI总结 AMIGO 评估基准通过长周期交互检测隐藏目标,要求模型在严格协议下通过属性问题逐步识别目标,强调不确定性下的问题选择、约束跟踪和细粒度区分能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26845 2026-03-31 cs.SE cs.AI 81%

GISclaw: An Open-Source LLM-Powered Agent System for Full-Stack Geospatial Analysis

GISclaw:一个基于大语言模型的开源代理系统,用于全栈地理空间分析

Jinzhen Han, JinByeong Lee, Yuri Shim, Jisung Kim, Jae-Joon Lee

机构 * Sungkyunkwan University(成均馆大学) Ministry of the Interior and Safety(行政安全部) University of Leeds(利兹大学) Jeonju University(全州大学)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 GISclaw通过集成LLM推理核心、Python沙盒、开源GIS库和交互界面,实现多数据类型的全栈地理空间分析,采用双代理架构和三种创新机制,提升任务成功率至96%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27404 2026-03-31 cs.AI cs.CL cs.CY cs.HC cs.MA 79%

Heterogeneous Debate Engine: Identity-Grounded Cognitive Architecture for Resilient LLM-Based Ethical Tutoring

异质辩论引擎:基于身份的认知架构用于鲁棒的基于大语言模型的伦理导师

Jakub Masłowski, Jarosław A. Chudziak

机构 * Institute of Computer Science, Warsaw University of Technology(华沙理工大学计算机科学研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出异质辩论引擎,结合身份导向检索增强生成与启发式理论思维,解决多代理系统在伦理教学中保持精确回答的挑战。

Comments 15 pages, 3 figures, 4 tables. Accepted at ACIIDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22751 2026-03-31 cs.CR 78%

Observable Channels, Not Just Storage: Evaluating Privacy Leakage in LLM Agent Pipelines

可观察通道而非仅存储:评估LLM代理流水线中的隐私泄露

Tao Huang, Chen Hou, Guosen Wu, Jiayang Meng

专题命中 Agent评测 :agent(title,abstract)

AI总结 本文提出CIPL框架,通过统一的通道导向接口评估LLM代理流水线中的隐私泄露,揭示内存、检索和工具中介目标的泄露特性,强调通道条件而非单一攻击方法的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28063 2026-03-31 cs.AI cs.GT 77%

Reward Hacking as Equilibrium under Finite Evaluation

奖励黑客行为作为有限评估下的均衡

Jiacheng Wang, Jinbin Huang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文基于五个公理证明优化AI代理在未被评估系统覆盖的质量维度上会系统性地减少努力,揭示奖励黑客行为为结构性均衡而非可修复错误,并提出可计算的扭曲指数预测黑客行为。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28082 2026-03-31 cs.CV cs.MA 75%

LogiStory: A Logic-Aware Framework for Multi-Image Story Visualization

LogiStory: 一个多图像故事可视化逻辑感知框架

Chutian Meng, Fan Ma, Chi Zhang, Jiaxu Miao, Yi Yang, Yueting Zhuang

专题命中 Agent评测 :agent(abstract);planning(abstract);multi-agent(abstract)

AI总结 本文提出LogiStory框架,通过显式建模视觉逻辑提升多图像故事可视化中的叙事逻辑与视觉质量,引入多智能体系统和LogicTale基准测试集进行评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26996 2026-03-31 cs.AI cs.CL cs.LG cs.PL 75%

FormalProofBench: Can Models Write Graduate Level Math Proofs That Are Formally Verified?

FormalProofBench:模型能否写出经过形式验证的研究生级数学证明?

Nikil Ravi, Kexing Ying, Vasilii Nesterov, Rayan Krishnan, Elif Uskuplu, Bingyu Xia, Janitha Aswedige, Langston Nashold

机构 * Vals AI École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Moscow Institute of Physics and Technology(莫斯科物理技术学院) Indiana University, Bloomington(印第安纳大学布卢明顿分校) Independent Researcher(独立研究员)

专题命中 Agent评测 :tool-use(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 FormalProofBench评估AI能否生成经过形式验证的研究生级数学证明,通过自然语言问题与Lean 4形式陈述配对,测试模型生成Lean证明的能力,结果显示最佳模型准确率为33.5%。

Comments Accepted at ICLR 2026 Workshop: VerifAI-2: The Second Workshop on AI Verification in the Wild. Live leaderboard hosted here: https://www.vals.ai/benchmarks/proof_bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16952 2026-03-31 cs.CL cs.AI 73%

AirQA: A Comprehensive QA Dataset for AI Research with Instance-Level Evaluation

AirQA:一个用于人工智能研究的综合性问答数据集,具有实例级评估

Tiancheng Huang, Ruisheng Cao, Yuxin Zhang, Zhangyi Kang, Zijian Wang, Chenrun Wang, Yijie Luo, Hang Zheng, Lirong Qian, Lu Chen, Kai Yu

机构 * X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院X-LANCE实验室) Shanghai Innovation Institution(上海创新研究院) Jiangsu Key Lab of Language Computing(江苏省语言计算重点实验室) Suzhou Laboratory(苏州实验室)

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI、cs.CL

AI总结 本文提出AirQA数据集,包含13956篇AI论文和1246个问题,支持多任务、多模态和实例级评估,并提出ExTrActor框架提升小模型多轮工具使用能力。

Comments 29 page, 6 figures, 17 tables, accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01331 2026-03-31 cs.CY cs.CL cs.LG 73%

AppellateGen: A Benchmark for Appellate Legal Judgment Generation

AppellateGen:上诉法律判决生成的基准测试

Hongkun Yang, Lionel Z. Wang, Wei Fan, Yiran Hu, Lixu Wang, Chenyu Liu, Yu Zeng, Shenghong Fu, Lei Gong, Zhengxin Zhang, Haoyang Li, Jiexin Zheng, Xin Xu

机构 * Nanyang Technological University(南洋理工大学) Ocean University of China(中国海洋大学) The Hong Kong Polytechnic University(香港理工大学) Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Cornell University(康奈尔大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出AppellateGen基准测试,包含7351个案例对,用于生成上诉阶段的法律判决,通过模拟司法流程验证模型在上诉推理中的逻辑一致性与挑战。

Comments 15 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27065 2026-03-31 cs.CL 70%

Story2Proposal: A Scaffold for Structured Scientific Paper Writing

Story2Proposal:一种结构化科学论文写作的支架

Zhuoyang Qian, Wei Shi, Xu Lin, Li Ling, Meng Luo, Ziming Wang, Zhiwei Zhang, Tengyue Xu, Gaoge Liu, Zhentao Zhang, Shuo Zhang, Ziqi Wang, Zheng Feng, Yan Luo, Shu Xu, Yongjin Chen, Zhibo Feng, Zhuo Chen, Bruce Yuan, Biao Wu, Harry Wang, Kris Chen

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 本文提出Story2Proposal,一种基于合同约束的多智能体框架,通过协调运作的智能体将研究故事转化为结构化论文,提升了论文结构一致性与视觉对齐性。

Comments 10 pages, 4 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01608 2026-03-31 cs.AI 70%

Evaluating and Understanding Scheming Propensity in LLM Agents

评估和理解大语言模型代理中的谋略倾向

Mia Hopman, Jannes Elstner, Maria Avramidou, Amritanshu Prasad, David Lindner

机构 * LASR Labs(LASR实验室) Google DeepMind(谷歌DeepMind)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本文通过分解谋略激励因素,研究大语言模型代理在复杂任务中的谋略行为,发现环境因素对谋略倾向影响显著,但实际部署中需谨慎评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28091 2026-03-31 cs.CV cs.RO 67%

SHARP: Short-Window Streaming for Accurate and Robust Prediction in Motion Forecasting

SHARP:短窗口流式处理用于运动预测中的准确性和鲁棒性

Alexander Prutsch, Christian Fruhwirth-Reisinger, David Schinagl, Horst Possegger

机构 * Institute of Visual Computing, Graz University of Technology(格拉茨技术大学视觉计算研究所)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出了一种基于流式处理的运动预测框架,通过逐步处理输入观测窗口和实例感知上下文流,提升在动态交通环境中的预测准确性与鲁棒性。

Comments CVPR 2026. Project page at https://a-pru.github.io/sharp

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04497 2026-03-31 cs.CV cs.AI cs.CL 62%

Vision-Language Agents for Interactive Forest Change Analysis

用于交互式森林变化分析的视觉-语言代理

James Brock, Ce Zhang, Nantheera Anantrasirichai

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出一种基于大语言模型的视觉-语言代理,用于处理遥感图像变化解释任务,通过多级变化解释框架和交互式查询提升森林变化分析的准确性与效率。

Comments 5 pages, 4 figures, Accepted into IGARSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21782 2026-03-31 cs.AI cond-mat.mtrl-sci cs.LG physics.chem-ph 62%

Accelerating Scientific Discovery with Autonomous Goal-evolving Agents

通过自主目标演化的代理加速科学发现

Yuanqi Du, Botao Yu, Tianyu Liu, Tony Shen, Junwu Chen, Jan G. Rittig, Kunyang Sun, Yikun Zhang, Aarti Krishnan, Yu Zhang, Daniel Rosen, Rosali Pirone, Zhangde Song, Bo Zhou, Cassandra Masschelein, Yingze Wang, Haorui Wang, Haojun Jia, Chao Zhang, Hongyu Zhao, Martin Ester, Nir Hacohen, Teresa Head-Gordon, Carla P. Gomes, Huan Sun, Chenru Duan, Philippe Schwaller, Wengong Jin

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SAGA代理,通过双层架构自动设计优化目标函数,提升科学发现效率,应用于抗生素、纳米抗体等设计任务,取得显著成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27469 2026-03-31 cs.LG cs.AI 62%

KV Cache Quantization for Self-Forcing Video Generation: A 33-Method Empirical Study

KV缓存量化用于自驱动视频生成:一项33种方法的实证研究

Suraj Ranganath, Vaishak Menon, Anish Patnaik

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 本文通过33种量化和缓存策略变体,研究自驱动视频生成中KV缓存压缩的影响,发现FlowCache启发的INT4软剪枝方法在压缩率和内存使用上表现优异,但高保真方法存在运行时或内存成本问题,需结合实际需求选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27333 2026-03-31 cs.SE cs.AI 62%

ComBench: A Repo-level Real-world Benchmark for Compilation Error Repair

ComBench:一个面向编译错误修复的仓库级真实世界基准

Jia Li, Zeyang Zhuang, Zhuangbin Chen, Yuxin Su, Wei Meng, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) School of Software Engineering, Sun Yat-sen University(中山大学软件工程学院) Sun Yat-sen University(中山大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文提出ComBench,首个面向C/C++编译错误修复的仓库级真实世界基准,通过自动化框架系统挖掘GitHub CI历史中的真实失败案例,评估12种现代LLM在直接和代理修复设置下的表现,揭示模型在语法正确性与语义正确性上的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.16448 2026-03-31 cs.AI cs.LG 62%

Information-theoretic Distinctions Between Deception and Confusion

信息论视角下欺骗与混淆的区别

Robin Young

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文从信息论角度区分两种AI安全失效模式:欺骗对齐与目标漂移,揭示二者在人类-AI系统不同接口的信息分歧,提出形式化模型和思想实验,为大型语言模型对齐挑战提供新视角。

Comments Proceedings of the 14th IJCNLP and the 4th AACL (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28625 2026-03-31 cs.RO cs.AI cs.SY eess.SY 57%

Dynamic Lookahead Distance via Reinforcement Learning-Based Pure Pursuit for Autonomous Racing

通过基于强化学习的纯追求实现动态前瞻距离

Mohamed Elgouhary, Amr S. El-Wakeel

机构 * West Virginia University(西弗吉尼亚大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出结合PPO与经典纯追求控制器的混合控制框架,动态调整前瞻距离以提升自动驾驶赛车性能,实验表明在未见过的赛道上提升了圈速并实现了仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28301 2026-03-31 cs.LG 57%

LIBERO-Para: A Diagnostic Benchmark and Metrics for Paraphrase Robustness in VLA Models

LIBERO-Para:一种用于视觉语言动作模型中同义词鲁棒性诊断的基准和指标

Chanyoung Kim, Minwoo Kim, Minseok Kang, Hyunwoo Kim, Dahuin Jung

机构 * Soongsil University(崇实大学) Chung-Ang University(中央大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本文提出LIBERO-Para基准,通过独立变化动作表达和物体参考,分析语言泛化能力。研究发现,不同规模的VLA模型在同义词替换下性能下降22-52个百分点,主要由物体层面的词汇变化导致。提出PRIDE指标量化同义词难度,揭示模型对任务识别的依赖。

Comments 32 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27962 2026-03-31 cs.LG cs.GT 57%

Gradient Manipulation in Distributed Stochastic Gradient Descent with Strategic Agents: Truthful Incentives with Convergence Guarantees

分布式随机梯度下降中梯度操纵的策略性代理:具有收敛保证的诚实激励

Ziqin Chen, Yongqiang Wang

机构 * Department of Electrical and Computer Engineering, Clemson University(克莱姆森大学电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出一种完全分布式支付机制,首次在分布式随机梯度下降中保证诚实行为和准确收敛,克服了现有诚实机制的两大局限:依赖集中服务器和牺牲收敛精度。

Comments 19 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.01502 2026-03-31 cs.CV cs.AI 57%

Clinical application of HEDI for biomechanical evaluation and visualisation in incisional hernia repair

HEDI在切口疝修复中的临床应用:生物力学评估与可视化

Philipp D. Lösel, Jacob J. Relle, Samuel Voß, Ramesch Raschidi, Regine Nessel, Johannes Görich, Mark O. Wielpütz, Thorsten Löffler, Vincent Heuveline, Friedrich Kallinowski

机构 * Department of Materials Physics, Research School of Physics, The Australian National University(澳大利亚国立大学物理研究学院材料物理系) Engineering Mathematics and Computing Lab (EMCL), Interdisciplinary Center for Scientific Computing (IWR), Heidelberg University(海德堡大学跨学科科学计算中心工程数学与计算实验室) Data Mining and Uncertainty Quantification (DMQ), Heidelberg Institute for Theoretical Studies (HITS)(海德堡理论研究所数据挖掘与不确定性量化) Forschungscampus STIMULATE, Department of Fluid Dynamics and Technical Flows, Otto von Guericke University Magdeburg(奥托·冯·格里克马格德堡大学流体动力学与技术流动系STIMULATE研究园区) Departement Chirurgie, Kantonsspital Graubünden(格劳宾登州医院外科) General and Visceral Surgery, Municipal Hospital Pirmasens(皮尔马森斯市立医院普通与内脏外科) Radiological Center, Kellereistrasse 32-34, 69412 Eberbach(放射中心) Diagnostic and Interventional Radiology, Heidelberg University Hospital(海德堡大学医院诊断与介入放射科) Translational Lung Research Center (TLRC) Heidelberg, German Center for Lung Research (DZL)(海德堡转化肺研究中心,德国肺研究中心) General and Visceral Surgery, GRN Hospital(GRN医院普通与内脏外科) General, Visceral and Transplantation Surgery, Heidelberg University Hospital(海德堡大学医院普通、内脏与移植外科)

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 本研究提出一种考虑腹壁不稳定性的生物力学修复策略,并开发可视化工具辅助术前评估,通过31例患者术前评估显示术后三年无疼痛和复发,但需作为辅助工具使用。

Comments 15 pages, 6 figures, this is the author's accepted manuscript of an article published in Communications Medicine (2026). The final version is available online at: https://doi.org/10.1038/s43856-025-01311-w

Journal ref Communications Medicine 6 (2026) 68

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27691 2026-03-31 cs.DB cs.PL cs.SE 57%

The Case for Multi-Version Experimental Evaluation (MVEE)

多版本实验评估(MVEE)的案例

Simon Jörz, Felix Schuhknecht

专题命中 Agent评测 :workflow(abstract);分类 cs.SE

AI总结 本文提出多版本实验评估(MVEE)以解决编译版本差异导致的评估问题,通过分析后续构建中的异常,生成新的版本以提高实验评估的准确性和表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27415 2026-03-31 cs.AI stat.CO 57%

Greedy Is a Strong Default: Agents as Iterative Optimizers

贪婪是一种强大的默认选择:智能体作为迭代优化器

Yitao Li

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文探讨了在智能体替代随机提议生成器的情况下,经典优化方法的有效性。通过四个任务验证,发现贪心爬山法在多个搜索空间中表现优异,且生成的规则具有可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26922 2026-03-31 cs.HC cs.AI 57%

Mimetic Alignment with ASPECT: Evaluation of AI-inferred Personal Profiles

模仿对齐与ASPECT:AI推断个人资料的评估

Ruoxi Shang, Dan Marshall, Edward Cutrell, Denae Ford

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI

AI总结 本文提出ASPECT方法,通过验证的沟通量表和职场数据评估LLM沟通特征,生成的个人资料在自评上表现良好,并在多个场景中优于通用和自述基线。

Comments 20 pages (including appendix), 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28504 2026-03-31 astro-ph.SR astro-ph.IM 50%

JW-VL: A Vision-Language Model for Solar Physics

JW-VL:用于太阳物理的视觉-语言模型

Mingfu Shao, Hui Wang, Liyue Tong, Yuyang Li, Cunshi Wang, Jiaben Lin, Suo Liu, Haiqing Xu, Yin Zhang, Jing Huang

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出JW-VL模型,专为太阳物理设计,整合多波段观测数据,实现从原始观测数据到图像识别、活动分析和OCR的端到端处理,同时构建多波段图像基准数据集。

Comments 16 Pages,8figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27989 2026-03-31 cond-mat.mtrl-sci quant-ph 50%

Graphitic-C3N4/TiO2(B) S-scheme Heterojunctions for Efficient Photocatalytic H2 Production and Organic Pollution Degradation

石墨碳氮化物/二氧化钛(B) S方案异质结用于高效光催化氢气生产和有机污染降解

Xiaoyi Zhou, Min Zhang, Qiushi Wang, Shiwen Du, Xuedong Jing, Zhenyi Zhang

专题命中 Agent评测 :agent(abstract)

AI总结 本研究通过耦合TiO2(B)纳米棒与g-C3N4纳米片构建S方案异质结,实现宽光谱吸收和强氧化还原能力,提升氢气生产和有机污染物降解效率。

Comments 28 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏