arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15729 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15729 篇

2608.10635 2026-08-12 cs.CV cs.AI 新提交 70%

MedUP: Awakening Unified Understanding and Perception in Medical Vision-Language Models

MedUP:唤醒医学视觉-语言模型中的统一理解与感知能力

Yuan Wang, Hualiang Wang, Yixin Chen, Songtao Jiang, Shujian Gao, Jiaming Lin, Siming Fu, Jian Wu, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学)

专题命中 Agent评测 :agentic(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出MedUP模型,通过UniMedTok分词器在共享token空间统一医学视觉-语言模型的感知与理解,构建相关训练语料库和评估基准,在多医学任务上性能优于现有模型。

Comments 10 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10178 2026-08-12 cs.SE 新提交 70%

One Recipe, Many Harnesses: What Self-Evolution Encodes Across Languages and Models

一个方案,多种适配:自演化在不同语言和模型中编码了什么

Siqi Yang, Qianlan Yang, Yu-Xiong Wang, Saurabh Pujar, Martin Hirzel

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 该研究固定演化方案,在八种编程语言和三个基础模型上分析自演化适配工具,发现其为语言需求与模型差距共同塑造的补偿层,可提升编码智能体性能并能蒸馏为通用工具。

Comments 20 pages, 12 figures, 9 tables. Includes appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08970 2026-08-12 cs.CV cs.AI 版本更新 70%

MultiView-Bench: A Diagnostic Benchmark for World-Centric Multi-View Integration in VLMs

MultiView-Bench:用于视觉语言模型中以世界为中心的多视图集成的诊断基准

Hantao Zhang, Jinru Sui, Ed Li, Dirk Bergemann, Zhuoran Yang

机构 * Google(谷歌)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究针对VLMs多视图集成能力评估不足问题,引入MultiView-Bench基准,发现模型在3D空间关系等方面的局限及偏差,提出ViewNavigator框架,能主动选择视角、融合证据,提升基础模型在该基准上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09298 2026-08-11 cs.RO cs.AI 新提交 70%

WorldSimProbe: Diagnosing Simulator Faithfulness in Action-Conditioned World Models for Embodied Manipulation

WorldSimProbe:面向具身操控的动作条件世界模型的模拟器保真度诊断

Peterson Co, Sicheng Hu, Chunxuan Jiao, Hongyang Cheng, Yulin Luo, Yijie Xu, Sixiang Chen, Zhongxia Zhao, Zihao Wang, DaFeng Chi, Peidong Liu, YuTong Chen, Henghua Liu, Zhihao Yuan, Huizhu Jia, Yuzheng Zhuang, Tianle Zhang, Liang Lin, Huajie Tan, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) EvoPhys AI(EvoPhys人工智能公司) Joy Future Academy, JD(京东探索研究院) The University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Institute of Technology(北京理工大学)

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.AI

AI总结 该研究提出WorldSimProbe框架,通过五套受控测试评估动作条件世界模型的模拟器保真度,发现其存在动作实现退化等问题,为具身操控模型提供标准化诊断方法。

Comments 20 pages, 18 figures, and 10 tables, including supplementary material. Code and data: https://evophys.com/WorldSimProbe/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08691 2026-08-11 cs.AI 新提交 70%

EnergyBridge: Benchmarking Household Energy Management, User Participation, and Grid Flexibility

EnergyBridge:家庭能源管理、用户参与度与电网灵活性基准测试

Xudong Wu, Zeqing Wu, Jiarui Zhang, Xuhao Fan, Ziang Ding, Yuming Zhuang, Mingqi Yuan, Yilun Du, Hongjie Jia, Yunfei Mu, Jiayu Chen

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出EnergyBridge基准框架,结合特定区域EnergyPlus环境与LLM用户模拟器,在含584组人类角色扮演判断的实验中,实现了更高授权率、更低能耗与更可靠容量承诺,推动以人为本的电网灵活性研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08621 2026-08-11 cs.AI 新提交 70%

Business Arena: Benchmarking LLM Agents in a Realistic Marketplace

商业竞技场:在现实市场中对大语言模型智能体进行基准测试

Yijun Pan, Yukun Lian, Kunyu Shi, Junbo Li, Hongwei Xue, Sicong Xie, Guannan Zhang, Xiaoying Xing

机构 * Alibaba Group(阿里巴巴集团) Yale University(耶鲁大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究人员推出Business Arena测试平台,评估15个前沿LLM智能体在跨境商店运营中的表现,发现其平均最终净资产差9倍,最优模型仍逊于人类策略,为商业智能体评估提供了现实测试基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07808 2026-08-11 cs.CR cs.AI 新提交 70%

The Anatomy of a Prompt Injection: A Component Model for Structured Analysis

提示注入的剖析:用于结构化分析的组件模型

Jeremy McHugh

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本文提出七个组件的提示注入结构化分析模型,统一相关分类法,结合实例与CTI模式,助力标记、分析提示注入攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07700 2026-08-11 cs.AI cs.DB 新提交 70%

Towards Researcher Agents for Knowledge-Graph Question Answering

面向知识图谱问答的研究者智能体

Tommaso Soru, Abdulsobur Oyewale

机构 * Liber AI Research(Liber AI研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究提出研究者智能体式文本转SPARQL系统,在DBpedia上迭代优化后,其在2025年DBpedia验证集上总体准确率达0.22,发现瓶颈在谓词选择,建议基准采用多指标评分。

Comments Second International TEXT2SPARQL Challenge, co-located with Text2KG at ESWC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07538 2026-08-11 cs.AI cs.GT econ.GN q-fin.EC 新提交 70%

When LLM Agents Negotiate: Private Information and Dynamic Bargaining in Supply Chains

当大语言模型智能体进行谈判:供应链中的私人信息与动态议价

Chen Liang, Fasheng Xu

机构 * School of Business, University of Connecticut(康涅狄格大学商学院)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 该研究以供应链议价问题为场景,将9个LLM与完美贝叶斯均衡基准测试,发现LLM智能体的谈判能力、提供商身份及提示策略对剩余分配和效率有显著影响,为AI智能体审计提供了三维框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07495 2026-08-11 cs.HC cs.AI 新提交 70%

EmoPatient: An Emotion-Directed Patient Simulator for Realistic Palliative Care Communication Training

EmoPatient:用于姑息治疗沟通训练的情绪导向患者模拟器

Yining Wu, Tianshu Du, Jinrui Fang, Chi Zhang, Sonal Admane, Ying Ding

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对现有LLM患者模拟器无法捕捉动态情绪变化的问题,提出情绪导向的EmoPatient模拟器,引入情绪指导代理生成动态情绪控制信号,经评估其在情绪真实性指标和稳健性上均优于基线,可提升姑息治疗沟通训练的真实性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06931 2026-08-10 cs.AI 新提交 70%

Science Edge Evaluation: SEE the Missing Step Toward Real Scientific Discovery

科学边缘评估:SEE——迈向真实科学发现的缺失环节

Taolin Han, Yuchen Zhang, Jinghang Wang, Yun Wu, Wai Yuet Chiu, Zhaohai Li, Yifei Zhang, Jinxin Wang, Yuhao Zhou, Chen Zhao, Jiajia Li, Jiaxin Li, Qile Jin, Kewei Sun, Shuang Wu, Weiqi Zhai, Renquan Lv, Junchao Li, Ruodan Chen, Qingteng Chen, Zhibo Yang, Hu Wei, Lin Qu, Shuai Bai, Bing Zhao

机构 * Alibaba Group(阿里巴巴集团) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) University of Alberta(阿尔伯塔大学) Zhejiang University(浙江大学)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 该研究构建多模态基准SEE评估19个MLLMs,发现其仅达48.7%准确率,通用模型优于专用模型,工具使用可提至52.7%但仍难实现科学发现所需的证据约束推断,需从解释转向推导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05990 2026-08-07 cs.AI cs.CE physics.app-ph physics.optics 新提交 70%

OPERA: Operator-residual feedback for reliable autonomous optical experiments with language-model agents

OPERA:面向语言模型智能体的可靠自主光学实验的算子残差反馈

Ning Xu, Xiang Zheng, Fuqiang Zhong, Huadong Wang, Xiaolong Wu, Zhiyuan Liu, Hui Ning

机构 * Tsinghua University(清华大学) ModelBest Inc.(模贝斯特公司) Hunan University(湖南大学) Northwest Institute of Nuclear Technology(西北核技术研究所)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 本研究提出面向语言模型智能体的OPERA算子残差框架,将实验动作表示为光学算子并结合物理解释残差评估,在三项光学任务中可减少无物理改进的决策占比,提升任务目标达成概率并降低实验预算。

Comments 34 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04003 2026-08-05 cs.CL 新提交 70%

PAST-Bench: Benchmarking the Foundations of Recursive Self-Improvement in Personal Agents

PAST-Bench:评测个人智能体递归自我改进的基础

Shuhan Xue, Zixin Ding, Yichen Shen, Yinjie Wang, Zhenfei Yin, Yingcheng Wu, Yuxin Chen, Mengdi Wang, Ling Yang

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.CL

AI总结 本研究推出PAST-Bench基准评测个人智能体递归自我改进能力,发现改进不均,在此基础上开发Hermes+提升收益,为相关研究提供评估诊断基础

Comments Code: https://github.com/Gen-Verse/PAST-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03524 2026-08-05 cs.AI 新提交 70%

Dr. AGENTONOMICS: A Didactic Experiment of AGENTONOMICS

Dr. AGENTONOMICS:AGENTONOMICS的教学实验

Fengjunjie Pan, Alois Knoll

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 本研究介绍了AGENTONOMICS框架的首个应用Dr. AGENTONOMICS,将其作为教学智能体,提出其可拓展为多角色系统并探讨其对多中心AI经济的意义。

Comments Technical report, Technical University of Munich

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28956 2026-08-05 cs.AI 版本更新 70%

MerchantBench: Benchmarking LLM Agents for Long-Term Coherence in E-Commerce Operations

MerchantBench:面向电商运营中长期一致性的大语言模型智能体基准测试

Qiming Shi, Yulong Tao, Linbo Jin, Zhaolu Kang, Yibo Dou, Jiawen Zhu, Tianjun Pan, Shaokang Fu, Chengyu Wang, Siyue Li, Yaping Cheng, Di Weng, Chengfu Huo

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 本研究推出MerchantBench电商运营基准测试,通过365天订单级模拟评估大语言模型智能体的中长期一致性,发现其与人类参与者存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28114 2026-08-05 cs.AI 版本更新 70%

Language model agents show in-group trust bias invisible to standard behavioural audits

指令调优语言模型代理中类似人类的内群体偏见

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24011 2026-08-05 cs.CV cs.AI 版本更新 70%

ActQuant: Sub-4-bit Action-Guided Quantization for Vision-Language-Action Models

ActQuant: 面向视觉-语言-动作模型的亚4比特动作引导量化

Arash Akbari, Arman Akbari, Masih Eskandar, Qitao Tan, Yixiao Chen, Jingwu Luo, Bertha Pangaribuan, Liyun Zhang, Jennifer Dy, Geng Yuan, Xue Lin, Gaowen Liu, Stratis Ioannidis, Yanzhi Wang

机构 * Northeastern University(东北大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 提出ActQuant框架,通过动作引导的混合精度后训练量化,在亚4比特权重量化下保持VLA模型性能,并引入OmniModel.cpp实现高效部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01204 2026-08-04 cs.CL 新提交 70%

ShiJianBench: From Dialogue to Decision for Long-Horizon Evaluation of Investment Advisors

ShiJianBench:面向投资顾问长周期评估的从对话到决策基准

Jie Gong, Maowei Jiang, Zhiwei Liu, Yang Qiao, Wenxi Wu, Mengxi Xiao, Enze Zhang, Ziyan Kuang, Yankai Chen, Caishuang Huang, Meng Zhou, Xiku Du, Xue Liu, Guojun Xiong, Min Peng, Qianqian Xie, Sophia Ananiadou

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.CL

AI总结 该研究推出ShiJianBench离线框架,用多智能体投资者模拟器评估对话式投资顾问,发现LLM顾问在个性化内容与投资者轨迹上表现更优,凸显需开展轨迹感知评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01149 2026-08-04 cs.AI 新提交 70%

PATH-Bench: Path-Dependent Evaluation of Lifelong Agents

PATH-Bench:面向终身智能体的路径依赖评估基准

Xidong Yang, Xingyi Zhang, Wenhao Li, Wenyan Liu, Junjie Sheng, Yun Hua, Wei Yin, Tao Fang, Chuyun Shen, Xiangfeng Wang

专题命中 Agent评测 :agent(abstract);tool-use(abstract);分类 cs.AI

AI总结 本研究构建了面向终身智能体路径依赖评估的基准PATH-Bench,评估8个智能体后提出SEU机制,该机制可减少遗忘、提升正向迁移,为设计更优终身智能体提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02277 2026-08-04 cs.CR cs.AI 版本更新 70%

Quantifying Frontier LLM Capabilities for Container Sandbox Escape

量化前沿大语言模型突破容器沙盒的能力

Rahul Marchand, Art O Cathain, Jerome Wynne, Philippos Maximos Giavridis, Stuart Jennings, Freddy Tuxworth, Tolga H. Dur, Sam Deverett, John Wilkinson, Jason Gwartz, Harry Coppock

机构 * University of Oxford(牛津大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究大语言模型突破容器沙盒的能力,通过引入SANDBOXESCAPEBENCH基准,利用嵌套沙盒架构和CTF评估,涵盖多种逃逸机制,发现添加漏洞时大语言模型能识别利用,证明此类评估对保障沙盒封装高性能模型的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18130 2026-08-04 cs.SE 版本更新 70%

Doc2Feat-Bench: Evaluating Documentation-Driven Feature Addition

Doc2Feat-Bench:评估文档驱动的功能添加

Zhonghao Jiang, Le Deng, Jialun Cao, Michael Pradel, Zhongxin Liu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本研究构建了Doc2Feat-bench基准及经人工验证的子集,用于评估软件工程智能体基于文档变更实现功能的能力,发现当前最先进智能体在该任务上的最佳成功率仅为37.72%,且面临跨文件编辑等关键挑战。

Comments Accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23802 2026-08-03 cs.AI 版本更新 70%

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27895 2026-07-31 cs.AI cs.CV 新提交 70%

MMHBench: A Multi-Perspective Benchmark for Mental Health Understanding in Long-Form Videos

MMHBench:用于长视频心理健康理解的多视角基准测试集

Jinpeng Hu, Erqiang Wang, Shan Wang, Zhuo Li, Peipei Song, Xun Yang, Meng Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出MMHBench多视角心理健康理解基准,含268个长视频与2184条问题,采用MAQG框架生成问题,评估22个多模态大语言模型后发现该任务仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24101 2026-07-31 cs.CV cs.AI 版本更新 70%

LU-500: A Logo Benchmark for Concept Unlearning

LU-500:用于概念遗忘的标志基准

Keyu Li, Jin Gao, Jialing Zhang, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究文本到图像模型中概念遗忘里公司标志未被充分研究的问题,引入LU-500基准及多粒度协议,通过实验评估多种方法,分析ProLU基线,指出未来标志遗忘或需空间感知控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27201 2026-07-30 cs.CL 新提交 70%

Mental World Modeling

心理世界建模

Hao Fei, Yiran Zhao

专题命中 Agent评测 :agent(abstract);planning(abstract);分类 cs.CL

AI总结 该研究提出将心理变量作为核心组件的MWM框架,实例化为MENTIS基线,实验证明显式建模心理状态对预测人类决策至关重要,推动世界建模从物理场景模拟转向心智模拟。

Comments project website: https://mental-world.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26314 2026-07-30 cs.CR cs.AI 新提交 70%

StealthBench: Measuring Operational Stealth in Autonomous Offensive-Security Agents

StealthBench:衡量自主进攻性安全智能体的操作隐蔽性

Ads Dawson, Adrian Wood

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究人员推出StealthBench基准,通过含三个LLM的评判小组评估自主进攻性安全智能体的OPSEC表现,发现无模型安全成功率超54%,证实OPSEC失败具系统性,该基准用于支持相关智能体开发与监控。

Comments 29 pages, 9 tables, 1 figure, 2 appendices. Code: https://github.com/GangGreenTemperTatum/stealthbench Dataset: https://huggingface.co/datasets/0xmoose/stealthbench Website: https://stealthbench.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26191 2026-07-30 cs.AI cs.CL cs.LG cs.SE 新提交 70%

Position: Evaluation Scores Are Perishable Knowledge Claims

Position: 评估分数是易逝的知识主张

Sankalp Gilda, Shlok Gilda

机构 * DeepThought Solutions(深度思考解决方案公司) Meta University of Florida(佛罗里达大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 该研究指出语言模型评估存在信任膨胀问题,提出将评估分数视为具有形式性、范围性和有效性窗口的认知主张,建议添加元数据并采用最弱链聚合,发现HELM排行榜上两种聚合方式的前五名模型完全不重合。

Comments 7 pages, 1 figure, 1 table. Published at the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, San Diego

Journal ref Proceedings of the Fifth Workshop on Generation, Evaluation and Metrics (GEM), ACL 2026, pages 1029-1035

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26113 2026-07-30 cs.SE 新提交 70%

NISPO: Open-source IUPAC name generation tool

NISPO:开源IUPAC名称生成工具

Nicholas T. Runcie, Fergus Imrie, Charlotte M. Deane

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 针对化学领域IUPAC名称生成需求,该研究开发了基于RDKit、采用智能体自改进循环的开源Python工具NISPO,经SureChEMBL分子优化后,在1.03亿个PubChem分子上实现98.1%的往返准确率,可免费获取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24063 2026-07-30 cs.AI 版本更新 70%

The Cost of Knowing: A Resource-Aware Protocol for Benchmarking Hallucination Beyond Static Leaderboards

知晓的代价:一种超越静态排行榜的幻觉基准测试的资源感知协议

Keyu Li, Jin Gao, Dequan Wang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 研究前沿模型事实性与计算成本的权衡问题,提出资源感知评估协议MAS-HQ,通过包装事实性检测器、归一化成本并让系统竞争,能衡量事实性答案成本,使单代理基线更具资源效率,收益稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08334 2026-07-30 cs.CL 版本更新 70%

CustomerSim: Benchmarking and Aligning Multimodal Language Models as Retail User Simulators

SalesSim:多模态语言模型作为零售用户模拟器的基准测试与对齐

Yada Pruksachatkun, Yixin Wan, Xingrun Chen, Kai-Wei Chang, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce研究院) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 SalesSim通过多轮多模态对话评估多模态大语言模型在模拟真实用户行为中的能力,发现模型在词汇多样性及决策一致性方面存在不足,并提出UserGRPO方法提升对话流畅度与决策对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏