arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 226 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 65 篇

2604.25154 2026-04-29 cs.LG cs.DB 79%

Prior-Aligned Data Cleaning for Tabular Foundation Models

对表格基础模型的先验对齐数据清洗

Laure Berti-Equille

机构 * IRD(法国国家科研 institutes)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出L2C2框架,通过强化学习实现表格数据清洗的先验对齐,实验表明该方法在提升TabPFN准确率和跨数据集迁移能力方面表现优异。

Comments 15 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24983 2026-04-29 cs.AI 79%

Adaptive Prompt Embedding Optimization for LLM Jailbreaking

适应性提示嵌入优化用于大语言模型劫持

Miles Q. Li, Benjamin C. M. Fung, Boyang Li, Radin Hamidi Rad, Ebrahim Bagheri

机构 * School of Information Studies, McGill University, Montreal, QC, Canada(麦吉尔大学信息研究学院) Department of Computer Science, Kean University, Union, NJ, United States(凯恩大学计算机科学系) Mila - Quebec AI Institute, Montreal, QC, Canada(魁北克人工智能研究所) Faculty of Information, University of Toronto, Toronto, ON, Canada(多伦多大学信息学院)

专题命中 评测与基准 :LLM(title,abstract_cn);分类 cs.AI

AI总结 本文提出PEO方法,通过优化原始提示嵌入而非附加对抗性标记,实现更有效的白盒劫持,实验显示其在多个基准测试中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24775 2026-04-29 physics.data-an cs.LG hep-ex nucl-ex physics.ins-det 79%

Application of a Mixture of Experts-based Foundation Model to the GlueX DIRC Detector

混合专家基础模型在GlueX DIRC探测器中的应用

Cristiano Fanelli, James Giroux, Cole Granger, Justin Stevens

机构 * 1 William \& Mary, Department of Data Science, Williamsburg, VA 23185, USA 2 William \& Mary, Department of Physics, Williamsburg, VA 23185, USA Author to whom any correspondence should be addressed.

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于混合专家的基础模型,用于GlueX DIRC探测器的快速模拟、粒子识别和击级噪声过滤,展示了其作为统一框架的实用性。

Comments 18 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22821 2026-04-29 cs.SD cs.LG eess.AS 77%

Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use

Audio2Tool: 说话,呼叫,行动 -- 一个用于语音工具使用的基准测试数据集

Ramit Pahwa, Apoorva Beedu, Parivesh Priye, Rutu Gandhi, Saloni Takawale, Aruna Baijal, Zengli Yang

机构 * Rivian and Volkswagen Group Technologies(Rivian和大众集团技术公司)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.LG

AI总结 Audio2Tool数据集通过三个领域评估语音语言模型的工具调用能力,包含30000个查询,涵盖简单指令到复杂多意图任务,测试模型在不同挑战下的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22597 2026-04-29 cs.SE cs.CL 77%

TimeMachine-bench: A Benchmark for Evaluating Model Capabilities in Repository-Level Migration Tasks

TimeMachine-bench:一个评估仓库级迁移任务模型能力的基准

Ryo Fujii, Makoto Morishita, Kazuki Yano, Jun Suzuki

机构 * Tohoku University(东大理工大学) Future Corporation(未来公司) RIKEN(日本理化学研究所) NII LLMC(国家信息研究所LLMC)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 本文提出TimeMachine-bench基准,用于评估软件迁移任务中的模型能力,通过自动化构建GitHub仓库测试失败数据集,评估基于11种模型的基线方法,发现LLM在迁移任务中仍存在可靠性挑战。

Comments Accepted to EACL 2026 Main, camera-ready

Journal ref Proceedings of the 19th Conference of the European Chapter of the Association for Computational Linguistics (Volume 1: Long Papers), pages 8233-8264, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25196 2026-04-29 cs.LG 74%

Knowledge-Data Dually Driven Paradigm for Accurate Landslide Susceptibility Prediction under Data-Scarce Conditions Using Geomorphic Priors and Tabular Foundation Model

基于地质先验知识和表格基础模型的双驱动范式用于数据稀缺条件下滑坡易发性预测

Yuting Yang, Gang Mei, Feng Chen, Yongshuang Zhang, Jianbing Peng

机构 * School of Engineering and Technology, China University of Geosciences (Beijing)(工程与技术学院,中国地质大学(北京)) School of Geological Engineering and Geomatics, Chang'an University(地质工程与测绘学院,长安大学)

专题命中 评测与基准 :foundation model(title);分类 cs.LG

AI总结 本文提出一种双驱动范式,结合地质先验知识和少量滑坡数据,有效提升数据稀缺条件下滑坡易发性预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25840 2026-04-29 cs.CL cs.AI 73%

PSI-Bench: Towards Clinically Grounded and Interpretable Evaluation of Depression Patient Simulators

PSI-Bench:迈向临床导向且可解释的抑郁症患者模拟器评估

Nguyen Khoi Hoang, Shuhaib Mehri, Tse-An Hsu, Yi-Jyun Sun, Quynh Xuan Nguyen Truong, Khoa D Doan, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) VinUniversity(文大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出PSI-Bench框架,用于评估抑郁症患者模拟器的行为,发现现有模拟器存在响应过长、情绪处理不充分等问题,且框架对仿真质量影响大于模型规模。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25088 2026-04-29 cs.AI cs.CL 73%

Cooperate to Compete: Strategic Coordination in Multi-Agent Conquest

合作以竞争:多智能体征服中的战略协调

Abigail O'Neill, Alan Zhu, Mihran Miroyan, Narges Norouzi, Joseph E. Gonzalez

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出C2C多智能体环境,研究在混合动机设定下智能体如何通过合作达成长期竞争目标,发现人类与AI在谈判行为上有显著差异,并通过优化提升AI胜率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14389 2026-04-29 cs.CL cs.AI 73%

BiCon-Gate: Consistency-Gated De-colloquialisation for Dialogue Fact-Checking

BiCon-Gate:基于一致性门控的对话事实核查去口语化处理

Hyunkyung Park, Arkaitz Zubiaga

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出BiCon-Gate,通过语义感知的一致性门控选择改写候选,提升对话事实核查的证据检索与验证效果,尤其在SUPPORTS任务上表现突出。

Comments 15 pages, 7 figures; minor source and formatting cleanup; results unchanged

Journal ref Proceedings of the Ninth Fact Extraction and VERification Workshop (FEVER), pages 59-73, Rabat, Morocco. Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25268 2026-04-29 cs.CL cs.AI 73%

CRAFT: Grounded Multi-Agent Coordination Under Partial Information

CRAFT:在部分信息下的 grounded 多智能体协调

Abhijnan Nath, Hannah VanderHoeven, Nikhil Krishnaswamy

机构 * Department of Computer Science, Colorado State University(计算机科学系,科罗拉多州立大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 CRAFT 是评估大语言模型在严格部分信息下实用沟通能力的多智能体基准,通过自然语言构建共享3D结构。研究发现更强推理能力不必然带来更好协调,小模型常表现更优,表明多智能体协调仍是当前语言模型的挑战。

Comments Added revisions, corrected typos and additional analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21225 2026-04-29 cs.CL cs.AI 73%

MGSM-Pro: A Simple Strategy for Robust Multilingual Mathematical Reasoning Evaluation

MGSM-Pro:一种用于多语言数学推理评估的简单策略

Tianyi Xu, Kosei Uemura, Alfred Malengo Kondoro, Tadesse Destaw Belay, Catherine Nana Nyaah Essuman, Ifeoma Okoh, Ganiyat Afolabi, Ayodele Awokoya, David Ifeoluwa Adelani

机构 * McGill University(麦吉尔大学) Mila-Quebec AI Institute(蒙特利尔AI研究院) University of Toronto(多伦多大学) Masakhane Hanyang University(翰阳大学) Instituto Politécnico Nacional(国家理工学院) Umbaji University of Ibadan(伊巴德安大学) McPherson University(麦菲逊大学) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MGSM-Pro,通过增加数字变化实例提升多语言数学推理评估的鲁棒性,发现低资源语言在不同数字实例下表现下降,且专有模型对数字变化更敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12072 2026-04-29 cs.CL cs.LG 73%

VOYAGER: A Training Free Approach for Generating Diverse Datasets using LLMs

VOYAGER: 一种无需训练的生成多样化数据集方法

Avinash Amballa, Yashas Malur Saidutta, Chi-Heng Lin, Vivek Kulkarni, Srinivas Chappidi

机构 * Samsung Research America(三星美国研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出VOYAGER方法,通过确定性点过程优化生成数据集的多样性,无需训练且适用于闭源模型,实验显示其多样性提升达1.5至3倍。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22102 2026-04-29 cs.CV cs.AI cs.CL 73%

Mitigating Coordinate Prediction Bias from Positional Encoding Failures

缓解位置编码失效导致的坐标预测偏差

Xingjian Tao, Yiwei Wang, Yujun Cai, Yihong Luo, Kai Han, Jing Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) University of California, Los Angeles(加州大学洛杉矶分校) The University of Queensland(昆士兰大学) Shanghai University of Finance and Economics(上海财经大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VPSG方法,通过shuffle位置编码纠正坐标偏移,提升定位精度,无需重新训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14183 2026-04-29 cs.CV 71%

UniSER: A Foundation Model for Unified Soft Effects Removal

UniSER:一个用于统一软效果去除的基础模型

Jingdong Zhang, Lingzhi Zhang, Qing Liu, Mang Tik Chiu, Connelly Barnes, Yizhou Wang, Haoran You, Xiaoyang Liu, Yuqian Zhou, Zhe Lin, Eli Shechtman, Sohrab Amirghodsi, Xin Li, Wenping Wang, Xiaohang Zhan

机构 * Texas A&M University(德克萨斯农工大学) Adobe Research(Adobe研究)

专题命中 评测与基准 :foundation model(title)

AI总结 UniSER通过构建大规模数据集和定制训练流程,提出统一软效果去除模型,实现对多种软效果的鲁棒高保真修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25849 2026-04-29 cs.AI 70%

ADEMA: A Knowledge-State Orchestration Architecture for Long-Horizon Knowledge Synthesis with LLMAgents

ADEMA:一种用于长周期知识综合的知觉状态 orchestration 架构与 LLMAgents

Zhou Hanlin, Chan Huah Yong

机构 * School of Computer Sciences, Universiti Sains Malaysia (USM)(国际 sciences 大学 (USM) 计算机科学学院) Xiamen Software Vocational & Technical College(厦门软件职业技术学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出 ADEMA 架构,通过显式知识状态管理、双评估治理、自适应任务模式切换等方法,解决长周期知识综合中知识状态漂移、中间承诺隐含等问题,强调显式证据链和可恢复连续性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25737 2026-04-29 cs.SE cs.AI 70%

SAFEdit: Does Multi-Agent Decomposition Resolve the Reliability Challenges of Instructed Code Editing?

SAFEdit:多智能体分解能否解决受指导代码编辑的可靠性挑战?

Noam Tarshish, Nofar Selouk, Daniel Hodisan, Bar Ezra Gafniel, Yuval Elovici, Asaf Shabtai, Eliya Nachmani

机构 * Ben-Gurion University of the Negev(巴伊兰大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SAFEdit通过多智能体框架分解编辑过程,提升代码编辑的可靠性与准确性,其迭代改进机制显著提高了任务成功率。

Comments Accepted to the EQUISA (Evaluation of Qualitative Aspects of Intelligent Software Assistants) workshop at EASE (Evaluation and Assessment in Software Engineering) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25720 2026-04-29 cs.CV cs.CL 70%

Toward Multimodal Conversational AI for Age-Related Macular Degeneration

迈向年龄相关性黄斑变性的多模态对话式人工智能

Ran Gu, Benjamin Hou, Mélanie Hébert, Asmita Indurkar, Yifan Yang, Emily Y. Chew, Tiarnán D. L. Keenan, Zhiyong Lu

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出OcularChat,一种基于多模态大语言模型的系统,通过模拟患者与医生对话,利用视网膜彩色照相进行黄斑变性诊断,展现出优于现有模型的分类性能和临床解释能力。

Comments 38 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21214 2026-04-29 cs.DB cs.AI 70%

A Demonstration of SQLyzr: A Platform for Fine-Grained Text-to-SQL Evaluation and Analysis

SQLyzr平台:一种细粒度文本到SQL评估与分析的演示

Sepideh Abedini, M. Tamer Özsu

机构 * University of Waterloo(滑铁卢大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文介绍SQLyzr平台,通过细粒度评估和分析改进文本到SQL模型,提供多种指标和真实场景下的评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25122 2026-04-29 cs.CV cs.AI 70%

M$^3$-VQA: A Benchmark for Multimodal, Multi-Entity, Multi-Hop Visual Question Answering

M$^3$-VQA:多模态、多实体、多跳视觉问答的基准测试

Jiatong Ma, Longteng Guo, Yuchen Liu, Zijia Zhao, Dongze Hao, Xuanxu Lin, Jing Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M$^3$-VQA引入了多实体问题,要求模型在多个文档间进行顺序和并行多跳推理,揭示了多模态大语言模型在知识获取和推理方面的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24935 2026-04-29 cs.CR cs.LG 70%

CAN-QA: A Question-Answering Benchmark for Reasoning over In-Vehicle CAN Traffic

CAN-QA:用于车载CAN流量推理的问答基准

Jing Chen, Abhijay Deevi, Onat Gungor, Tajana Rosing

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CAN-QA基准,将车载CAN流量分析转化为问答任务,评估大语言模型在时间推理和多条件推理上的表现。

Comments Accepted by the 35th International Conference on Computer Communications and Networks (ICCCN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24814 2026-04-29 cs.SE cs.AI 70%

SWE-QA: A Dataset and Benchmark for Complex Code Understanding

SWE-QA:复杂代码理解的数据库和基准测试

Laïla Elkoussy, Julien Perez

机构 * LRE, EPITA(EPITA研究中心) Bpifrance(法国国家研究基金会)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SWE-QA数据集,用于评估多跳代码理解,填补了简化评估任务与真实软件开发中复杂推理之间的差距。数据集包含9072个多选问题,评估多种推理模式,评估15种语言模型显示多跳推理存在显著挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 70%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02082 2026-04-29 cs.LG q-bio.QM 70%

FARM: Enhancing Molecular Representations with Functional Group Awareness

FARM:通过功能团意识增强分子表示

Thao Nguyen, Kuan-Hao Huang, Ge Liu, Martin D. Burke, Ying Diao, Heng Ji

机构 * Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校Siebel计算与数据科学学院) Department of Computer Science, Texas A&M University(德克萨斯大学计算机科学系) Department of Chemistry, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校化学系) Department of Chemical & Biomolecular Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校化学与生物分子工程系)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 FARM通过整合功能团注释提升分子表示,结合SMILES与分子图,改进Transformer模型的分子表示能力,实现功能团与结构信息的联合编码。

Comments Preprint. The code is available at: https://github.com/thaonguyen217/farm_molecular_representation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25136 2026-04-29 cs.CL cs.AI cs.LG 69%

Frictive Policy Optimization for LLMs: Epistemic Intervention, Risk-Sensitive Control, and Reflective Alignment

摩擦性政策优化用于大语言模型:认知干预、风险敏感控制与反思对齐

James Pustejovsky, Nikhil Krishnaswamy

机构 * Brandeis University(布拉德雷大学) Colorado State University(科罗拉多州立大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

AI总结 本文提出摩擦性政策优化框架,通过干预管理认知与规范风险,引入摩擦干预分类和统一方法,提升模型的认知能力与对齐性。

Comments Frictive Policy Optimization; epistemic alignment; risk-sensitive control; LLM alignment; clarification and refusal; preference learning; trust regions; dialogue agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03384 2026-04-29 cs.IR 67%

BridgeRAG: Training-Free Bridge-Conditioned Retrieval for Multi-Hop Question Answering

BridgeRAG:无训练桥条件检索用于多跳问答

Andre Bacellar

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 BridgeRAG通过桥条件检索提升多跳问答性能,无需训练或图数据库,通过三元评分器实现有效检索,实验显示其在选择性、不可替代性、可预测性和机制精确性方面均优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25175 2026-04-29 physics.soc-ph 67%

Indirect reciprocity beyond pairwise interactions

间接互惠超越 pairwise 互动

Ming Wei, Xin Wang, Junyu Lu, Longzhao Liu, Yishen Jiang, Hongwei Zheng, Shaoting Tang, Feng Fu

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究提出多玩家间接互惠框架,揭示群体合作的稳定原则,并展示群体结构对声誉动态的影响,为人工智能中的合作对齐提供基准。

Comments 21 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25022 2026-04-29 cs.HC 67%

AFA: Identity-Aware Memory for Preventing Persona Confusion in Multi-User Dialogue

AFA:面向防止多用户对话中身份混淆的身份感知记忆

Mohammad Al-Ratrout, Pavan Uttej Ravva, Shayla Sharmin, Aditya Raikwar, Ju Young Shin, Roghayeh Leila Barmaki

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 本文提出AFA框架,通过语音识别与用户记忆结合,实现多用户对话中的身份感知个性化,通过PAT数据集评估,展示身份感知路由显著提升Persona Attribution Accuracy。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22040 2026-04-29 cs.CR cs.SE 67%

"Your AI, My Shell": Demystifying Prompt Injection Attacks on Agentic AI Coding Editors

你的AI,我的Shell:解密面向代理AI编码编辑器的提示注入攻击

Yue Liu, Yanjie Zhao, Yunbo Lyu, Ting Zhang, Haoyu Wang, David Lo

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 研究分析了高权限代理AI编码编辑器的提示注入攻击,通过AIShellJack框架测试,发现攻击成功率高达84%,可实现从初始访问到数据外泄的多种攻击目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25231 2026-04-29 cs.CV cs.AI cs.CL 62%

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

DRAGON:一个用于基于证据的视觉推理的图示基准

Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

机构 * Arizona State University(亚利桑那州立大学) Adobe Research(Adobe研究) University of Maryland(马里兰大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL、cs.AI

AI总结 DRAGON基准评估模型在图示中基于证据的视觉推理能力,要求模型定位支持答案的视觉元素,包含图表、地图等,通过标注数据和评估框架检验八种最新视觉语言模型的定位能力。

Comments 22 Pages, 14 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24964 2026-04-29 cs.LG cs.CL 62%

Odysseys: Benchmarking Web Agents on Realistic Long Horizon Tasks

Odysseys:在现实长周期任务上评估网络代理

Lawrence Keunho Jang, Jing Yu Koh, Daniel Fried, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Odysseys基准,通过200个现实浏览任务评估长周期网络代理,引入基于评分的评估方法,发现传统二元评估不足,且前沿模型在效率上仍有提升空间。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏