arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-07 至 2026-07-07 共收录 712 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 164 篇

2607.04688 2026-07-07 cs.LG cs.AI cs.CE cs.CL 新提交 75%

URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment

URSA:用于功利性逆合成评估的化学感知基准测试

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Anton Morgunov, Arkadii Lin, Maksim Kuznetsov, Rim Shayakhmetov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(Insilico Medicine AI有限公司) Independent researcher(独立研究者) Insilico Medicine Canada Inc.(Insilico Medicine加拿大公司) Insilico Medicine Hong Kong Ltd.(Insilico Medicine香港有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对药物发现中合成规划任务,介绍URSA评估框架,能从形式和化学合理性角度评估合成路线,全面评估传统及基于大语言模型的逆合成解决方案,发现大语言模型在解决合成规划任务上不如专业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04623 2026-07-07 cs.SE cs.DC 新提交 75%

Can LLMs Really Recover Microservice Failures? A Recovery-Aware Evaluation of Diagnosis-to-Action Reasoning

大语言模型真的能恢复微服务故障吗?对诊断到行动推理的恢复感知评估

Jiaxing Qi, Zhongzhi Luan, Hongyu Zhang, Shaohan Huang, Carol Fung, Yongxin Tong, Hailong Yang, Depei Qian

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究大语言模型在云原生微服务系统中恢复故障的能力,提出R2Act框架,定义相关内容并实例化为基准数据集,评估多种方法,发现恢复失败多因难以将诊断证据转化为有效恢复行动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03884 2026-07-07 cs.SE 新提交 75%

LogNLQ: Natural-Language Log Querying with Parser-Induced and Semantically Grounded Schemas

LogNLQ:基于解析器诱导和语义基础模式的自然语言日志查询

Juepeng Wang, Jinyang Liu, Zhuangbin Chen, Zibin Zheng

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究自然语言日志查询难题,提出LogNLQ框架,通过解析日志成表、双粒度语义标注及语义搜索获取候选模式,结合大语言模型生成可执行SQL,还引入LogNLQ-Bench,实验证明其性能优越。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03440 2026-07-07 cs.IR 新提交 75%

Improving Access to Historical Archives with Real-time RAG-based Systems

利用基于实时检索增强生成(RAG)的系统改善对历史档案的访问

Stergios Konstantinidis, Hayman Lotfy, Alexis Erne, Faruk Zahiragic, Min-Yen Kan, Michalis Vlachos

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对数字化历史档案访问难题,提出集成大语言模型的端到端框架,含OCR优化模块和语义检索重排管道,实验表明能减少OCR错误并提升检索效果,使档案系统更具交互性和语义可搜索性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02991 2026-07-07 cs.CV 新提交 75%

GuideMe: Multi-Domain Task Guidance and Intervention in Streaming Video

GuideMe:流视频中的多域任务指导与干预

Fang Liu, Jinpeng Chen, Ke Xu, Yuhao Liu, Huankang Guan, Xudong Lu, Bo Yang, Gerhard Hancke, Rui Liu, Rynson W. H. Lau

机构 * City University of Hong Kong(香港城市大学) Huawei Research(华为研究院) University of Science and Technology of China(中国科学技术大学) Chinese University of Hong Kong(香港中文大学) City University of Hong Kong (Dongguan)(香港城市大学(东莞))

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 构建流视频多域基准GuideMe,支持训练和评估用于闭环交互任务指导的MLLMs,设计评估框架衡量模型能力,实验发现现有MLLMs虽擅提供指令,但难识别执行错误并反馈。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07591 2026-07-07 cs.LG cs.AI cs.CL 版本更新 75%

ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research

ResearchClawBench: 端到端自主科学研究基准

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao, Yiheng Wang, Qi Li, Kun Li, Sheng Xu, Shengdu Chai, Fangchen Yu, Xiangyu Zhao, Zhangrui Zhao, Weijie Ma, Zijie Guo, Koutian Wu, Haoyu Zhou, Haoxiang Yin, Lixue Cheng, Chaofan Hu, Haoxuan Li, Lu Mi, Xuxuan Xie, Yifan Zhou, Ruizhe Chen, Zhiwang Zhou, Xingjian Guo, Yuhao Zhou, Xuming He, Shengyuan Xu, Xinyu Gu, Jiamin Wu, Mianxin Liu, Chunfeng Song, Fenghua Ling, Dongzhan Zhou, Shixiang Tang, Yuqiang Li, Mao Su, Peng Ye, Siqi Sun, Bin Wang, Xue Yang, Zhenfei Yin, Tianfan Fu, Guangtao Zhai, Wanli Ouyang, Bo Zhang, Lei Bai, Wenlong Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ResearchClawBench基准,包含10个领域40个任务,通过多模态评分标准评估自主科研能力,最强智能体仅得21.5分,揭示当前系统在实验协议、证据匹配和科学核心方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17418 2026-07-07 eess.SY cs.SY 版本更新 75%

PowerDAG: Supervisory Agentic AI System for Automating Distribution Grid Analysis

PowerDAG:用于自动化配电网络分析的可靠代理AI系统

Emmanuel O. Badmus, Amritanshu Pandey

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PowerDAG,一种用于自动化复杂配电网络分析的代理AI系统,通过自适应检索和即时监督机制提升可靠性,实验显示其在未见查询上表现优异,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04033 2026-07-07 cs.LG cs.AI 新提交 73%

OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers

OmniOpt:现代优化器的分类法、几何结构及基准测试

Siyuan Li, Jiabao Pan, Yumou Liu, Zhuoli Ouyang, Xin Jin, Xinglong Xu, Jingxuan Wei, Shengye Pang, Jintao Che, Xuanhe Zhou, Conghui He, Cheng Tan

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai University(上海大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学) UCAS(中国科学技术大学) Zhejiang University(浙江大学) Southern University of Science and Technology(南方科技大学)

专题命中 评测与基准 :language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 针对大规模模型训练的优化器选择受多种因素制约且方法零散,介绍OmniOpt,通过五阶段元管道、规范约束线性最小化预言机等构建统一分类法和跨域基准测试,为优化器选择提供操作坐标系。

Comments Survey & benchmark preprint V1 (91 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交 73%

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05409 2026-07-07 cs.AI cs.CL 版本更新 73%

Agentic Retrieval-Augmented Generation for Financial Document Question Answering

代理检索增强生成用于财务文档问答

Yang Shu, Yingmin Liu, Zequn Xie

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出FinAgent-RAG框架,通过迭代检索-推理循环和自我验证,提升金融文档问答的精度。引入对比金融检索器、程序化思维模块和自适应策略路由,实验表明在三个基准数据集上均取得显著效果,准确率提升5.62-9.32个百分点。

Comments This paper is withdrawn due to significant methodological errors in the experimental design that fundamentally affect the validity of the results. The errors are not correctable within the current framework, and the conclusions can no longer be supported. We apologize for any inconvenience caused to readers

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.10711 2026-07-07 cs.SE cs.AI cs.CL 版本更新 73%

Code Benchmarks Should Prioritize Rigor, Reliability, and Reproducibility

代码基准应优先考虑严谨性、可靠性和可重复性

Jialun Cao, Yuk-Kit Chan, Zixuan Ling, Wenxuan Wang, Shuqing Li, Mingwei Liu, Ruixi Qiao, Yuting Han, Chaozheng Wang, Boxi Yu, Pinjia He, Shuai Wang, Zibin Zheng, Michael R. Lyu, Shing-Chi Cheung

机构 * The Chinese University of Hong Kong(香港中文大学) Renmin University of China(中国人民大学) Sun Yat-Sen University(中山大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究代码基准在评估大语言模型中的作用,指出其质量影响对模型能力的解读。通过对672个代码基准的调查发现实际与认知有差距,提出代码基准应在构建、评估和发布中分别注重严谨性、可靠性和可重复性,并给出准则。

Comments 66 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04727 2026-07-07 cs.SE cs.AI cs.CV 新提交 70%

Dashboard2Code: Evaluating Multimodal Models on Reconstructing Interactive Dashboards

Dashboard2Code:在重建交互式仪表板上评估多模态模型

Tianhao Niu, Ziyu Han, Qiguang Chen, Shiqi Zhou, Baocai Shan, Hengjie Fang, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics(社会计算与交互机器人研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态模型在交互式仪表板重建任务,介绍Dashboard2Code任务,提出DashboardMimic基准及自动化评估框架,实验发现开源与闭源模型在此任务上有差距。

Comments Accepted to ACL2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04436 2026-07-07 cs.SE cs.AI 新提交 70%

A Retrieval-Augmented Framework for Detecting and Resolving Pragmatic Ambiguities in Natural Language Requirements

一种用于检测和解决自然语言需求中语用歧义的检索增强框架

Pavithra PM Nair, Preethu Rose Anish

机构 * Tata Consultancy Services(塔塔咨询公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究自然语言需求中的语用歧义,利用检索增强技术和不同领域知识库模拟不同专业利益相关者,生成候选消歧需求并验证,评估该方法在需求文档上的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04008 2026-07-07 cs.CL cs.IR 新提交 70%

Candidate-Constrained Retrieval-Augmented Generation for LongEval-RAG: System Design and Empirical Analysis

用于LongEval-RAG的候选约束检索增强生成:系统设计与实证分析

Yingdong Yang, Haijian Wu

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 介绍用于LongEval-RAG的候选约束检索增强生成系统,结合多种方法,经评估得出最强平衡变体rule-minilm,表明主要增益来自稳定规则证据单元与句子级神经选择结合,强调多指标评估需求。

Comments Published in CEUR Workshop Proceedings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03887 2026-07-07 cs.CR cs.AI cs.SE 新提交 70%

Advanced Topic Modeling Techniques for Categorizing Software Vulnerabilities

用于软件漏洞分类的高级主题建模技术

Utkarsh Tiwari, Spoorthi M, Anirudh S, Nidhin Prabhakar T.

机构 * Department of Computer Science & Engineering, Amrita School of Computing, Bengaluru, Amrita Vishwa Vidyapeetham, India(计算机科学与工程系,Amrita计算学院,班加罗尔,Amrita世界大学,印度)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究利用大语言模型驱动的主题建模技术,从软件漏洞数据集中提取有意义见解,采用多种模型及降维和聚类方法,增强网络安全威胁优先级排序与决策,支持漏洞管理的可扩展自动化解决方案。

Comments 10 pages, 10 figures. Accepted at the 16th International Conference on Computing, Communication and Networking Technologies (ICCCNT 2025), July 6-11, 2025, IIT Indore, Madhya Pradesh, India. IEEE proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02897 2026-07-07 cs.CR cs.AI cs.CV 新提交 70%

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。

Comments 17 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01425 2026-07-07 cs.AI 新提交 70%

Agent4cs: A Multi-agent System for Code Summarization in Large Hierarchical Codebases

Agent4cs:面向大型分层代码库的代码摘要多智能体系统

Yongjian Tang, Ezgi Sarikayak, Doruk Tuncel, Jie M. Zhang, Thomas Runkler

机构 * Siemens AG(西门子股份公司) Technical University of Munich(慕尼黑工业大学) Kings College London(伦敦国王学院)

专题命中 评测与基准 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 提出多智能体框架Agent4cs,通过自底向上方式对大型代码库进行摘要,包含摘要、关键词提取和质量保证三个智能体,在语义一致性和关键词覆盖率上分别提升8%和38%。

Comments Accepted to the main track of the 23rd European Conference on Multi-Agent Systems (EUMAS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31644 2026-07-07 cs.CL cs.CY 新提交 70%

Moral Safety in LLMs: Exposing Performative Compliance with Puzzled Cues

大语言模型中的道德安全:揭示对困惑线索的表演性遵从

Mohammadamin Shafiei, Shuyue Stella Li, Yulia Tsvetkov

机构 * University of Milan(米兰大学) University of Washington(华盛顿大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出“表演性遵从”概念,揭示大语言模型在道德困境中当身份标签被隐藏时公平性显著下降,并引入线索变化方法和“线索可见性差距”指标来区分真实与表演性道德安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09118 2026-07-07 cs.AI 新提交 70%

ComplexConstraints and Beyond: Expert Rubrics for RLVR

复杂约束与超越:RLVR的专家评分标准

Sushant Mehta, Liudas Panavas, Suhaas Garre, Edwin Chen

机构 * Surge AI

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出专家设计的评分标准作为评估和训练信号,通过复杂指令遵循和企业智能体任务验证,在RL训练中显著提升模型性能。

Comments Accepted to the GEM workshop at ACL 2026: https://gem-workshop.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30673 2026-07-07 cs.CL 版本更新 70%

TeachObs: A Human-Validated Benchmark for Multimodal Teaching Observation and Model Evaluation

TeachObs:多模态教学观察与模型评估的人工验证基准

Yeil Jeong, Youngjin Yoo, Jiyoung Bae, Seobin Sohn, Hyejin Han, Jinseo Lee, Howard Scott, Unggi Lee

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Pai Chai University(培才大学) Seoul National University(首尔国立大学) Ewha Womans University(成均馆大学) University of Wolverhampton(沃尔夫汉普顿大学) Korea University Sejong Campus(韩国大学世宗校区)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出TeachObs基准,包含30节公开课视频的5158个15秒场景,由7名研究者标注39个二值观察码,并评估5个前沿视觉大语言模型在三种任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08678 2026-07-07 cs.LG 版本更新 70%

MLS-Bench: A Holistic and Rigorous Assessment of AI Systems on Building Better AI

MLS-Bench:对构建更好AI的AI系统的全面且严格评估

Bohan Lyu, Yucheng Yang, Siqiao Huang, Jiaru Zhang, Qixin Xu, Xinghan Li, Xinyang Han, Yicheng Zhang, Huaqing Zhang, Runhan Huang, Kaicheng Yang, Zitao Chen, Wentao Guo, Junlin Yang, Xinyue Ai, Wenhao Chai, Yadi Cao, Ziran Yang, Kun Wang, Dapeng Jiang, Huan-ang Gao, Shange Tang, Chengshuai Shi, Simon S. Du, Max Simchowitz, Jiantao Jiao, Dawn Song, Chi Jin

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Washington(华盛顿大学) Purdue University(Purdue 大学) Harvard University(哈佛大学) University of Pennsylvania(宾夕法尼亚大学) Shanghai Jiao Tong University(上海交通大学) UC San Diego(圣地亚哥大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出MLS-Bench基准,包含12个领域140个任务,评估AI系统能否发明通用且可扩展的机器学习方法,发现当前智能体在方法发明上仍远逊于人类,瓶颈在于科学洞察而非单纯搜索或计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09662 2026-07-07 cs.MA cs.AI cs.HC 版本更新 70%

AgentDynEx: Nudging the Mechanics and Dynamics of Multi-Agent Simulations

AgentDynEx: 调节多智能体模拟的机制与动态

Jenny Ma, Riya Sahni, Karthik Sreedhar, Lydia B. Chilton

机构 * Columbia University(哥伦比亚大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AgentDynEx通过配置矩阵和nudging技术帮助设置多智能体模拟,平衡机制与动态,提升模拟复杂性与动态表现。

Comments 40 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02510 2026-07-07 cs.LG cs.DC cs.NE cs.PF 版本更新 70%

ParEVO: Synthesizing Code for Irregular Data: High-Performance Parallelism through Agentic Evolution

ParEVO:为不规则数据合成代码:通过智能进化实现高性能并行

Liu Yang, Zeyu Nie, Andrew Liu, Felix Zou, Deniz Altinbüken, Amir Yazdanbakhsh, Quanquan C. Liu

机构 * Department of Computer Science, Yale University(耶鲁大学计算机科学系) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对不规则数据并行计算难题,ParEVO框架通过构建数据集、微调模型及进化编码代理,合成高性能并行算法,在基准测试中加速显著,优于商业模型及专家基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04355 2026-07-07 cs.SE cs.LG 70%

Where Do LLMs Still Struggle? An In-Depth Analysis of Code Generation Benchmarks

LLMs仍面临哪些挑战?对代码生成基准的深入分析

Amir Molzam Sharifloo, Maedeh Heydari, Parsa Kazerooni, Daniel Maninger, Mira Mezini

机构 * The Hessian Center for Artificial Intelligence(黑森人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究研究中心ATHENE)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文分析了LLMs在代码生成基准中的表现,识别出主要失败任务,并探讨了静态复杂度和常见问题导致的弱点。

Comments To be published in Proceedings of 2025 2nd IEEE/ACM International Conference on AI-powered Software (AIware), Data & Benchmark Track

Journal ref AIware (2025) 249-253

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15135 2026-07-07 cs.CL 版本更新 70%

TrendFact: A Benchmark Towards Hotspot Perception in Automatic Fact-Checking

TrendFact:自动事实核查中热点感知的基准

Xiaocheng Zhang, Xi Wang, Yifei Lu, Jianing Wang, Zhuangzhuang Ye, Mengjiao Bao, Peng Yan, Xiaohong Su

机构 * Harbin Institute of Technology(哈尔滨工业大学) National University of Defense Technology(国防科学技术大学) Northeastern University(东北大学) East China Normal University(华东师范大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究自动事实核查范式在资源受限环境下面临风险不对称挑战,引入TrendFact基准及评估热点感知能力的指标,提出FactISR框架提升热点感知能力和计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01764 2026-07-07 cs.LG 版本更新 70%

Octax: Accelerated CHIP-8 Arcade Environments for Reinforcement Learning in JAX

Octax:用于JAX中强化学习的加速CHIP-8街机环境

Waris Radji, Thomas Michel, Hector Piteau

机构 * Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189-CRIStAL(里尔大学、法国国家科学研究中心、中央理工大学、UMR 9189-CRIStAL)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究为强化学习引入Octax,基于CHIP-8仿真在JAX实现经典街机游戏环境,相比传统CPU模拟器有数量级加速,可训练RL智能体,模块化设计便于扩展,是大规模RL实验理想平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04331 2026-07-07 cs.RO cs.CV 新提交 67%

Agent-driven Long-tail Simulation for Autonomous Driving

用于自动驾驶的智能体驱动长尾模拟

Junru Gu, Lijin Yang, Jianing Huang, Shu Liu, Zhongzhan Huang, Hang Zhao

机构 * IIIS, Tsinghua University(清华大学交叉信息研究院) Bosch Research(博世研究院)

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对现有自动驾驶模拟器局限性,提出智能体驱动模拟框架,通过结构化动作接口由大语言模型控制道路参与者,还引入SemanticPlan基准测试,结果表明长尾场景仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04255 2026-07-07 eess.SY cs.SY 新提交 67%

Towards Effcient Low Altitude Sensing: A Dual Heterogeneous Graph Learning Method for UAV Task Allocation

迈向高效低空传感:一种用于无人机任务分配的双异构图学习方法

Guangyu Lei, Tianhao Liang, Bingyan Xie, Tingting Zhang

专题命中 评测与基准 :large language model(abstract);language model(abstract)

AI总结 针对传统无人机任务分配方法难捕捉任务依赖与通信关系的问题,提出基于双异构图学习的方法,构建任务图与通信图,将分配问题转为结构匹配问题,用图注意力网络和交叉注意力机制优化匹配,提升任务完成率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03751 2026-07-07 cs.RO 新提交 67%

Look Before You Leap: Distilling Tree Search into Action Evaluation for Frozen VLA Models

三思而后行:将树搜索提炼为冻结视觉语言动作模型的动作评估

Xinyi Xie, Zican Hu, Zhanyu Liu, Yicheng Dong, Wenhao Wu, Zhenhong Sun, Haoran Li, Chunlin Chen, Zhi Wang, Pichao Wang

机构 * Nanjing University(南京大学) Australian National University(澳大利亚国立大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nvidia(英伟达)

专题命中 评测与基准 :pretraining(abstract);post-training(abstract)

AI总结 研究发现视觉语言动作(VLA)模型泛化能力差的关键瓶颈在于动作评估。提出SVA框架,通过蒙特卡洛树搜索探索输出分布,将知识提炼到轻量级Q值模型,提升任务成功率,且保持泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02908 2026-07-07 cs.CV 新提交 67%

Holo-Captioning: Toward the Text Equivalent of 3D Scenes

全息字幕:迈向3D场景的文本等效物

Kun-Yu Lin, Chengke Bu, Zhenguo Li, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Frontier Robotics(前沿机器人)

专题命中 评测与基准 :LLM(abstract,abstract_cn)

AI总结 研究提出全息字幕任务,先将其定义为生成结构化文本描述,开发字幕引擎及大规模基准,在此基础上提出HoloScribe模型,还给出评估指标和测试集,该模型性能超现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏