arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2605.28732 2026-07-17 cs.CL cs.AI cs.LG 版本更新 67%

MemTrace: Tracing and Attributing Errors in Large Language Model Memory Systems

MemTrace:大型语言模型记忆系统中的错误追踪与归因

Xinle Deng, Ruobin Zhong, Hujin Peng, Xiaoben Lu, Yanzhe Wu, Guang Li, Buqiang Xu, Yunzhi Yao, Jizhan Fang, Haoliang Cao, Junjie Guo, Yuan Yuan, Ziqing Ma, Yuanqiang Yu, Rui Hu, Baohua Dong, Hangcheng Zhu, Ningyu Zhang

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MemTrace框架,通过构建可执行的记忆演化图实现细粒度错误追踪,并利用自动归因方法定位根因,进而优化提示词提升下游任务性能。

Comments Ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21649 2026-07-14 cs.CV 67%

Seeing Isn't Orienting: A Cognitively Informed Hierarchical Benchmark for Object Orientation in MLLMs

看到并不等于定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yan, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

机构 * Boston University(波士顿大学) Johns Hopkins University(约翰霍普金斯大学)

专题命中 推理评测 :reasoning(abstract,abstract_cn)

AI总结 本文提出DORI基准,揭示多模态大语言模型在定向理解上的不足,发现其在角度估计和方向跟踪方面存在系统性缺陷,对机器人控制和3D场景重建有重要启示。

Comments Paper accepted to ECCV 2026 (Main Track). Previously, this version appeared as arXiv:2603.11410 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22588 2026-07-10 cs.CL cs.AI cs.LG 版本更新 67%

Rethinking LLM-as-a-Judge: Representation-as-a-Judge with Small Language Models via Semantic Capacity Asymmetry

重新思考大语言模型作为评判器:通过语义能力不对称利用小语言模型进行表示作为评判器

Zhuochun Li, Yong Zhang, Ming Li, Yuelyu Ji, Yiming Zeng, Ning Cheng, Yun Zhu, Yanmeng Wang, Shaojun Wang, Jing Xiao, Daqing He

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Pittsburgh(匹兹堡大学) University of Maryland, College Park(马里兰大学学院公园分校) University of Connecticut(康涅狄格大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨小语言模型能否作高效评估器,基于语义能力不对称假设提出“表示作为评判器”范式,通过INSPECTOR框架实例化,实验显示其在推理基准测试中性能出色,为可扩展评估提供了更优选择。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09595 2026-07-09 cs.AI cs.CL cs.LG 版本更新 67%

LiveOIBench: Can Large Language Models Outperform Human Contestants in Informatics Olympiads?

LiveOIBench:大语言模型在信息学奥林匹克竞赛中能超越人类参赛者吗?

Kaijian Zou, Aaron Xiong, Yunxiang Zhang, Frederick Zhang, Yueqi Ren, Jirong Yang, Ayoung Lee, Shitanshu Bhushan, Lu Wang

机构 * University of Michigan(密歇根大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在信息学奥林匹克竞赛中的表现,引入含403个专家策划问题的LiveOIBench基准,通过四个关键特性评估34个模型,发现GPT - 5等不及顶级人类参赛者,还表明强大推理模型特点及基准数据污染少。

Comments ICML 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05859 2026-07-08 cs.CV 新提交 67%

AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring

AVA-VLM:用于野外建筑工地监测的自适应视觉注意力视觉语言模型

Younggun Kim, Taeheon Kim, Youngseo Kim, Seunghee Park

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) AI+KCIR Global Resilience Research Center(人工智能与韩国气候变化影响韧性研究中心) SmartInside AI Co., Ltd.(思玛特因赛德人工智能有限公司) Sungkyunkwan University(成均馆大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 针对野外建筑工地监测,提出AVA-VLM自适应视觉注意力视觉语言模型,遵循粗到细推理策略,先对低分辨率全局图像推理,按需请求高分辨率局部裁剪,并引入区域感知思维链数据集,提升了低分辨率下的可靠性并减少视觉令牌使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04688 2026-07-07 cs.LG cs.AI cs.CE cs.CL 新提交 67%

URSA: Chemistry-Aware Benchmark for Utilitarian Retrosynthesis Assessment

URSA:用于功利性逆合成评估的化学感知基准测试

Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Anton Morgunov, Arkadii Lin, Maksim Kuznetsov, Rim Shayakhmetov, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine AI Limited(Insilico Medicine AI有限公司) Independent researcher(独立研究者) Insilico Medicine Canada Inc.(Insilico Medicine加拿大公司) Insilico Medicine Hong Kong Ltd.(Insilico Medicine香港有限公司)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对药物发现中合成规划任务,介绍URSA评估框架,能从形式和化学合理性角度评估合成路线,全面评估传统及基于大语言模型的逆合成解决方案,发现大语言模型在解决合成规划任务上不如专业模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04293 2026-07-07 cs.CL cs.AI cs.LG stat.ML 新提交 67%

CausalGame: Benchmarking Causal Thinking of LLM Agents in Games

因果游戏:在游戏中对大语言模型智能体的因果思维进行基准测试

Zhenhao Chen, Yongqiang Chen, Chenxi Liu, Junchi Yu, Xiangchen Song, Zijian Li, Jialin Li, Philip Torr, Bo Han, Kun Zhang

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong Baptist University(香港浸会大学) University of Oxford(牛津大学) New York University, Abu Dhabi(纽约大学阿布扎比分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究旨在通过因果游戏基准测试大语言模型智能体的因果思维能力,让智能体设计实验、收集数据并给出解决方案。设计含多种挑战的场景,发现当前智能体因果思维能力欠佳,为评估提供了测试平台。

Comments Zhenhao, Yongqiang, and Chenxi contributed equally to the project. A short version is accepted at the Forty-Third International Conference on Machine Learning (ICML) 2026 as an Oral presentation. Project website https://causalgame.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20723 2026-07-07 cs.CV 新提交 67%

Evaluation of Medical Vision Language Models HuluMed and MedGemma, and general purpose chatbots Gemma 3, ChatGPT Plus, and Claude Pro on real previously unseen wound images

医学视觉语言模型 HuluMed 和 MedGemma 以及通用聊天机器人 Gemma 3、ChatGPT Plus 和 Claude Pro 在真实未见伤口图像上的评估

Yunzhe Xue, Mohammed Saim Ahmed Quadri, Neal Panse, Justin W. Ady, Usman Roshan

机构 * Department of Computer Science, New Jersey Institute of Technology(新泽西理工学院计算机科学系) Vascular and Endovascular Surgery, Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院血管外科) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本研究评估了六种视觉语言模型在慢性伤口分析任务上的表现,发现通用模型 ChatGPT 和 Claude 显著优于医学专用模型,表明广泛的多模态推理能力比领域知识更重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28543 2026-07-07 cs.AI cs.CL cs.LG 版本更新 67%

Cultural Binding Heads in Language Models

语言模型中的文化绑定头

Avrile Floro, Luca Benedetto

机构 * Mistral-7B Mistral-Nemo-12B Llama-3.1-8B Gemma-2-9B

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过机制可解释性和析因设计,识别出8个语言模型中2-3个中间层注意力头对文化绑定有因果贡献,且绑定主要在预训练阶段形成,知识探测表明模型知道的知识远多于其行为表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17801 2026-07-07 cs.RO cs.CV 版本更新 67%

Robobench: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models as Embodied Brain

Robobench:作为具身大脑的多模态大语言模型的综合评估基准

Yulin Luo, Chun-Kai Fan, Menghang Dong, Jiayu Shi, Xiangju Mi, Mengdi Zhao, Bo-Wen Zhang, Cheng Chi, Jiaming Liu, Gaole Dai, Rongyu Zhang, Ruichuan An, Kun Wu, Zhengping Che, Shaoxuan Xie, Guocai Yao, Zhongxia Zhao, Pengwei Wang, Guang Liu, Zhongyuan Wang, Tiejun Huang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息多媒体国家重点实验室,计算机学院,北京大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Institute for Brain and Intelligence, Fudan University(脑与智能研究院,复旦大学) University of Science and Technology Beijing(北京科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 研究针对在动态非结构化环境中构建能感知、推理和行动的机器人的挑战,介绍RoboBench基准,涵盖多维度、多任务等,能评估多模态大语言模型,揭示其局限性并分析与下游控制关系,为量化高级认知提供支架。

Comments ECCV 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01245 2026-07-03 cs.CL cs.AI cs.CY cs.IR cs.LG 新提交 67%

Office Comprehension Benchmark

办公室理解基准

Firoz Shaik, Mateus Picanço Lima Gomes, Tanvir Aumi, Jingci Wang, Milos Milunovic, Filip Basara, Ivana Jovanovic, Vishwas Suryanarayanan, Neha Nandan Kenkare, Weiyao Xie, Zhipeng Han, Zheng Zhang, Waleed Shahid, Jay Rathi, Russell Scherer, Thong Q. Nguyen, Michael Bentley, Tamara Stankovic, Rasika Chakravarthy, Vishal Chowdhary

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Office Comprehension Bench,首个联合评估LLM对Word Excel和PowerPoint文件理解的基准,包含文件保真度问答和领域问答两个赛道,测试结构与视觉感知及多领域推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00276 2026-07-02 cs.LG cs.AI cs.CL 新提交 67%

Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds

测试前沿大语言模型在平行物理世界中的物理素养

Dong Zhang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出四阶段诊断方法评估LLM在陌生物理框架中的推理能力,在三个平行世界测试发现定性-定量不对称及自我审查薄弱。

Comments 37 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31529 2026-07-02 cs.CV 版本更新 67%

SVI-Bench: A Dynamic Microworld for Strategic Video Intelligence

SVI-Bench: 一个用于战略视频智能的动态微世界

Yulu Pan, Han Yi, Seongsu Ha, Md Mohaiminul Islam, Benjamin Zhang, Lorenzo Torresani, Gedas Bertasius

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Northeastern University(东北大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出SVI-Bench,一个基于团队体育动态微世界的大规模基准,通过四个层级(动态场景理解、因果推理、战略模拟、智能体合成)的9个任务评估视频智能从感知到战略规划的能力,发现模型在感知任务上表现良好但在认知层级上性能急剧下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28615 2026-06-30 cs.LG cs.AI cs.CL stat.ML 67%

What LLMs explain is not what they believe: Evaluating explanation sufficiency under models' own input beliefs

LLM 解释的内容并非其信念:基于模型自身输入信念评估解释充分性

Nhi Nguyen, Shauli Ravfogel, Rajesh Ranganath

机构 * New York University(纽约大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出自洽充分性(SCSuff)指标,利用 LLM 自身生成替代输入来评估自由文本解释的充分性,发现 LLM 解释通常不充分且与模型大小、准确率等弱相关。

Comments 23 pages, 9 figures, 13 tables, Forty-Third International Conference on Machine Learning (ICML 2026)

Journal ref Forty-Third International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28467 2026-06-30 cs.LG cs.AI cs.CL 67%

An Agentic AI Pipeline for Appliance-Level Energy Anomaly Detection and LLM-Driven Recommendations

一种用于设备级能源异常检测和基于LLM的推荐建议的智能体AI流水线

Dihia Falouz, Aida Douaibia, Amine Bechar, Youssef Elmir, Abbes Amira, Adel Oulefki

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种端到端智能体流水线,结合深度时间序列预测、变分异常检测和LLM推理,为办公建筑设备级能耗生成优先级排序的可操作维护建议。

Comments 07 pages, 01 figure, accepted for presentation at the IEEE International Conference on Communication, Computing, Networking, and Control in Cyber-Physical Systems (CCNCPS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.00539 2026-06-30 cs.LG cs.AI cs.CL 67%

Distributionally Robust Reinforcement Learning with Human Feedback

具有人类反馈的分布鲁棒强化学习

Debmalya Mandal, Paulius Sasnauskas, Goran Radanovic

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种分布鲁棒的强化学习方法,通过改进奖励基强化学习和直接偏好优化,提升模型在分布变化时的鲁棒性,实验显示在非分布任务中性能显著提升。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27619 2026-06-29 cs.AI cs.CL cs.HC cs.IR cs.LG 新提交 67%

DysLexLens: A Low-Resource LLM Framework for Analysing Dyslexic Learners Insights from Online Forums

DysLexLens:面向低资源场景的LLM框架,用于分析在线论坛中阅读障碍学习者的见解

Dana Rezazadegan, Atie Kia, Phongpadid Nandavong, Dominique Carlon, Jeremy Nguyen, Abhik Banerjee, James Marshall, Anthony McCosker, Yong-Bin Kang

机构 * Swinburne University of Technology(斯威本科技大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DysLexLens框架,通过字典过滤、知识图谱推理和评估机制,从低资源论坛数据中分析阅读障碍学习者对AI工具的使用体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27128 2026-06-26 cs.CV cs.RO 新提交 67%

FlameVQA: A Physically-Grounded UAV Wildfire VQA Benchmark with Radiometric Thermal Supervision

FlameVQA: 一个基于辐射热监督的物理基础无人机野火VQA基准

Mobin Habibpour, John Spodnik, Niloufar Alipour Talemi, Fatemeh Afghah

机构 * National Science Foundation(国家科学基金会) NASA(美国国家航空航天局)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 提出FlameVQA,一个基于FLAME 3数据集的无人机野火多选视觉问答基准,利用配对的RGB和辐射热TIFF图像实现温度基础的推理,评估了多种MLLM在检测、定位、覆盖估计等任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26105 2026-06-26 cs.CL cs.AI cs.LG 新提交 67%

Context Recycling for Long-Horizon LLM Inference

长程LLM推理的上下文回收

Derek Thomas

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ContextForge系统,通过结构化查询生成、外部记忆检索和受控合成实现上下文回收,在15轮对话基准中减少令牌消耗并保持回答质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25585 2026-06-25 cs.CV 新提交 67%

FeVOS: Foresight Expression Video Object Segmentation

FeVOS:前瞻性表达视频目标分割

Kehan Lan, Kaining Ying, Henghui Ding

机构 * Institute of Big Data, College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与技术学院大数据研究所)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出前瞻性表达视频目标分割任务,通过推理时空线索预测未来目标,并构建FeVOS数据集和FeVOS-R1模型,实现最先进性能。

Comments Accepted by ECCV 2026. Homepage: https://henghuiding.com/FeVOS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25207 2026-06-25 cs.LG cs.AI cs.CL 新提交 67%

ASAP: Agent-System Co-Design for Wall-Clock-Centered Auto HPO Research for ML Experiments

ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计

Taicheng Guo, Haomin Zhuang, Kehan Guo, Yujun Zhou, Nitesh V. Chawla, Olaf Wiest, Xiangliang Zhang

机构 * University of Notre Dame(圣母大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14609 2026-06-25 cs.CV 版本更新 67%

GroundSet: A Cadastral-Grounded Dataset for Spatial Understanding with Vector Data

GroundSet: 基于地籍数据的空间理解向量数据集

Roger Ferrod, Maël Lecene, Krishna Sapkota, George Leifman, Vered Silverman, Genady Beryozkin, Sylvain Lobry

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 针对多模态大模型在遥感精细空间理解上的不足,提出基于地籍矢量数据的大规模数据集,含510k高分辨率图像和380万标注对象,通过指令微调基准验证,标准架构可掌握细粒度空间定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24083 2026-06-24 cs.CL cs.AI cs.LG 新提交 67%

CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

CAVEWOMAN: 大型语言模型在语言输入和输出压缩下的行为

Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt

机构 * Independent(独立研究者) Adobe Research(Adobe研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道评估协议CAVEWOMAN,发现输出压缩降低API模型成本(1.4-2.4倍),输入压缩反而增加成本(~1.15倍)并导致准确率下降和文本偏离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18648 2026-06-24 physics.comp-ph 新提交 67%

Deep Research in Physical Sciences: A Multi-Agent Framework and Comprehensive Benchmark

物理科学中的深度研究:多智能体框架与综合基准

Yigeng Jiang, Tengchao Yang, Taoyong Cui, Jiaxing Wan, Yuan Wang, Weida Wang, Zhiyu Liu, Chuyi Peng, Binzhao Luo, Maoli Gao, Huaihai Huang, Yuqianer Zeng, Ziyang Zheng, Dongchen Huang, Chao Chen, Zichao Liu, Weiping Shen, Shuchen Pu, Siyu Zhou, Runmin Ma, Yusong Hu, Fei Chao, Bo Zhang, Xiawu Zheng, Zifu Wang, Lei Bai, Yunqi Cai, Shufei Zhang

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 提出PhySciBench基准评估LLM在物理科学中的深度研究能力,并开发DelveAgent多智能体框架,通过自适应规划、双粒度记忆和分层反思机制提升准确率并降低推理成本。

Comments v3: fix error and add data, codes publicly link on Abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10044 2026-06-24 cs.AI cs.CL cs.CY cs.LG 67%

Safety Under Scaffolding: How Evaluation Conditions Shape Measured Safety

脚手架下的安全性:评估条件如何影响测量的安全性

David Gringras

机构 * Harvard University(哈佛大学) MIT(麻省理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过62,808次盲法预注册评估,测试了六种前沿模型在四种部署配置下的安全性,发现脚手架架构对安全性影响较小,而格式转换(如选择题与开放式问题)可导致5-20个百分点的测量差异,且模型-脚手架间存在显著异质性,质疑了单一综合安全性分数的实用性。

Comments 74 pages including appendices. 6 frontier models, 62,808 primary observations (~89k total). Pre-registered: OSF DOI 10.17605/OSF.IO/CJW92. Code and data: https://github.com/davidgringras/safety-under-scaffolding

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01752 2026-06-24 cs.LG cs.AI cs.CL cs.CR 版本更新 67%

Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training

无窥调优:可证明的泛化边界与鲁棒的大语言模型后训练

Ismail Labiad, Mathurin Videau, Matthieu Kowalski, Marc Schoenauer, Alessandro Leite, Julia Kempe, Olivier Teytaud

机构 * Meta FAIR LISN, Inria, CNRS(LISN,Inria,CNRS) NYU Courant Institute(NYU Courant学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BBoxER黑盒进化方法用于LLM后训练,通过隐式压缩数据诱导信息瓶颈,提供非平凡泛化边界和对数据投毒、提取攻击的鲁棒性理论保证,实验证明其有效性和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21075 2026-06-23 cs.CL cs.AI cs.LG 新提交 67%

FiLM-Coordinated Dual-Branch Transformer for Global-Local Dependency Modeling in Language Modeling

FiLM协调的双分支Transformer用于语言建模中的全局-局部依赖建模

Zhiqiang Zhou, Xu Ling, Junliang Dai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出FiLM协调的双分支Transformer,通过特征级线性调制动态协调全局与局部分支,在轻量级设置下优于单分支基线。

Comments 14 pages, 7 figures, 7 tables. Small-scale language modeling study on FiLM-coordinated dual-branch Transformer architectures, including multi-seed evaluation, cross-dataset validation, ablation studies, efficiency analysis, and parameter-matched fairness baselines

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20661 2026-06-23 cs.AI cs.CL cs.LG 新提交 67%

From Knowing to Acting: Benchmarking Self-Awareness Capability of LLM Agents

从知道到行动:基准测试LLM代理的自我意识能力

Yifan Li, Shengbin Yue, Boyu Feng, Jinhu Qi, Bo Ke, Zixing Song, Hongru Wang, Zhongyu Wei, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Fudan University(复旦大学) University of Edinburgh(爱丁堡大学) Tencent(腾讯) University of Bristol(布里斯托大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出KAPRO框架和KAware数据集,通过解耦元认知判断与自主执行,评估LLM代理的自我意识能力,发现其与任务成功强相关但在内部能力场景中下降,开源模型易过度使用工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22219 2026-06-23 physics.soc-ph 新提交 67%

Lost in Aggregation: A Multi-Scale Diagnostic Benchmark for LLM Spatial Navigation

迷失在聚合中:LLM空间导航的多尺度诊断基准

Yuhan jiang, Peng Luo, Liqiu Meng

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 提出多尺度诊断基准,将迷宫导航分解为局部、节点和全局三个认知层次,评估LLM在空间推理中的失败位置,发现跨尺度聚合是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24551 2026-06-23 cs.CV 版本更新 67%

PhyGDPO: Physics-Aware Groupwise Direct Preference Optimization for Physically Consistent Text-to-Video Generation

PhyGDPO: 物理感知的分组直接偏好优化以实现物理一致的文本到视频生成

Yuanhao Cai, Kunpeng Li, Menglin Jia, Jialiang Wang, Junzhe Sun, Feng Liang, Weifeng Chen, Felix Juefei-Xu, Chu Wang, Ali Thabet, Xiaoliang Dai, Xuan Ju, Alan Yuille, Ji Hou

机构 * Meta Superintelligence Labs(Meta超智能实验室) Johns Hopkins University(约翰霍普金斯大学) Meta BizAI(Meta商业人工智能)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 提出PhyAugPipe构建大规模物理增强数据集PhyVidGen-135K,并设计PhyGDPO框架,利用分组Plackett-Luce模型和物理引导奖励机制,实现物理一致的文本到视频生成。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏