arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10428 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10428 篇

2606.04466 2026-06-04 cs.CL 79%

Learning What to Learn: Stage-Specific Data Sets for SFT-then-RL in Small Language Model Reasoning

学习什么:小语言模型推理中SFT-then-RL的阶段特定数据集

Chongyang He, Rui Zhang, Zixuan Wang, Xin Li

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) DiDi(滴滴出行) University of Electronic Science and Technology of China(电子科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出一种难度感知的SFT-then-RL框架,通过阶段特定数据集(SFT阶段使用桥接机制,RL阶段使用批判微调)协调数据难度,提升小语言模型推理性能。

Comments 25 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19852 2026-06-04 cs.CL 79%

Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning

工具总是有益的吗?学习自适应调用工具以实现双模式多模态大语言模型推理

Qinghe Ma, Zhen Zhao, Yiming Wu, Jian Zhang, Lei Bai, Yinghuan Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出AutoTool模型,通过强化学习框架自适应决定是否调用工具,结合双模式推理策略和模式特定奖励函数,在提升准确率的同时降低推理开销。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18577 2026-06-04 cs.AI 79%

MedForge: Interpretable Medical Deepfake Detection via Forgery-aware Reasoning

MedForge:基于伪造感知推理的可解释医学深度伪造检测

Zhihui Chen, Kai He, Qingyuan Lei, Bin Pu, Jian Zhang, Yuling Xu, Mengling Feng

机构 * National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Hunan University(湖南大学) Xi’an Jiaotong University(西安交通大学) Guangdong Provincial People’s Hospital(广东省人民医院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出MedForge框架,通过构建大规模基准数据集MedForge-90K和局部-分析推理方法,实现可解释的医学图像伪造检测,在准确性和专家对齐解释上达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03918 2026-06-03 cs.AI 79%

Hedge-Bench: Benchmarking Agents on Hard, Realistic Tasks Pertaining to Financial Reasoning

Hedge-Bench:在金融推理相关的困难、现实任务上对智能体进行基准测试

Eric Cho, Shawn Huang, Alice Lu, Andy Lyu

机构 * Trata Brigham Young University

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出Hedge-Bench基准,包含102个基于对冲基金分析师实际工作推理轨迹的任务,用于评估AI智能体在开放金融推理问题上的表现,前沿模型得分低于16%。

Comments Dataset and evaluation harness available at github.com/Trata-Inc/trata-hedge-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03629 2026-06-03 cs.AI 79%

TSQAgent: Rating Time Series Data Quality via Dedicated Agentic Reasoning

TSQAgent: 通过专用智能体推理评估时间序列数据质量

Shunyu Wu, Dan Li, Haozheng Ye, Weibin Feng, Jian Lou, Bo Zhang, Wenjie Feng, Chenjuan Guo, See-Kiong Ng

机构 * Sun Yat-sen University(中山大学) China University of Mining Technology(中国矿业大学) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学) National University of Singapore(新加坡国立大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出TSQAgent框架,通过三个协作智能体(感知器、检查员、裁决者)识别相关质量维度并进行定量比较,显著提升LLM在时间序列数据质量评估中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03236 2026-06-03 cs.AI 79%

Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents

先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架

Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu

机构 * HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司) Zhongnan University of Economics and Law(中南财经政法大学) Jilin University(吉林大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出预推理感知框架(PRPF),通过轻量级多模态主动感知器(MPP)进行干预门控和上下文压缩,仅在需要时激活主动代理推理器(PAR),以解决主动移动代理中干预时机与方式决策的目标错位和冗余推理问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03066 2026-06-03 cs.AI 79%

CORE: Conflict-Oriented Reasoning for General Multimodal Manipulation Detection

CORE: 面向冲突的通用多模态篡改检测推理

Jinjie Shen, Yaxiong Wang, Yujiao Wu, Lechao Cheng, Tianrui Hui, Nan Pu, Zhihui Li, Zhun Zhong

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出CORE框架,通过构建冲突归因语料库和面向冲突的推理,增强多模态大语言模型的冲突捕捉能力,实现鲁棒且泛化的多模态篡改检测。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02747 2026-06-03 cs.CV cs.AI 79%

Plan2Map: A Multimodal Benchmark for Document-Grounded Geospatial Boundary Reconstruction from Planning Records

Plan2Map: 基于规划记录的文档驱动地理空间边界重建的多模态基准

Fabian Degen, Oishi Deb, Jindong Gu, Junchi Yu, Samuele Marro, Philip Torr, Jialin Yu

专题命中 推理评测 :planning(title,abstract);分类 cs.AI

AI总结 提出Plan2Map基准和GeoPlanAgent系统,通过文档证据提取、定位、地图配准、边界分割等步骤,从英国规划记录中重建地理空间边界,显著优于直接VLM方法。

Comments Project page: https://odeb1.github.io/Plan2Map_Project_Page/. Fabian Degen and Oishi Deb Contributed Equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02109 2026-06-02 cs.AI 79%

BADGER: Bridging Agentic and Deterministic Evaluation for Generative Enterprise Reasoning

BADGER:桥接生成式企业推理的自主与确定性评估

Shannon Serrao, Soumitra Chatterjee, Dorina Strori, Abhishek Sharma, Nathan Miller

机构 * Merkle Analytics

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出BADGER框架,统一文本到SQL评估与自主行为评估,通过混合执行准确率指标(Hybrid-EX)和自主评估套件,在工业查询上超越现有方法。

Comments 30 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00642 2026-06-02 cs.AI cs.CR 79%

Hidden Thoughts Are Not Secret: Reasoning Trace Exposure in LLMs

隐藏的思考并非秘密:大型语言模型中的推理痕迹暴露

Yu-An Lu, Ci-Yang Tsai, Yu-Lin Tsai, Raluca Ada Popa, Chia-Mu Yu

机构 * National Yang Ming Chiao Tung University(国家阳明交通大学) UC Berkeley(伯克利大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出推理暴露提示(REP)方法,通过影子模型生成的示范以辅助代码格式包装,从受害者模型中引出用户可见的推理痕迹,显著提高暴露痕迹与内部痕迹的相似性并保留有用推理信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00103 2026-06-02 cs.AI 79%

Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games

评估大语言模型中的交互式推理:一个带有可执行游戏的分层基准

Mingyuan Fan, Weiguang Han, Daixin Wang, Cen Chen, Zhiqiang Zhang, Jun Zhou

机构 * East China Normal University(东华师范大学) Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出一个多轮交互式推理评估框架,将推理视为主动证据获取和信念更新,通过474个可执行游戏基准测试大语言模型在成功率、交互效率、上下文鲁棒性和元认知适应方面的表现。

Comments preprint version, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09883 2026-06-02 cs.CV cs.AI 79%

The Cartesian Shortcut: Re-evaluate Vision Reasoning in Polar Coordinate Space

笛卡尔捷径:在极坐标空间中重新评估视觉推理

Xia Hu, Zhenrui Yue, Brian Potetz, Howard Zhou, Leonidas Guibas, Chun-Ta Lu, Zhicheng Wang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对多模态大语言模型在视觉推理中利用笛卡尔坐标捷径的问题,提出Polaris-Bench基准,将任务转换至极坐标空间,揭示模型缺乏拓扑不变性视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06995 2026-06-02 cs.AI 79%

What's Missing in Screen-to-Action? Towards a UI-in-the-Loop Paradigm for Multimodal GUI Reasoning

屏幕到动作中缺失了什么?面向多模态GUI推理的UI-in-the-Loop范式

Songze Li, Xiaoke Guo, Tianqi Liu, Biao Yi, Zhaoyan Gong, Zhiqiang Liu, Huajun Chen, Wen Zhang

机构 * Zhejiang University(浙江大学) ZJU-Ant Group Joint Lab of Knowledge Graph(浙大蚂蚁集团知识图谱联合实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出UI-in-the-Loop (UILoop) 范式,通过循环的屏幕-UI元素-动作过程,让多模态大模型显式学习UI元素的定位、语义和用法,实现可解释推理,并在UI理解任务上达到最优。

Comments Accepted by ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02823 2026-06-02 cs.CL 79%

R2-Router: A New Paradigm for LLM Routing with Reasoning

R2-Router: 一种基于推理的LLM路由新范式

Jiaqi Xue, Qian Lou, Jiarong Xing, Heng Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对现有LLM路由忽略输出长度对质量和成本影响的问题,提出R2-Router,通过将输出长度预算作为可控变量联合选择最优LLM和预算,实现低成本高质量路由。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03615 2026-06-02 cs.CL cs.SD eess.AS 79%

SARA: Stress Test Reasoning in Audio Deepfake Detection

SARA: 音频深度伪造检测中的压力测试推理

Binh Nguyen, Charles Fleming, Thai Le

机构 * Indiana University(印第安纳大学) Cisco Research(思科研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SARA框架,通过声学感知、推理-判决一致性与不和谐三个维度评估音频语言模型在对抗攻击下的推理可靠性,发现声学攻击降低一致性而语言攻击保持一致性但成功率更高,且推理轨迹的文本一致性可作为检测对抗样本的潜在指标。

Comments Preprint for ACL 2026 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24081 2026-06-02 cs.CL 79%

Global PIQA: Evaluating Commonsense Reasoning Across 100+ Languages and Cultures

Global PIQA:评估跨100多种语言和文化的常识推理

Tyler A. Chang, Catherine Arnett, Abdelrahman Sadallah, Abdelrahman Eldesokey, Abeer Kashar, Abolade Daud, Abosede Grace Olanihun, Adamu Labaran Mohammed, Adeyemi Praise, Adhikarimayum Meerajita Sharma, Aditi Gupta, Adril Putra Merin, Adwoa Bremang, Afitab Iyigun, Afonso Simplício, Ahmed Essouaied, Aicha Chorana, Akhil Eppa, Akintunde Oladipo, Akriti Kuri, Akshay Ramesh, Aleksei Dorkin, Alfred Malengo Kondoro, Alham Fikri Aji, Ali Eren Çetintaş, Allan Hanbury, Alou Dembele, Alp Niksarli, Álvaro Arroyo, Amin Bajand, Amol Khanna, Ana Chkhaidze, Ana Carolina Condez, Anamaria-Roberta Hartl, Andiswa Mkhonto, Andrew Hoblitzell, Andrew Tran, Angelos Poulis, Anirban Majumder, Anjali Chaudhary, Anna Vacalopoulou, Annette Kuuipolani Kanahele Wong, Annika Simonsen, Anton Kovalev, Anupam Nayak, Ashvanth S, Ayodeji Lana, Ayu Purwarianti, Bashar Alhafni, Benedict Busole, Bernard Ghanem, Bharti Nathani, Biljana Stojanovska Đurić, Blessing Ogundipe, Bolaotan Agbonile, Bragi Bergsson, Bruce Torres Fischer, Burak Tutar, Burcu Çınar, Cade Kane, Can Udomcharoenchaikit, Chadi Helwe, Chaithra Reddy Nerella, Chen Cecilia Liu, Chiamaka Nwokolo, Christopher Homan, Clément Sampebgo, Cristina España-Bonet, Cynthia Amol, Daeyoep Lee, Dan Saattrup Smart, Dana Arad, Daniil Dzenhaliou, Dasol Choi, David Liu, David Semedo, David Anugraha, Deborah Popoola, Deividas Mataciunas, Delphine Nyaboke, Dennis Owusu, Dhyuthy Krishna Kumar, Diogo Tavares, Diogo Glória-Silva, Divyanshu Goyal, DongGeon Lee, E. Kelly Buchanan, Ebele Nwamaka Anajemba, Egonu Ngozi Grace, Elena Mickel, Elias Herranen, Eliza Acharya, Eman Nisar, Emile Anand, Emmanuel Habumuremyi, Emuobonuvie Maria Ajiboye, Eryawan Presma Yulianrifat, Esther Adenuga, Ewa Rudnicka, Faith Itiola, Faran Taimoor Butt, Fareeha Fayyaz Sheikh, Fathima Thekkekara, Fatima Haouari, Faustin Nsengiyumva, Fenal Ashokbhai Ilasariya, Filbert Aurelian Tjiaranata, Firas Laakom, Francesca Grasso, Francesco Periti, Francesco Orabona, Gbenga Kayode Solomon, Genta Indra Winata, Gia Nghia Ngo, Gloria Udhedhe-oze, Gonçalo Vinagre, Gopi Naga Sai Ram Challagolla, Gorka Urbizu-Garmendia, Gouthami Vadithya, Guijin Son, Gulnaz Abdykadyrova, Gyan Swaroop Mohapatra, Hafeez Ullah, Hafsteinn Einarsson, Hai Hu, Hamidreza Saffari, Hamza Zaidi, Haopeng Zhang, Harethah Abu Shairah, Harry Vuong, Hele-Andra Kuulmets, Hitesh Laxmichand Patel, Houda Bouamor, Hwanjo Yu, Iben Nyholm Debess, İbrahim Ethem Deveci, Ikhlasul Akmal Hanif, Ikhyun Cho, Inês Vieira, Inês Calvo, Isaac Manzi, Ismael Illa Salifou, Ismail Daud, Ismail Yusuf, Itay Itzhak, Ivan Zhelyazkov, Ivan Belashkin, Ivan Spada, Jacob Brinton, Jafar Isbarov, Jaka Čibej, Jan Kocoń, Jan Cuhel, Jauza Krito, Jebish Purbey, Jennifer Za, Jennifer Mickel, Jenny Kunz, Jessica Ratovondranto, Jeyarajalingam Varsha, Jihae Jeong, Jimena Tena Dávalos, Jinu Lee, João Magalhães, John Seon Keun Yi, Jongin Kim, Joseph Chataignon, Joseph Marvin Imperial, Jubeerathan Thevakumar, Judith Land, Julia Alekseenko, Junchen Jiang, Jungwhan Kim, Kairit Sirts, Kamesh R, Kamesh V, Kanda Tshinu, Kätriin Kukk, Kaustubh Ponkshe, Kavsar Huseynova, Ke He, Kenneth Enevoldsen, Kent Joshua Alvarez, Kerem Zaman, Khalil Mrini, Kian Kyars, Komal Gour, Krishnakumar Lainitha, Krister Kruusmaa, Kunal Mukherjee, Kusum Chouhan, Laura Castro, Laura M. Porrino-Moscoso, Lenny Sivi Za Nzambi, Leshem Choshen, Levent Sencan, Lilja Øvrelid, Lisa Alazraki, Loretta Oma Jones, Lovina Ehimen-Ugbede, Luheerathan Thevakumar, Luxshan Thavarasa, Mahnoor Malik, Mamadou K. Keita, Mansi Jangid, Marco De Santis, Marcos Garcia, Marek Šuppa, Mariam D'Ciofalo, Marii Ojastu, Marium Attaullah, Maryam Sikander, Mausami Narayan, Maximos Skandalis, Mehak Mehak, Mehmet İlteriş Bozkurt, Melaku Bayu, Menan Velayuthan, Mhasilenuo Vizo, Michael Leventhal, Michał Marcińczuk, Mina Almasi, Mirna Potočnjak, Mithil Bangera, Mohammadamin Shafiei, Mohiba Ansari, Mridul Sharma, Mrityunjaya Indoria, Mughees Ur Rehman, Muhammad Ravi Shulthan Habibi, Murat Kolić, Murat Barkın Kınay, Nada Galant, Naina Singh Rathore, Naphat Permpredanun, Narada Maugin, Nathalie Norman, Nicholas Kluge Corrêa, Nikola Ljubešić, Nirmal Thomas, Nisansa de Silva, Nisheeth Joshi, Nitish Ponkshe, Nizar Habash, Nneoma Udeze, Noel Thomas, Noémi Ligeti-Nagy, Nouhoum Coulibaly, Odunayo Ogundepo, Odunayo Kareemat Buliaminu, Oghojafor Godswill Fejiro, Okechukwu God'spraise, Olanrewaju Samuel, Olaoye Deborah Oluwaseun, Olasoji Akindejoye, Olga Snissarenko, Onyinye Anulika Chiemezie, Orkun Kınay, Osman Tursun, Oyelade Oluwafemi Joshua, Oyesanmi Fiyinfoluwa, Pablo Rodríguez, Pablo Gamallo, Palak Arora, Pedro Valente, Peter Rupnik, Philip Oghenesuowho Ekiugbo, Prakhar Agarwal, Pramit Sahoo, Prokopis Prokopidis, Pua Niau-Puhipau, Quadri Yahya, Rachele Mignone, Raghav Singhal, Rahul Raja, Ram Mohan Rao Kadiyala, Raphael Merx, Rasmus Larsen, Ratnavel Rajalakshmi, Rishav Ghosh, Romina Oji, Ron Kekeha Solis, Rui Guerra, Rushikesh Zawar, Sa'ad Nasir Bashir, Saeed Alzaabi, Sahil Sandeep, Sai Pavan Batchu, Sai Sandeep Kantareddy, Saleha Muzammil, Salsabila Zahirah Pranida, Sam Buchanan, Samuel Rutunda, Sander Land, Sarah Sulollari, Sardar Ali, Saroj Sapkota, Sarveswaran Kengatharaiyer, Saulius Tautvaisas, Sayambhu Sen, Sayantani Banerjee, Sebastien Diarra, Segun Afolayan, Senthilnathan M, Sewoong Lee, Shaan Shah, Shankar Venkitachalam, Sharifa Djurabaeva, Sharon Ibejih, Shivanya Shomir Dutta, Siddhant Gupta, Silvia Paniagua Suárez, Sina Ahmadi, Sivasuthan Sukumar, Siyuan Song, Snegha A, Sokratis Sofianopoulos, Sona Elza Simon, Sonja Benčina, Sophie Gvasalia, Sphurti More, Spyros Dragazis, Stefan Milosavljević, Stephan P. Kaufhold, Suba S, Sultan Alrashed, Surangika Ranathunga, Taiga Someya, Taja Kuzman Pungeršek, Tal Haklay, Tasi'u Jibril, Tatsuya Aoyama, Tea Abashidze, Terenz Jomar Dela Cruz, Terra Blevins, Themistoklis Nikas, Theresa Idoko, Thu Mai Do, Tilek Chubakov, Tina Munda, Tobiloba Owoeye, Tommaso Gargiani, Uma Rathore, Uni Johannesen, Uwuma Ugwu, Vallerie Alexandra Putra, Vanya Bannihatti Kumar, Varvara Arzt, Vasily Konovalov, Vasudevan Nedumpozhimana, Viktoria Ondrejova, Viktoryia Horbik, Vishnu Vardhan Reddy Kummitha, Vuk Dinić, Walelign Sewunetie, Winston Wu, Xiaojing Zhao, Yacouba Diarra, Yaniv Nikankin, Yash Mathur, Yash Bagla, Yeshil Bangera, Yixi Chen, Yiyuan Li, Yolanda Xavier, Yonatan Belinkov, Zaid Alyafeai, Zhargal Batozargalova, Zhengyang Shan, Zhi Rui Tam, Zilu Tang, Zuzana Nadova, Baber Abbasi, Stella Biderman, David Stap, Duygu Ataman, Fabian Schmidt, Hila Gonen, Jiayi Wang, David Ifeoluwa Adelani

机构 * th Multilingual Representation Learning (MRL) Workshop(第五届多语言表示学习(MRL)研讨会)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文提出Global PIQA,一个由全球350多位研究人员手工构建的、覆盖100多种语言和文化的参与式常识推理基准,用于评估大语言模型在不同语言和文化中的表现。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31410 2026-06-01 cs.AI 79%

FAM-Bench: A Multimodal Benchmark for Condition-Aware Food-as-Medicine Reasoning

FAM-Bench:面向条件感知的“食物即药物”推理的多模态基准

Mingyang Mao, Bhargav Rishi Medisetti, Utkarsh Grover, Tanvir Ibrahim, Wenyan Li, Tingting Zhang, Xiaomin Lin

机构 * Department of Electrical Engineering, University of South Florida(佛罗里达州立大学电气工程系) Muma College of Business, University of South Florida(佛罗里达州立大学Muma商学院) Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出FAM-Bench多模态基准,包含2500个营养专家验证的实例,通过菜肴适宜性评估和比较分析两个任务,测试模型在特定健康状况下对食物选择的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31251 2026-06-01 cs.CV cs.AI 79%

ERGeoBench:A Comprehensive Benchmark for Embodied Reasoning and Geo-localization in Multimodal Large Language Models

ERGeoBench:多模态大语言模型中具身推理与地理定位的综合基准

Kaiwen Xue, Tao Wei, Guoxin Zhang, Zhonghong Ou, Kaoyan Lu, Yu Feng, Yifan Zhu, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) School of Materials Science and Engineering(材料科学与工程学院) China Mobile Research Institute(中国移动研究院) College of Computing and Data Science(计算与数据科学学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出ERGeoBench基准,通过单视图、全景视图和具身视图三种渐进设置评估多模态大语言模型在视觉驱动的具身地理定位中的能力,发现当前模型在高层次地理语义推理上表现良好,但在细粒度感知、度量定位和视图间空间一致性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31031 2026-06-01 cs.AI 79%

GraphARC: A Comprehensive Benchmark for Graph-Based Abstract Reasoning

GraphARC:基于图的抽象推理综合基准

Saku Peltonen, August Bøgh Rønberg, Andreas Plesner, Roger Wattenhofer

机构 * ETH Z\"urich Z\"urich Switzerland ETH Z\"urich

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出GraphARC基准,将抽象推理扩展到图结构数据,通过少样本变换学习任务评估模型在局部、全局和层次图变换上的泛化能力,并揭示语言模型的理解-执行差距和规模扩展障碍。

Comments Accepted at KDD 2026 Datasets and Benchmarks Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29833 2026-06-01 cs.AI 79%

OmniMatBench: A Human-Calibrated Multimodal Reasoning Benchmark Across 19 Materials Science Subfields

OmniMatBench:跨19个材料科学子领域的人类校准多模态推理基准

Wanhao Liu, Jiaqing Xie, Qian Tan, Weida Wang, Jue Wang, Ran Sun, Zhuo Yang, Wanli Ouyang, Lei Bai, Tianfan Fu, Lu Chen, Xin Chen, Yuqiang Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Southeast University(东南大学) Nanjing University(南京大学) Suzhou Laboratory(苏州实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 针对现有基准忽视从材料知识到应用的推理过程,提出OmniMatBench,包含3171个专家策划的问答与计算问题,覆盖19个子领域,评估13个多模态大模型,最佳模型仅得0.372分,揭示当前模型在材料科学推理中的显著差距。

Comments 22 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19923 2026-06-01 cs.CV cs.CL 79%

Distilling Counterfactual Reasoning from Language to Vision: Causal Graph Guided Post-Training for Video Understanding

从语言到视觉的反事实推理蒸馏:因果图引导的视频理解后训练

Yuefei Chen, Jiang Liu, Xiaodong Lin, Ruixiang Tang

机构 * Rutgers University(新泽西罗格斯大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对视觉语言模型在反事实推理上的不足,提出CounterVQA基准和CFGPT后训练方法,通过从语言模态蒸馏反事实推理能力提升视频理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30214 2026-05-29 cs.CL 79%

GRUFF: LLM Pronoun Fidelity, Reasoning, and Biases in German

GRUFF:德语中LLM的代词忠实度、推理与偏见

Fabian Mewes, Anne Lauscher, Vagrant Gautam

机构 * JobMatchMe GmbH(JobMatchMe公司) Trustworthy AI Lab(可信人工智能实验室) Heidelberg Institute for Theoretical Studies(海德堡理论研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 通过构建大规模德语数据集GRUFF,研究大型语言模型在四种性别一致系统与四组代词上的代词忠实度,发现模型在无显式上下文时对阳性和阴性实体表现出强语法一致,但对新代词xier和en较弱,且职业刻板印象在不同语法格和模型间相关性低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29512 2026-05-29 cs.AI 79%

MINDGAMES: A Live Arena for Evaluating Social and Strategic Reasoning in Multi-Agent LLMs

MINDGAMES: 多智能体LLM中社会与策略推理评估的实时竞技场

Kevin Wang, Anna Thöni, Benjamin Kempinski, Bobby Cheng, Jianzhu Yao, Benjamin Finch, Leon Guertler, Viraj Nadkarni, Yihan Jiang, Aliaksei Korshuk, Alexander Buyantuev, Ilya Makarov, Siyuan Wu, Yu-Chi Cheng, Yan-Ru Ju, Ti-Rong Wu, I-Hsuan Chu, Yu-Yu Yang, I-Chen Wu, Yitian Huang, Qinlu Cao, Yiheng Sun, Yuhong Dai, Hongkun Yao, Jingxuan Fu, Jiwei Zhang, Hao Liao, Mossimo Ebeling, Govind Arun, Sadhvik Bathini, Mihir S Arya, Avinash Anish, Aditya Ranjan, Kirtana Sunil Phatnani, Paval KS, Vrushali Mehta, Aravind S, Nikhil Arora, Tanya Upadhyay, Amol Bandagale, Yuan Lu, ChunEn Hsiao, YuTing Lin, Arvin Chung, Jerry John Thomas, Mathieu Laurière, Leshem Choshen, Yoram Bachrach, Pramod Viswanath, Maria Polukarov, Cheston Tan, Tal Kachman, Atlas Wang

机构 * NeurIPS 2025 Competition(NeurIPS 2025 会议)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出MINDGAMES多游戏竞技平台,通过四个游戏环境评估LLM智能体的社会推理与策略能力,揭示规则遵循瓶颈与排行榜有效性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29402 2026-05-29 cs.CV cs.AI 79%

Semantic and Visual Evidence for Efficient Long-Video Reasoning: A Solution for the HD-EPIC VQA Challenge

面向高效长视频推理的语义与视觉证据:HD-EPIC VQA挑战赛的解决方案

Yinsong Xu, Wei Jing, Liuxin Zhang, Wanjun Lv, Hui Li

机构 * Lenovo, China(联想(中国))

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出一种统一框架,通过解耦长视频推理为语义证据(粗到细提取全局过程结构)和视觉证据(基于目标的细粒度定位),并采用查询条件证据检索与整合,在HD-EPIC VQA挑战赛中取得竞争性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29319 2026-05-29 cs.CL 79%

Rethinking Stepwise Model Routing: A Cost-Efficient Table Reasoning Perspective

重新思考逐步模型路由:一种成本高效的表格推理视角

Shenghao Ye, Yuxiang Wang, Yu Guo, Dong Jin, Shuangwu Chen, Jian Yang

机构 * University of Science and Technology of China(中国科学技术大学) The University of Melbourne(墨尔本大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出EcoTab框架,通过分别估计表格令牌和文本令牌的不确定性并映射到下一步失败风险,实现表格推理中准确性与效率的更好平衡。

Comments 17pages, 15 figures, submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29229 2026-05-29 cs.AI 79%

Tailoring the Curriculum: Student-Centered Reasoning Distillation via Dynamic Data-Model Compatibility

定制课程:通过动态数据-模型兼容性进行以学生为中心的推理蒸馏

Jiahao Huang, Fei Cheng, Junfeng Jiang, Akiko Aizawa

机构 * University of Tokyo(东京大学) Kyoto University(京都大学) National Institute of Informatics(日本信息处理研究所)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出数据-模型兼容性(DMC)指标,通过联合考虑数据质量、相对难度和学生能力来评估数据集对推理蒸馏的适用性,并基于DMC动态选择数据以提升蒸馏性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28779 2026-05-28 cs.CL cs.CV 79%

The Abstraction Gap in Vision-Language Causal Reasoning

视觉-语言因果推理中的抽象差距

Chinh Hoang, Mohammad Rashedul Hasan

机构 * Department of Electrical and Computer Engineering, University of Nebraska--Lincoln, Lincoln, Nebraska, USA(电气与计算机工程系,内布拉斯加大学林肯分校,内布拉斯加,林肯,美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 针对视觉-语言模型(VLM)生成因果解释时语言流畅性与忠实因果推理的混淆问题,提出双探针方法和抽象差距(AG)指标,通过CAGE基准评估发现多数模型存在显著AG,但通过预训练和架构选择可缩小差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28433 2026-05-28 cs.CL 79%

Roles with Rails: Contract-Preserving Role Evolution in Multi-Agent Structured Reasoning

角色与轨道:多智能体结构化推理中保持契约的角色演化

Ling-Yue Ge, Lan-Zhe Guo

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 提出SERO框架,通过契约保持的角色演化机制(信用引导检索、保护终端聚合器、条件验证器修复、上下文赌博机控制器)解决多智能体系统中角色漂移和契约破坏问题,在真实推理基准上验证有效性。

Comments 33 pages, 23 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28398 2026-05-28 cs.AI 79%

HRBench: Benchmarking and Understanding Thinking-Mode Switch Strategies in Hybrid-Reasoning LLMs

HRBench:混合推理大语言模型中思维模式切换策略的基准测试与理解

Yansong Ning, Mianpeng Liu, Jingwen Ye, Weidong Zhang, Hao Liu

机构 * AI Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)人工智能方向)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 提出HRBench统一评估框架,系统研究混合推理LLM中基于提示、外部路由和推测执行三类切换策略在四种训练机制下的效率-效果权衡,揭示策略选择随模型规模和任务领域的变化规律。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28277 2026-05-28 cs.AI 79%

Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning

LLMs 是否从文本构建世界模型?多语言空间推理诊断

Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao

机构 * University of New South Wales(新南威尔士大学) Essential Energy University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 通过多语言诊断基准 MentalMap 评估大语言模型的空间推理能力,发现所有模型在视角推理上存在普遍的性能瓶颈(L3 推理悬崖),表明该限制源于纯文本工作记忆约束而非特定架构。

详情

展开后加载摘要…

URL PDF HTML 收藏