arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 958 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 958 篇

2608.07621 2026-08-11 cs.AI cs.CV cs.RO 新提交 85%

CMU-Drive and V2V-VLA: Cooperative Multi-agent Unified Driving with Reasoning Benchmark and Vehicle-to-Vehicle Vision-Language-Action Models

CMU-Drive与V2V-VLA:具备推理能力的协同多智能体统一驾驶基准及车对车视觉-语言-动作模型

Hsu-kuang Chiu, Stephen F. Smith

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 本文提出协同多智能体统一驾驶基准CMU-Drive及车对车视觉-语言-动作模型V2V-VLA,解决现有VLA模型缺乏协同能力的问题,构建了协同自动驾驶研究的首个基准并将相关资源开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29062 2026-08-03 cs.AI 新提交 85%

On the Generalization of Steering Vectors for Chain-of-Thought Faithfulness

论用于思维链忠实性的引导向量的泛化性

Matthew Nguyen, Kyle Cox, Austin Meek, Iván Arcuschin

机构 * University of Virginia(弗吉尼亚大学) University of Delaware(特拉华大学) Poseidon Research(波塞冬研究院)

专题命中 推理评测 :chain-of-thought(title);CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI

AI总结 该研究针对三个模型探究提升思维链忠实性的引导向量的泛化性,发现其效果主要由评估设置决定,且仅对最大型模型有效,引导可减少未被确认的提示使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07883 2026-07-10 cs.AI 新提交 85%

Nigeria Machinery: A Low-Resource Industrial Dataset with a Domain-Grounded Reasoning Layer

尼日利亚机械:一个具有领域基础推理层的低资源工业数据集

Gospel Bassey, Vincent Fakiyesi

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 针对非洲经济体工业机械数据缺乏问题,发布尼日利亚机械数据集及构建思维链推理示例的方法,解决语言模型构建数据集时领域不明确问题,提升领域基础提示比例,虽有局限性,但为相关研究提供参考。

Comments 10pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22862 2026-06-23 cs.CV cs.LG 新提交 85%

Chains That See, Answers That Don't: A Multi-Aspect Evaluation Recipe for Forced Chain-of-Thought on Video-MME

看得见的链,答不出的答案:针对视频MME上强制思维链的多方面评估方案

Zhichao Fan, Yanhang Li, Zexin Zhuang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Northeastern University(东北大学) Southern Methodist University(南卫理公会大学)

专题命中 推理评测 :chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.LG

AI总结 提出三探针评估方案检验强制思维链在视频问答中的可靠性,应用于Qwen2.5-VL发现思维链强依赖视频但未提升准确率,甚至在小模型上导致下降。

Comments 10 pages, 5 figures. To appear at The 2nd Workshop on Evaluation for Multimodal Generation @ SIGIR 2026 (EvalMG '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21123 2026-06-23 cs.CL 新提交 85%

A Multi-Agent Audit Framework for High-Stakes Reasoning: Evaluation and Interpretability in Clinical Mental Health Screening

面向高风险推理的多智能体审计框架:临床心理健康筛查中的评估与可解释性

Jingchen Ye, Yanpei Yu, Luyao Zhang

机构 * Duke Kunshan University(昆山杜克大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 提出多智能体审计框架,通过感知、知识检索、思维链推理和审计验证的多步协作,在临床心理健康筛查中降低PHQ-8抑郁预测误差,提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10317 2026-08-12 cs.CV 新提交 85%

From Detection to Understanding: TAR and TAR-Bench for Multi-Task Traffic Anomaly Reasoning

从检测到理解:用于多任务交通异常推理的TAR与TAR-Bench

Han Zhang, Yilin Zhao, Zaid Pervaiz Bhat, Zheng Tang, Varun Praveen, Vidya N. Murali, David C. Anastasiu, Tomasz Kornuta

机构 * NVIDIA(英伟达) Santa Clara University(圣克拉拉大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract)

AI总结 该研究提出TAR与TAR-Bench数据集,用于训练评估超越异常检测的视频-语言模型,经实验验证其多任务微调可提升模型推理能力,且为2026年AI城市挑战赛第3赛道提供官方数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26553 2026-07-30 cs.SD 新提交 85%

ThinkOmni: A Reasoning-Driven Omni-Modal LLM Framework for Audio Forgery Detection and Localization

ThinkOmni:用于音频伪造检测与定位的推理驱动全模态大语言模型框架

Yuxiong Xu, Kaiqing Lin, Bin Li, Haodong Li, Sheng Li

机构 * Shenzhen University(深圳大学) Afirstsoft Technology Group Co., Ltd.(安福软件科技集团有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract,abstract_cn)

AI总结 针对现有AFDL方法泛化能力不足的问题,提出推理驱动的全模态大语言模型ThinkOmni,构建FACoT数据集,引入FMIL与FCML,实现了跨数据集的音频伪造检测与定位。

Comments Accepted by ACM MM 2026, 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11106 2026-07-14 cs.CV 新提交 85%

Beyond the Eye: Efficient Multimodal Reasoning via Self-Regulated Implicit Visual Tools

超越视觉:通过自我调节的隐式视觉工具实现高效多模态推理

Xiuwei Chen, Quanlin Chen, Wentao Hu, Zisheng Chen, Kun Xiang, Zehua Ma, Mingyang Zhang, Jianhua Han, Hanhui Li, Hang Xu, Xiaodan Liang

机构 * Sun Yat-sen University(中山大学) The Hong Kong Polytechnic University(香港理工大学) Yinwang Intelligent Technology Co., Ltd.(银望智能科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究针对多模态大语言模型推理效率问题,提出超越视觉(BEE)的隐式视觉工具范式,通过将视觉工具调用行为纳入训练目标,经两阶段训练,包括形式化思维链监督微调与自我调节奖励驱动对齐,提升了模型在细粒度视觉感知任务中的性能和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12779 2026-08-14 cs.CL cs.AI cs.IR 新提交 84%

CRAFT: LLM-Based Iterative Refinement for Temporal Reasoning over Clinical Narratives

CRAFT:基于大语言模型的迭代优化用于临床叙事的时间推理

Chengyang He, Tahreem Arif, Marko Zivkovic, Lijing Wang, Yue Ning, Ping Wang

机构 * Stevens Institute of Technology(史蒂文斯理工学院) Genesis Research Group(创世纪研究集团) New Jersey Institute of Technology(新泽西理工学院)

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.CL、cs.AI

AI总结 针对临床叙事中时间锚点稀疏导致的症状轨迹重建难题,提出基于大语言模型的CRAFT框架,通过生成器与约束验证器迭代优化,在MedTempo基准上提升了时间排序准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11047 2026-08-12 cs.AI cs.CE cs.LG 新提交 84%

V-FiLLM: Verified Financial LLM Reasoning Benchmark

V-FiLLM:经过验证的金融大语言模型推理基准

Alicia Larsen, Victoire Laurent, Aulia Kharis Rakhamsari, Lara Turgut, Nino Antulov-Fantulin

机构 * ETH Zürich(苏黎世联邦理工学院) Aisot Technologies Ltd(艾索特科技有限公司)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文提出V-FiLLM框架生成高可靠性金融推理基准,发现开源模型在金融推理深度增加及数值扰动下准确率显著下降,轻量级LoRA微调可提升模型在相关任务的表现。

Comments 10 pages, 6 tables, 2 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04001 2026-08-05 cs.LG cs.AI 新提交 84%

Test-Time Scaling in Reasoning LLMs: Inference Regimes, Evaluation, and Reproducibility

推理大语言模型中的测试时缩放:推理机制、评估与可复现性

Mohsen Hariri, Weicong Chen, Nahal Shahini, Vikash Singh, Kai Ye, Amirhossein Samandar, Debargha Ganguly, Sreehari Sankar, Yanyan Zhang, Shouren Wang, Jerry Peng, Biyao Zhang, Michael Hinczewski, Vipin Chaudhary

专题命中 推理评测 :reasoning(title,abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对推理大语言模型的测试时缩放,明确三种推理机制,提出系统评估原则与可复现性要求,应用于多类基准并发布超20亿条推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01431 2026-07-03 cs.CL cs.AI 新提交 84%

IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs

IsoSci: 用于评估LLM中推理与知识检索的同构跨域科学问题基准

Samir Abdaljalil, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) Hamad Bin Khalifa University(哈马德·本·哈利法大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出IsoSci基准,通过逻辑结构相同但领域知识不同的科学问题对,分离推理能力与领域知识检索,发现91.3%的推理增益依赖于知识而非结构,挑战了思维链推理提升科学问题解决的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00531 2026-07-02 cs.LG cs.AI q-bio.BM stat.ML 新提交 84%

Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization

Active-GRPO:用于分子优化的自适应模仿与自我改进推理

Xuefeng Liu, Mingxuan Cao, Qinan Huang, Thomas Brettin, Rick Stevens, Le Cong

机构 * School of Medicine, Stanford University(斯坦福大学医学院) Data Science Institute, University of Chicago(芝加哥大学数据科学研究所) Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系) Argonne National Laboratory(阿贡国家实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Active-GRPO方法,通过主动模仿-强化和主动参考机制,在分子优化中自适应平衡模仿与自我改进,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23404 2026-06-23 cs.CL cs.AI 新提交 84%

ReasoningLens: Hierarchical Visualization and Diagnostic Auditing for Large Reasoning Models

ReasoningLens:大型推理模型的分层可视化与诊断审计

Jun Zhang, Jiasheng Zheng, Boxi Cao, Yaojie Lu, Hongyu Lin, Jia Zheng, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出ReasoningLens框架,通过分层结构、智能审计和系统分析,将长思维链转化为可操作洞察,用于解释、调试和优化大型推理模型。

Comments Our project is available at https://github.com/icip-cas/ReasoningLens

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15419 2026-06-16 cs.CL cs.AI 新提交 84%

Let LLMs Judge Each Other: Multi-Agent Peer-Reviewed Reasoning for Medical Question Answering

让LLMs互相评判:面向医学问答的多智能体同行评审推理

Zaifu Zhan, Shuang Zhou, Rui Zhang

机构 * University of Minnesota(明尼苏达大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体同行评审推理方法,让多个LLM独立生成思维链推理并相互评估,选择最优推理链输出答案,在三个医学问答数据集上优于单模型和多数投票方法。

Comments Accepted by the Journal of the American Medical Informatics Association

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12608 2026-06-12 cs.CL cs.LG 新提交 84%

Shopping Reasoning Bench: An Expert-Authored Benchmark for Multi-Turn Conversational Shopping Assistants

购物推理基准:面向多轮对话购物助手的专家编写基准

Shuxian Fan, Seonwoo Min, Youna Hu, Botao Xia, Jayakrishnan Unnikrishnan, Rowan Musselmann, Yifan Gao, Qingyu Yin, Priyanka Nigam, Bing Yin

机构 * Amazon(亚马逊)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.LG

AI总结 提出一个由零售专家编写的525个任务的多轮对话购物推理基准,包含10863个加权评分标准,评估9个模型显示通过率仅57-77%,多轮任务性能下降4-18分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18262 2026-06-18 cs.HC 新提交 83%

When Prompts Mislead: Textual Dominance and Diagnostic Bias in MLLMs

当提示误导:多模态大语言模型中的文本主导与诊断偏差

Inhyuk Park, Doohyun Park

专题命中 推理评测 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);self-correction(abstract)

AI总结 研究揭示在医学多模态大语言模型中,文本提示会主导视觉线索,导致诊断偏差,即使模型具备空间定位能力,提示策略仍可能不安全。

Comments Accepted to the CVPR 2026 MMFM-BIOMED Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11260 2026-08-13 cs.AI cs.CV 新提交 83%

Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning

扫视、审视与思考:将视频异常检测从无训练推进到智能体推理

Shibo Gao, Peipei Yang, Xu-Yao Zhang, Linlin Huang

机构 * Beijing Jiaotong University(北京交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 该研究针对视频异常检测的“何时-何事”脱节问题,提出无训练框架GtS及工具增强型智能体方法,扩展基准并引入联合评估指标,实现了更高的异常检测准确性与推理速度。

Comments 34 pages, 8 figures, 8 tables. Journal extension of our AAAI 2026 paper (arXiv:2507.21507)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09072 2026-08-11 cs.SE cs.AI 新提交 83%

A Unified Issue Resolution Benchmark for Requirement Clarification, Planning, and Code Generation for Coding Agents

面向编码智能体的需求澄清、规划与代码生成的统一问题解决基准

Xin Zhou, Chun Yong Chong, Kisub Kim, Yun Peng, Rui Shu, Zihan Wu, Xu Han, Guowen Yuan, Zeyang Zhuang, Jounghoon Kim, Jeongjin Ju, Seongmin Ju, Taein Yoon, David Lo

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.AI

AI总结 该研究推出SWE-RPG编码智能体基准,评估发现主流编码智能体在该基准上平均解决率仅31.5%,隐性需求恢复是主要瓶颈,为改进编码智能体提供了方向。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06663 2026-08-10 cs.CL 新提交 83%

The Horizon Gap: Planning, Memory, Execution, Training, and Evaluation for Long-Horizon LLM Agents

视界差距:长视界大语言模型智能体的规划、记忆、执行、训练与评估

Mingguang Chen, Licheng Wang, Bo Qu

机构 * DeepGrounding(深地研究机构) AlphaAvatar(阿尔法 Avatar 公司)

专题命中 推理评测 :planning(title,abstract);reasoning(abstract);分类 cs.CL

AI总结 本文提出长视界大语言模型智能体存在的视界差距,调研1547篇相关论文,厘清长视界等属性,分析领域应对措施并提出开放测量问题。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26432 2026-07-30 cs.CV cs.AI 新提交 83%

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

FAS-R1:用于推理人脸防伪的统一多任务多模态大语言模型(MLLM)

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

专题命中 推理评测 :reasoning(title,abstract);CoT(abstract);分类 cs.AI

AI总结 本文提出面向推理的两阶段多任务MLLM框架FAS-R1,结合DSA与DA-GRPO优化,在人脸防伪的分类、识别、定位任务中表现优异,性能优于对比系统且具备良好缩放性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20478 2026-07-24 cs.SE cs.AI 新提交 83%

Verifier-First Evaluation of Agentic LLMs for Infrastructure-as-Code Generation

用于基础设施即代码生成的智能语言模型的验证优先评估

Mohamed Jouini

专题命中 推理评测 :verifier(title,abstract);planning(abstract);分类 cs.AI

AI总结 研究针对自然语言生成基础设施即代码的问题,对七种智能策略在特定基准测试上进行验证优先评估,通过多种方法得出如主动检索提升性能、迭代优化有收敛效果等五个主要发现,为相关研究提供了重要参考。

Comments 26 pages, 3 figures, 17 tables. Benchmark dataset available at https://huggingface.co/datasets/iac-eval-v2/iac-eval-v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17828 2026-07-21 cs.CL 新提交 83%

When a Name Is Not a Name: A Benchmark Dataset and Distilled Reasoning for Culturally Entangled Bangla Homographs in Low-Resource LLMs

当一个名字并非名字时:低资源语言模型中文化纠缠的孟加拉语同形异义词的基准数据集和提炼推理

Md. Asaduzzaman Shuvo

机构 * United International University(联合国际大学)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 研究针对低资源语言模型中孟加拉语同形异义词文化纠缠问题,构建基准数据集。发现模型有主导意义偏差,特定模型失败。提出对比性思维链提示及提炼文化解释,能减少偏差,让小模型正确推理,提升系统性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12480 2026-07-15 cs.AI 新提交 83%

TRACE: An Operational Reasoning Schema for Auditable Agentic Commitments

TRACE:可审计的智能体承诺的操作推理模式

Edward Y. Chang, Emily J. Chang

机构 * Stanford University(斯坦福大学) Quadrivium AI(四元数人工智能)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出TRACE模式用于记录推理轨迹,通过字段和测试应对推理不在语言模型中的问题,给出参考程序和操作规范,借助记录-消费者契约形成操作接口,通过示例展示应用,贡献了模式及其契约。

Comments 46 pages, 18 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10748 2026-07-14 cs.LG 新提交 83%

Policy-Driven CT-Agent: Modeling Phase-Aware Diagnostic Control for Clinically Consistent CT Reasoning

策略驱动的CT智能体:为临床一致的CT推理建模阶段感知诊断控制

Yanmeng Dong, Han Li, Yujia Li, Jingsong Liu, Xun Ma, Yanzhu Hu, Zhengyang Xu, Zhicheng Li, Nassir Navab, Shaohua Kevin Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Technical University of Munich(慕尼黑工业大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.LG

AI总结 研究针对CT诊断阶段选择协议差异及现有方法局限,提出策略驱动的CT智能体(PD-CTAgent)。通过临床结构抽象模块和知识引导诊断控制模型,实现阶段感知诊断推理,实验验证其在多数据集上的有效性与临床一致性。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05131 2026-07-07 cs.AI 新提交 83%

TacReasoner: A Dynamic Tactile-Language Framework for Interactive Reasoning in Real-World Scenarios

TacReasoner:面向真实场景交互推理的动态触觉-语言框架

Kailin Lyu, Di Wu, Long Xiao, Jianning Zeng, Jianwei He, Chang Lin, Lianyu Hu, Lin Shu, Jie Hao, Ce Hao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Zhongguancun Academy(北京中关村科学城) Nanyang Technological University(南洋理工大学) Guangdong Institute of Artificial Intelligence and Advanced Computing(广东省人工智能与先进计算研究院)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 针对动态触觉信号建模不足、触觉基础模型易幻觉的问题,提出含动态触觉编码器的TacReasoner框架,配套构建TouchCoT-10k数据集与DynTac-Bench基准,推理性能优于主流大模型。

Comments 8 pages, 7 figures. Accepted at IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18950 2026-06-19 cs.AI 新提交 83%

RTSGameBench: An RTS Benchmark for Strategic Reasoning by Vision-Language Models

RTSGameBench: 视觉语言模型战略推理的RTS基准

San Kim, Daechul Ahn, Reokyoung Kim, Hyeonbeom Choi, Seungyeon Jwa, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title,abstract);planning(abstract);分类 cs.AI

AI总结 提出RTSGameBench,基于Beyond All Reason游戏,通过多样化对战、迷你游戏诊断和自进化生成框架,评估视觉语言模型在实时策略游戏中的战略推理能力。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16562 2026-06-16 cs.LG 新提交 83%

MIRAGE: Auditing Anti-Muslim Bias in Frontier LLMs Across Reasoning, Agentic, and Time-Coupled Conditions

MIRAGE: 审计前沿大语言模型在推理、智能体与时间耦合条件下的反穆斯林偏见

Noor Islam S. Mohammad, Tamim Sheikh

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 推理评测 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.LG

AI总结 提出MIRAGE基准,包含1200个提示,覆盖直接完成、思维链推理和模拟智能体决策三种部署场景,发现思维链放大偏见、智能体决策存在不对称性、偏见与检索新闻时间耦合,现有缓解措施效果有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13192 2026-06-12 cs.AI 新提交 83%

Reasoning for Mobile User Experience with Multimodal LLMs: Task, Benchmark, and Approach

基于多模态大语言模型的移动用户体验推理:任务、基准与方法

Ruichao Mao, Zhou Fang, Teng Guo, Hao Yang, Yaping Li, Shaohua Peng, Maji Huang, Xiaoyu Lin, Shuoyang Liu, Xuepeng Li, Yuyu Zhang, Hai Rao

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.AI

AI总结 提出UXBench基准(2000个VQA样本)评估多模态大模型在UI推理上的能力,并设计UI-UX模型,通过奖励路由和不对称过渡奖励机制在UXBench上达到0.7963准确率,超越Claude-4.5-Sonnet。

Comments 10 pages, 6 figures, Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10403 2026-06-12 cs.CL 新提交 83%

KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty

KCSAT-ML: 用全国队列人类难度探测推理模型

Sanghee Park, Geewook Kim, Kee-Eung Kim

机构 * NAVER Cloud AI(NAVER云AI) KAIST AI(韩国科学技术院人工智能系)

专题命中 推理评测 :reasoning(title,abstract);math reasoning(abstract);分类 cs.CL

AI总结 提出KCSAT-ML基准(含664道韩国高考数学题及339道带官方错误率的核心题)和难度对齐推理增益(DRG)指标,揭示视觉语言模型在人类高错误率题目上准确率崩溃、测试时缩放非单调以及同一模型族内反缩放与过度思考并存的现象。

Comments 18 pages, 14 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏