arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 996 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 996 篇

2606.14817 2026-06-16 cs.IR cs.AI 新提交 57%

Combining Retrieval-Augmented Text Generation with LLMs for Reading Content Recommendations

结合检索增强文本生成与大型语言模型的阅读内容推荐

Sooyeon Kim, Piotr S. Maciąg

机构 * Institute of Computer Science, Warsaw University of Technology(计算机科学学院,华沙技术大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 提出结合检索增强生成(RAG)与大型语言模型的系统,通过四个模块实现个性化阅读内容生成,实验表明RAG将相关性和接地性提升26-35个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11349 2026-06-16 cs.AI cs.HC 新提交 57%

Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents

知道何时提问:分层语言代理的自门控澄清机制

Aijing Gao, Yiming Kang, Mengdie Flora Wang, Jae Oh Woo

机构 * Amazon Web Services(亚马逊云科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出ACTION-RATING框架,将澄清请求纳入代理的动作空间,与导航共享序数尺度,在分层推理中实现自门控澄清,通过强制性和机会性两种信息寻求模式提升决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14239 2026-06-15 cs.AI 新提交 57%

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit: 通过配对轨迹审计实现无真实反馈的技能进化

Haowen Gao, Haoran Chen, Can Wang, Shasha Guo, Liang Pang, Zhaoyang Liu, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,通过配对轨迹审计和过程对齐对比评估,无需真实反馈即可进化智能体技能,在89个任务中平均奖励达73.9%。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14068 2026-06-15 cs.CL 新提交 57%

Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

对男性更严厉?评估LLM在不同冲突场景中的性别不对称道德框架

Guangzong Si, Dong Wang, Zhenhao Li, Yifan Yu, Panwang Pan, Wentao Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出GAMA-Bench基准,通过性别镜像场景评估LLM对相同负面行为的回应,发现模型对男性更倾向于惩罚和责备,对女性则更强调共情和治疗。

Comments underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14037 2026-06-15 cs.CL 新提交 57%

Right or Wrong, Models Comply: Directional Blindness in LLM Moral Judgment

对或错,模型都顺从:LLM 道德判断中的方向盲从

Jihye Kim, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出顺从不对称性(A = BCR/HCR)双向诊断指标,发现大语言模型在事实判断中更顺从有益提示(A=1.58),但在道德判断中几乎同等顺从有益和误导提示(A=1.04),揭示了方向盲从这一对齐失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13931 2026-06-15 cs.CL 新提交 57%

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

DLawBench: 通过多轮法律咨询评估大语言模型

Li Zhang, Yuzhen Shi, Yiran Hu, Jingwen Zhang, Wenbo Lv, Yubo Ma, Wei Wang, Rongyao Shi, Yuanyang Qiu, Xinran Xu, Yuemeng Qi, Linlin Miao, Jaromir Savelka, Yun Liu, Kevin Ashley, Bing Zhao, Hu Wei, Lin Qu

机构 * University of Pittsburgh(匹兹堡大学) Alibaba Group(阿里巴巴集团) University of Waterloo(滑铁卢大学) Shandong University(山东大学) Skylenage China University of Political Science and Law(中国政法大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Fordham University(福特汉姆大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出DLawBench基准,通过模拟四种客户类型(合作、依赖、退缩、对抗)的多轮对话,评估大语言模型在真实法律咨询中的交互能力。

Comments 37 pages, 8 figures, 26 tables. Code and data: https://github.com/SKYLENAGE-AI/DLawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13808 2026-06-15 cs.CL 新提交 57%

The Culture Funnel: You Can't Align What isn't in the Data

文化漏斗:你无法对齐不在数据中的内容

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对当前文化对齐方法依赖推理时干预而忽视训练数据的问题,提出文化数据漏斗概念,通过多维标签框架分析预训练、微调、对齐和推理数据集,发现后训练阶段文化信号急剧下降,多语言性虽增强地理多样性但未能确保平衡,所提标签可提升下游文化基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13218 2026-06-12 cs.CL 新提交 57%

When Similar Means Different: Evaluating LLMs on Arabic--Hebrew Cognates

当相似意味着不同:评估大语言模型在阿拉伯语-希伯来语同源词上的表现

Junhong Liang, Noor Abo Mokh, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆扎伊德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对阿拉伯语和希伯来语同源词、假朋友和借词,构建SemCog Bench基准(1858对词对),评估LLM跨语言语义理解,发现模型依赖表面形式相似性,在假朋友和借词上表现差,上下文帮助有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12969 2026-06-12 cs.AI 新提交 57%

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

用于配电缺陷检测的多模态智能体:基础模型评估

Quan Quan

机构 * Quan Quan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12821 2026-06-12 cs.AI cs.ET 新提交 57%

GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

GeoNatureAgent Benchmark:面向前沿与开源基础模型的环境地理空间分析LLM智能体基准测试

Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces, Javier Velázquez, Devika Jain

机构 * Universidad Católica de Ávila (UCAV)(阿维拉天主教大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者) Center for Geographic Analysis, Harvard University(哈佛大学地理分析中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出首个通过结构化工具调用真实API评估环境分析智能体的基准,包含93个任务,发现Claude Sonnet 4领先,但开源模型在成本效益上占优,且比较任务普遍未解决。

Comments Preprint. 10 pages, 8 figures. Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12599 2026-06-12 cs.CL 新提交 57%

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

通过波斯谚语条件故事生成实现LLM中的约束语义解压缩

Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12320 2026-06-11 cs.AI cs.CC cs.CR cs.SE 新提交 57%

A Five-Plane Reference Architecture for Runtime Governance of Production AI Agents

生产AI代理运行时治理的五平面参考架构

Krti Tallam

机构 * Kamiwaza

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对生产AI代理打破传统数据边界治理假设的问题,提出由推理平面和四个执行平面组成的五平面参考架构,通过可组合原语实现运行时治理,阻断七种威胁并验证四个正确性不变式。

Comments 65 pages, 3 figures, 5 tables. Reference architecture with a reference implementation of the policy-engine core and microbenchmark results; full-system evaluation identified as future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12250 2026-06-11 cs.CL 新提交 57%

Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

重新评估高性能大语言模型在波兰医学考试中的表现:真实能力还是偏差驱动?

Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski, Jeremi Ignacy Kaczmarek, Gabriela Korzańska, Janusz Świeczkowski-Feiz, Oskar Pastuszek, Paulina Hoffman, Jakub Tomasz Dąbrowski, Wojciech Kusa

机构 * NASK National Research Institute(NASK国家研究所) Adam Mickiewicz University(亚当·密茨凯维奇大学) ARAAI Poland(ARAAI波兰) Poznań University of Medical Sciences(波兹南医科大学) Centre of Postgraduate Medical Education, Poland(波兰研究生医学教育中心) T. Marciniak Lower Silesian Specialist Hospital(T. 马尔奇尼亚克下西里西亚专科医院) Medical University of Warsaw(华沙医科大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过引入扩展和更具挑战性的波兰医学考试基准,减少MCQA伪影,发现标准MCQA分数高估了LLM的真实临床能力,最佳模型在更难的设置下分数下降28.4和31个百分点。

Comments 26 pages total with references and appendix, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11447 2026-06-11 cs.CL 新提交 57%

AI Coding Agents Can Reproduce Social Science Findings

AI编码智能体能够复现社会科学研究结果

Meysam Alizadeh, Mohsen Mosleh, Fabrizio Gilardi, Atoosa Kasirzadeh, Joshua Tucker

机构 * University of Oxford(牛津大学) University of Zurich(苏黎世大学) Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究构建SocSci-Repro-Bench基准测试,评估Claude Code和Codex两个前沿编码智能体在221项社会科学任务中的复现能力,发现它们能复现大部分结果,且Claude Code表现更优,同时提示框架会影响确认性规范搜索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11416 2026-06-11 cs.CR cs.AI 新提交 57%

MPC-Patch-Bench: Security-Aware LLM Code Patch for Multi-Party Computation

MPC-Patch-Bench:面向多方计算的安全感知LLM代码补丁

Yukuan Zhang, Mengxin Zheng, Qian Lou

机构 * University of Central Florida(中央佛罗里达大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 针对多方计算(MPC)软件缺乏仓库级代码修复基准的问题,提出MPC-Patch-Bench,包含数据筛选框架和MPC验证器,评估LLM在MPC仓库级修复中的安全性和数值保真度。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11260 2026-06-11 cs.SD cs.AI 新提交 57%

RAIL: Rethinking Auditory Intelligence in Large Audio-Language Models with a CHC-Grounded Benchmark

RAIL: 基于CHC框架重新思考大型音频语言模型中的听觉智能

Hongyu Jin, Siyi Wang, Yang Xiao, Jiaheng Dong, Shihong Tan, Kaiyuan peng, Georgiana Juravle, Shanquan Chen, Gongping Huang, Hong Jia, Eun-Jung Holden, James Bailey, Ting Dang

机构 * School of Computing and Information Systems, The University of Melbourne(墨尔本大学计算与信息系统学院) Faculty of Psychology and Educational Sciences, Alexandru Ioan Cuza University of Iași(亚历山德鲁伊万库扎大学心理学与教育科学学院) School of Electronic Information, Wuhan University(武汉大学电子信息学院) School of Public Health, The University of Hong Kong(香港大学公共卫生学院) School of Computer Science, The University of Auckland(奥克兰大学计算机科学学院) Department of Data Science and Artificial Intelligence, Monash University(莫纳什大学数据科学与人工智能系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出RAIL基准,基于CHC认知框架将听觉智能分解为五种核心能力,构建结构化评估任务,系统评测大型音频语言模型的认知行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11220 2026-06-11 cs.CL 新提交 57%

LifeSentence: Language models can encode human life course trajectories from longitudinal panel data

LifeSentence: 语言模型可以从纵向面板数据编码人类生命历程轨迹

Samuel Liu, Muchen Xi, William Yeoh, Joshua J. Jackson

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出LifeSentence模型,将大型语言模型与纵向面板数据结合,通过结构化自然语言记录生命事件并微调预训练模型,在少样本条件下超越传统方法,实现生命事件预测与时间顺序重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11204 2026-06-11 cs.CL cs.IR 新提交 57%

Benchmarking Large Language Models for Safety Data Extraction

大型语言模型在安全数据提取中的基准测试

Jonas Grill, Thomas Bayer, Sören Berlinger

机构 * SAP SE(SAP公司) Institute for Digital Transformation, Ravensburg-Weingarten University(拉文斯堡-魏恩加滕大学数字化转型研究所)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 针对安全数据表(SDS)的异构格式,本研究基准测试了四种大型语言模型(LLM)在文本与多模态处理下的提取性能,发现文本结合思维链提示的Gemini 1.5 Pro准确率最高(84%),但均未达到90%的可靠部署阈值。

Comments 18 pages, 8 figures, submitted to Applied Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10738 2026-06-10 eess.AS cs.AI 新提交 57%

Spatial-Omni: Spatial Audio Understanding Integration in Multimodal LLMs via FOA Encoding

Spatial-Omni:通过FOA编码在多模态大语言模型中实现空间音频理解

Zhiyuan Zhu, Yixuan Chen, Yiwen Shao, Wenxiang Guo, Changhao Pan, Yu Zhang, Yuxiang Wang, Wei Liu, Houhua Zhang, Chengkuan Zeng, Wenbo Cheng, Yunxi Liu, Rui Yang, Steve Yves, Liefeng Bo, Zhou Zhao

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出Spatial-Omni,通过SO-Encoder将一阶Ambisonics空间音频注入现有全模态大语言模型,以轻量方式实现空间音频理解,并在构建的SO-Bench基准上超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11150 2026-06-10 cs.AI cs.CY 新提交 57%

ABC-Bench: An Agentic Bio-Capabilities Benchmark for Biosecurity

ABC-Bench:生物安全的主体生物能力基准

Andrew Bo Liu, Samira Nedungadi, Bryce Cai, Alex Kleinman, Harmon Bhasin, Seth Donoughe

机构 * Andrew Bo Liu(安德鲁·刘) Samira Nedungadi(萨米拉·纳杜加迪) Bryce Cai(布莱斯·凯) Alex Kleinman(亚历克斯·克莱因曼) Harmon Bhasin(哈蒙·巴辛) Seth Donoughe(塞斯·多诺赫)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出ABC-Bench基准,评估LLM主体在生物安全相关任务上的能力,包括液体处理机器人编程、DNA片段设计和合成筛选规避,所有测试主体均优于人类专家基线。

Comments 18 pages. To be published in ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10949 2026-06-10 cs.AI 新提交 57%

Recalling Too Well: Sycophancy Evaluation and Mitigation in Memory-Augmented Models

回忆过好:记忆增强模型中的谄媚评估与缓解

Shelly Bensal, Axel Magnuson, Aparna Balagopalan, Daniel M. Bikel

机构 * Writer, Inc.(Writer公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本研究首次系统评估记忆增强模型中的谄媚现象,提出MIST基准测试,发现记忆会放大谄媚行为(最高25倍),并提出两种轻量级缓解方法。

Comments Under submission; preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10833 2026-06-10 cs.AI 新提交 57%

Do VLMs Reason Like Engineers? A Benchmark and a Stage-wise Evaluation

视觉语言模型像工程师一样推理吗?一个基准测试与分阶段评估

Syed Wasiq, Syed Mohamad Tawseeq, Yashwant Pravinrao Bangde, Debaditya Roy

机构 * Indian Institute of Technology Kharagpur(印度理工学院卡哈拉格普尔分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出工程视觉问答基准EngVQA和8阶段自动评估框架,揭示当前视觉语言模型在工程推理中的显著局限,并验证了自动化评估与人工评分的高度一致性。

Comments 9 pages (main text), 4 figures, 2 tables; 50 pages total including appendix. The first two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10747 2026-06-10 cs.AI 新提交 57%

The Arbiter Agent: Continually Monitoring Multi-Agent Conversations to Detect Emergent Misalignment

仲裁者代理:持续监控多智能体对话以检测涌现性失调

Filippo Tonini, Federico Torrielli, Anton Danholt Lautrup, Peter Schneider-Kamp, Mustafa Mert Çelikok, Lukas Galke Poech

机构 * University of Southern Denmark(南丹麦大学) University of Turin(都灵大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出仲裁者代理,在有限检查预算下实时监控多智能体对话,通过主动检查工具检测失调行为,实验表明能可靠提前发现失调,并分析不同失调类型的检测难度。

Comments AITC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10400 2026-06-10 cs.CL cs.CV 新提交 57%

Do Vision-Language Models See or Guess? Measuring and Reducing Textual-Prior Reliance with a Phrasing-Controlled Benchmark

视觉语言模型是看见还是猜测?通过措辞控制基准衡量和减少文本先验依赖

Pratham Singla, Shivank Garg, Vihan Singh, Paras Chopra

机构 * Lossfunk Indian Institute of Technology Roorkee(印度理工学院罗尔基分校) Raeth AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文构建了540张图像的基准,通过为同一图像生成四种措辞变体,衡量视觉语言模型对文本先验的依赖,发现所有模型在最难变体上性能下降,开放模型下降最严重,并通过无图像消融等分析证实了真正的图像依赖。

Comments 17 pages, 7 figures, Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10285 2026-06-10 cs.CL 新提交 57%

OpenRTLSet: A Fully Open-Source Dataset for Large Language Model-based Verilog Module Design

OpenRTLSet: 基于大语言模型的Verilog模块设计的完全开源数据集

Jinghua Wang, Lily Jiaxin Wan, Sanjana Pingali, Scott Smith, Manvi Jha, Shalini Sivakumar, Xing Zhao, Kaiwen Cao, Deming Chen

机构 * UIUC-ChenLab(UIUC-陈实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出最大完全开源硬件设计数据集OpenRTLSet,包含13万+多样Verilog代码样本,结合GitHub代码、VHDL和C/C++翻译,利用DeepSeek-R1生成自然语言描述,支持多种语言模型微调,证明开源方法在硬件设计中的优越性。

Comments Accepted by ICLAD'25

Journal ref 2025 IEEE International Conference on LLM-Aided Design (ICLAD), Stanford, CA, USA, 2025, pp. 212-218

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10208 2026-06-10 cs.RO cs.AI 新提交 57%

Exploration of Foundation Model-Based Robots in Patient and Elderly Care

基于基础模型的机器人在患者和老年人护理中的探索

Zhiwen Qiu, Wei Liu, Yuexing Hao

机构 * Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文综述了基于基础模型的护理机器人在设计特征、用户体验和护理效果方面的现状,指出当前系统多用于语音交互,多模态和物理自主性有限,并呼吁向护理特定评估标准和负责任自主性发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09956 2026-06-10 cs.SE cs.LG 新提交 57%

Multi-task LLMs for Bug Classification: Efficient Inference with Auxiliary Decoding Heads

多任务大语言模型用于缺陷分类:基于辅助解码头的高效推理

Nikolai Rozanov

机构 * Recurse Ltd. Department of Computing, Imperial College London(帝国理工学院计算机系)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出一种轻量级多任务大语言模型(MLC),通过令牌对齐算法和优化训练策略,实现全文件上下文下的行级缺陷定位,性能与代理方法相当但推理延迟降低数个数量级。

Comments 8 pages, 6 pages appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09908 2026-06-10 cs.CR cs.AI 新提交 57%

IDP-Bench: Benchmarking ability of LLMs to protect personal information in interdependent privacy contexts

IDP-Bench:评估大语言模型在相互依赖隐私上下文中保护个人信息能力的基准

Ayana Hussain, Soumya Sharma, Golnoosh Farnadi, Nicholas Vincent, Héber Hwang Arcolezi, Ulrich Aïvodji

机构 * Simon Fraser University(西蒙弗雷泽大学) McGill University(麦吉尔大学) Mila(Mila研究所) ÉTS

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出IDP-Bench,首个基于情境完整性框架的LLM相互依赖隐私基准,评估8个开源模型在三个推理层次上的表现,发现模型在识别CI参数和IDP特定参数方面存在弱点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09644 2026-06-09 cs.CL cs.CV 新提交 57%

Where Does the Answer Come From? Benchmarking View-Level Visual Evidence Identification in Multi-View MLLMs for Autonomous Driving

答案从何而来?面向自动驾驶的多视角MLLMs中视角级视觉证据识别基准

Yimu Wang, Yee Man Choi, Barry Zhang, Mozhgan Nasr Azadani, Sean Sedwards, Krzysztof Czarnecki

机构 * University of Waterloo(滑铁卢大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对多视角自动驾驶场景,提出一个基准测试,评估多模态大模型在视觉问答中识别支持性相机视角的能力,包含122个冲突中心问题对,并区分视角选择与答案正确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09484 2026-06-09 cs.CL 新提交 57%

Detecting Differences Is Not Understanding Structure: Large Language Models Fail at Graph Isomorphism

检测差异不等于理解结构:大型语言模型在图同构任务中失败

Kumar Thushalika, Sukumar Kishanthan, Asela Hevapathige

机构 * University of Ruhuna(鲁胡纳大学) University of Moratuwa(莫拉图瓦大学) University of Melbourne(墨尔本大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究通过图同构检测任务揭示LLM的“虚假成功”:虽然LLM在检测同构时准确率接近完美,但面对节点标签置换的相同图时却无法识别,表明其依赖模式而非抽象结构推理。

详情

展开后加载摘要…

URL PDF HTML 收藏