arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-21 至 2026-07-21 共收录 211 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 47 篇

2607.17701 2026-07-21 cs.AI 新提交 57%

ProEvent: An Event-centric Benchmark for Proactive Agents

ProEvent:面向主动智能体的以事件为中心的基准测试

Guanzhen Li, Liangming Pan, Leye Wang

机构 * School of Computing, Peking University(北京大学计算机学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对主动智能体研究忽视事件中心协助及评估难的问题,引入ProEvent基准测试,基于即时通讯聊天评估智能体维护用户时间表能力,实验发现当前智能体存在过度反应和事件取消处理难等问题,揭示了大语言模型的根本局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17627 2026-07-21 cs.HC cs.CL 新提交 57%

It Matters How You Say It: Exploring Rhetorical Patterns for AI-Assisted Information Evaluation

表达方式很重要:探索用于人工智能辅助信息评估的修辞模式

Sadra Sabouri, Zeinabsadat Saghi, Jordan Lee Boyd-Graber, Jonathan May, Jonathan K. Kummerfeld, Souti Chattopadhyay

机构 * Department of Computer Science, University of Southern California(计算机科学系,南加州大学) Department of Computer Science, University of Maryland(计算机科学系,马里兰大学) Information Sciences Institute, University of Southern California(信息科学研究所,南加州大学) School of Computer Science, University of Sydney(计算机科学学院,悉尼大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究人工智能辅助信息评估中修辞模式,通过主体内研究考察八种修辞模式,发现支架式解释与最高准确率提升相关,对抗条件也能适度提高准确率,还探讨了设计不同修辞风格对话代理的意义及相关权衡。

Comments 13 pages, 6 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17624 2026-07-21 cs.LG 新提交 57%

Can Transformers Really Do It All? On the Compatibility of Inductive Biases Across Tasks

变压器真的无所不能吗?论跨任务归纳偏差的兼容性

Damien Teney, Liangze Jiang, Hemanth Saratchandran, Simon Lucey

机构 * Idiap Research Institute(Idiap研究所) EPFL(洛桑联邦理工学院) Adelaide University(阿德莱德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 研究探讨变压器对给定任务是否最优,提出为数据集优化变压器架构的方法,在算法玩具任务和代码语言建模数据集上实验,发现标准变压器非局部最优,简单替代方案有优劣,暗示有改进架构可支持多种能力。

Comments Published as a conference paper at ICLR 2026. https://github.com/idiap/lm-afs

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17070 2026-07-21 cs.AI 新提交 57%

Bridging the Information Gap: Semantic Densification and Hindsight Distillation for Cold-Start Prediction

弥合信息差距:冷启动预测的语义致密化与事后蒸馏

Hao Duong Le, Yifei Gao, Huan Li, Lun Jiang, Chen Bai, Ke Xing, Chen Zhang

机构 * Tsinghua University(清华大学) Meituan(美团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对电子商务平台新用户冷启动预测难题,SemRaD框架利用结构化语义推理管道和事后感知蒸馏网络,有效弥合信息差距,提升了LTV和CVR,减少训练数据用量,在工业数据集和在线测试中均取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17050 2026-07-21 cs.CV cs.AI 新提交 57%

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

EvoGUI:用于GUI状态转换理解的进化感知基准测试

Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26648 2026-07-21 cs.SE cs.AI 版本更新 57%

Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

Vision2Web: 一个用于视觉网站开发的分层基准,包含代理验证

Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 本文提出Vision2Web基准,用于评估视觉网站开发能力,包含193个任务和16类,通过GUI代理验证器和基于VLM的裁判器评估多个视觉语言模型,揭示了在全栈开发中现有模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20804 2026-07-21 cs.AI 版本更新 57%

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟

Xueyao Wan, Hang Yu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12921 2026-07-21 cs.CL 57%

When Words Don't Mean What They Say: Figurative Understanding in Bengali Idioms

当词语不表示其意义:孟加拉成语的隐喻理解

Adib Sakhawat, Shamim Ara Parveen, Md Ruhul Amin, Shamim Al Mahmud, Md Saiful Islam, Tahera Khatun

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出一个包含10361个孟加拉成语的数据集,评估30种LLMs在隐喻理解任务上的表现,发现模型在跨语言和文化推理上存在显著不足。

Comments 9 pages, 5 figures. Accepted for presentation at LREC 2026 (Language Resources and Evaluation Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14335 2026-07-21 cs.CR cs.AI cs.SE 版本更新 57%

Is "Knowing It's Malicious Enough?" Evaluating LLMs for Fine-Grained Malware Behavior Auditing

“知道它足够恶意吗?”评估用于细粒度恶意软件行为审计的大语言模型

Xinran Zheng, Xingzhi Qian, Yiling He, Shuo Yang, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型用于恶意软件审计可靠性不明问题,引入MalEval诊断框架,通过配对代码库与审计报告提供基本事实,经中间表示压缩代码库,映射输出到证据链,分解审计为四阶段任务,评估发现大语言模型在审计中有诸多问题,为后续可靠工作流程研究提供参考。

Comments Paper has beed accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20693 2026-07-21 cs.DL cs.CL 57%

Leveraging Large Language Models for Generating Research Topic Ontologies: A Multi-Disciplinary Study

利用大型语言模型生成研究主题本体:多学科研究

Tanay Aggarwal, Angelo Salatino, Francesco Osborne, Enrico Motta

机构 * Knowledge Media Institute, The Open University(开放大学知识媒体学院) The Open University(开放大学) University of Milano Bicocca(米兰比克卡大学) Department of Business and Law, University of Milano Bicocca(米兰比克卡大学商学院与法学院)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型在生物医学、物理和工程学三个学科中识别研究主题语义关系的能力,通过零样本提示、链式思维提示和在现有本体上微调三种条件评估模型性能,并引入PEM-Rel-8K数据集验证跨学科迁移能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17722 2026-07-21 cs.SE 新提交 50%

KernelDiag: Agent-Based Root Cause Diagnosis for Kernel Crashes

KernelDiag:基于代理的内核崩溃根本原因诊断

Weijing Wang, Zan Wang, Dong Wang, Haichi Wang, Junjie Chen

专题命中 推理评测 :reasoning(abstract)

AI总结 针对Linux内核崩溃根本原因诊断难的问题,提出KernelDiag框架,通过日志到代码映射及专门代理进行结构化因果推理,在KGYM基准测试中表现出色,优于现有方法,为自动内核根本原因诊断奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17353 2026-07-21 cs.CR 新提交 50%

Measuring and Evaluating the Performance of Generative AI Models for Scam Detection

测量和评估用于诈骗检测的生成式人工智能模型的性能

Cem Topcuoglu, Seyed Ali Akhavani, Harel Berger, Sadia Afroz, Michalis Pachilakis, Vibhor Sehgal, Leyla Bilge, Engin Kirda

专题命中 推理评测 :reasoning(abstract)

AI总结 研究大语言模型在无特定任务微调下检测诈骗的能力,通过策划发布独特基准数据集,评估九个不同模型,发现较大模型性能优,有效提示可提升小模型性能,且LLMs泛化能力强,还发布了数据集和评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16321 2026-07-21 cs.CV cs.IR 新提交 50%

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

超越语义的艺术:用于多关系表示的层状信息对比学习

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

机构 * University of Zurich(苏黎世大学) Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) Sapienza University of Rome(罗马第一大学) Amazon(亚马逊) University of Amsterdam(阿姆斯特丹大学) The University of Osaka(大阪大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13420 2026-07-21 cs.CV 版本更新 50%

VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task

VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象

Xingming Long, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究聚焦视觉语言模型在自愿想象任务中的幻觉问题,引入VOPE评估基准,通过构建数据集应用于主流模型和缓解方法,发现多数模型幻觉严重,现有缓解方法效果有限,为该领域未来研究指明重要方向。

Comments Accepted at ACM MM 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05298 2026-07-21 cs.RO 版本更新 50%

GhostShell: Streaming LLM Function Calls for Concurrent Embodied Programming

GhostShell:用于并发实体编程的流式大语言模型函数调用

Jian Gong, Youwei Huang, Bo Yuan, Ming Zhu, Zhou Liao, Jianhang Liang, Juncheng Zhan, Jinke Wang, Hang Shu, Zihao Xu, Mingyue Xiong, Yanjun Ye, Yufan Zu, Yang Zhou, Yihan Ding, Xuannian Chen, Xingyu Lu, Runjie Ban, Bingchao Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 研究提出GhostShell方法,利用大语言模型进行实体系统的流式和并发行为编程。通过定义函数令牌及多通道调度算法协调调用,在机器人原型上评估,该方法在任务完成率等方面表现出色,尤其在协调并发动作上优势明显。

Comments 22 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 15 篇

2607.16603 2026-07-21 cs.CL 新提交 83%

NOWJ@COLIEE 2026: Adaptive Pipelines for Legal Retrieval and Reasoning

NOWJ@COLIEE 2026:用于法律检索和推理的自适应管道

Thuong-Hieu Ngo, Hoang-Trung Nguyen, Huu-Dong Nguyen, Xuan-Bach Le, Le-Dung Nguyen, Quang-Thanh Tran, Ha-Thanh Nguyen, Thi-Hai-Yen Vuong

机构 * VNU University of Engineering and Technology(越南国立工程技术大学) Center for Juris-Informatics, ROIS-DS College of Engineering & Computer Science, VinUniversity(越南Vin大学工程与计算机科学学院法律信息学中心)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 NOWJ团队参与COLIEE 2026竞赛五项任务,针对各任务提出不同方法。如任务1的四阶段管道,任务2的多种方法结合,任务3的检索增强框架等,通过这些方法在法律检索、推理等方面取得相应成果。

Comments Presented at COLIEE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12349 2026-07-21 cs.CY cs.AI cs.CL 82%

Information Suppression in Large Language Models: Auditing, Quantifying, and Characterizing Censorship in DeepSeek

大语言模型中的信息压制:对DeepSeek的信息审查、量化与特征化

Peiran Qiu, Siyi Zhou, Emilio Ferrara

机构 * Thomas Lord Department of Computer Science, University of Southern California, USA(汤姆斯·劳德计算机科学系,南加州大学) Information Sciences Institute, University of Southern California, USA(信息科学研究所,南加州大学) Annenberg School of Communication, University of Southern California, USA(安纳伯格传播学院,南加州大学)

专题命中 其他推理 :CoT(abstract,abstract_cn);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本研究通过审计框架揭示DeepSeek在处理政治敏感提示时的信息压制现象,指出模型在内部推理中保留敏感内容,但在最终输出中进行过滤或改写,强调了对AI模型中信息压制机制进行系统审查的重要性。

Journal ref Inf. Sci. 724, C (Jan 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18142 2026-07-21 cs.CV cs.AI cs.CL cs.MA 新提交 81%

O-VAD: Industrial Video Anomaly Detection through Object-Centric Tracking and Reasoning

O-VAD:通过以对象为中心的跟踪和推理进行工业视频异常检测

Mei Yuan, Qi Long, Qifeng Wu, Zhenyang Li, Yizhou Zhao, Lei Wang, Yang Liu, Min Xu

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Alabama at Birmingham(阿拉巴马大学伯明翰分校) Griffith University(格里菲斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对工业视频异常检测,现有基于VLM的方法在工业场景中性能不佳的问题,提出无训练的智能框架O-VAD,通过跟踪对象时空动态和推理状态轨迹来检测异常,在多数据集实验中优于多种方法且能提供可解释报告。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16451 2026-07-21 cs.CL cs.AI 新提交 81%

Committed Before Reasoning: Behavioral Reproduction and Preliminary Activation-Level Evidence of Answer Pre-Commitment in an Open-Weight LLM

推理前先承诺:开放权重语言模型中答案预承诺的行为再现及初步激活水平证据

Heejin Jo

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 研究聊天模型在简单问题上先承诺答案而非推导的现象,通过行为再现和初步激活水平证据揭示错误承诺情况,还指出方法学上问题措辞对结果的影响,强调阳性对照对解读阴性预言机结果的重要性。

Comments 8 pages. Code, data, and all reported statistics: https://github.com/JO-HEEJIN/interview_mate/tree/docs/car-wash-repro/car_wash/paper_4

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18100 2026-07-21 cs.AI 新提交 79%

Can We Break LLMs Out of Self-Loops? Fine-Grained Reasoning Control with Activation Steering

我们能否使大语言模型摆脱自我循环?通过激活引导实现细粒度推理控制

Sheldon Yu, Tong Yu, Xunyi Jiang, Rohan Surana, Gagan Mundada, Sungchul Kim, Lina Yao, Julian McAuley, Junda Wu

机构 * UC San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究院) University of New South Wales(新南威尔士大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究大语言模型推理过程不可控问题,提出SOPHIA方法,通过将推理轨迹视为潜在状态序列,构建引导向量库,在推理时进行干预,可检测并防止自我循环,提升推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16322 2026-07-21 cs.CV cs.AI 新提交 79%

GMoT: Gated Motion-Aware Tokenization for Fine-Grained Micro-Gesture Video Reasoning with Multimodal LLMs

GMoT:用于基于多模态大语言模型的细粒度微手势视频推理的门控运动感知令牌化

Taorui Wang, Wei Xia, Hui Ma, Zijia Song, Jiayu Zhang, Zeheng Wang, Yong Xu, Zitong Yu

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Great Bay University(大湾区大学) Dongguan Key Laboratory for Intelligence and Information Technology(东莞市智能信息技术重点实验室)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对微手势识别中运动易被掩盖及MLLMs处理运动学困难的问题,提出GMoT模块,通过空间加权池等提取运动线索并融合,引入渐进奖励引导策略优化范式,在多数据集上表现出色,还提出BRG召回及跨域转移协议。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10848 2026-07-21 cs.CL 版本更新 79%

Psyche-R1: Towards Reliable Psychological LLMs through Unified Empathy, Expertise, and Reasoning

Psyche-R1:通过统一的同理心、专业知识和推理实现可靠的心理语言模型

Chongyuan Dai, Jinpeng Hu, Hongchang Shi, Zhuo Li, Dan Guo, Xun Yang, Meng Wang

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL

AI总结 研究旨在将大语言模型应用于心理领域,提出Psyche-R1模型。通过设计数据合成管道生成大量心理问题及对话,采用混合训练策略,经实验验证该模型在多个心理基准测试中有效,7B的Psyche-R1能取得与671B的DeepSeek-R1相当的结果。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16051 2026-07-21 cs.CL cs.AI 版本更新 62%

Loop the Loopies!

循环循环者!

Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究提出最强大的循环Transformer——Loopie,由两个专家混合模型组成。它应对了循环Transformer面临的挑战,经消融研究表明在相同计算预算下优于普通基线,其训练后管道赋予强大推理能力,在竞赛中无需工具获金牌。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12463 2026-07-21 cs.AI cs.CL 版本更新 62%

Function-Aware Fill-in-the-Middle as Mid-Training for Coding Agent Foundation Models

作为编码智能体基础模型中间训练的函数感知中间填充

Yubo Wang, Jiarong Liang, Yuxuan Zhang, Xuye Liu, Cong Wei, Yuyu Zhang, Ping Nie, Wenhu Chen

机构 * University of Waterloo(滑铁卢大学) University of British Columbia(英属哥伦比亚大学) NVIDIA(英伟达公司) Verdent AI(Verdent人工智能公司) Vector Institute(向量研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究针对编码智能体将外部工具返回集成到推理中的问题,利用函数感知中间填充进行中间训练,在多个模型上提升了性能,并减轻了后训练对非智能体编码等基准测试的能力侵蚀。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02522 2026-07-21 cs.CL cs.LG 版本更新 62%

Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR

通过监督学习框架实现隐式Actor-Critic耦合的RLVR方法

Jiaming Li, Longze Chen, Ze Gong, Yukun Chen, Lu Wang, Wanwei He, Run Luo, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 PACS通过监督学习框架实现隐式Actor-Critic耦合,提升RLVR中奖励信号的稳定性与训练效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17147 2026-07-21 cs.CR cs.CL 新提交 57%

SlotGuard: Stop Oversharing Private Local Context in LLM Agent Transcri

SlotGuard:阻止大语言模型代理转录中过度共享私有本地上下文

Haocheng Xia, Yongjoo Park

机构 * Siebel School of Computing(计算机科学系) Data Science, University of Illinois Urbana-Champaign(数据科学,伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究大语言模型代理转录本隐私泄露问题,提出SlotGuard方法,通过重写结构绑定、替换机密值、链接跨轮引用等操作隐藏敏感数据,在保持代理性能的同时大幅降低凭证泄漏率。

Comments ICML 2026 AIWILD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16325 2026-07-21 cs.CV cs.LG 新提交 57%

RegionFM: Interpretable Region-Based Brain MRI Classification Using Foundation Model Embeddings

RegionFM:使用基础模型嵌入进行可解释的基于区域的脑MRI分类

Wei Zhang

机构 * L3S Research Center(L3S研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 研究针对脑MRI基础模型预测难解释问题,提出RegionFM框架,将解剖分割与基础模型嵌入结合,通过划分区域、编码嵌入及构建模型组合,用于认知障碍分类评估,在保持性能同时使解释与临床推理更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16303 2026-07-21 cs.CV cs.AI 新提交 57%

Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation

Med-OPD:通过证据感知策略蒸馏改进医学视觉语言模型

Yunhang Qian, Jiaquan Yu, Jiawei Liu, Meng Wang, Hongwei Bran Li, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 研究针对医学视觉语言模型依赖语言先验而非视觉证据推理的问题,提出Med-OPD框架,引入医学证据优势信号,在令牌和轨迹级别重新分配蒸馏信号,实验证明该方法能加强模型对关键视觉证据的依赖,提升多模态医学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01375 2026-07-21 cs.CY cs.AI 版本更新 57%

Beyond Access: Guided LLM Scaffolding for Independent Learning in Undergraduate Statistics

超越访问:引导式LLM支架在本科统计学自主学习中的应用

Mohammad Amanlou, Yasaman Amou-Jafari, Mehrad Livian, Fatemeh Boloukazari, Fereshte Bagheri, Elahe Khodaverdi Nadrabadi, Shahab Sherafat, Behnam Bahrak

机构 * School of Electrical and Computer Engineering, University of Tehran, Iran(伊朗塔里哈大学电气与计算机工程学院) Tehran Institute for Advanced Studies, Khatam University, Iran(伊朗卡塔姆大学泰赫兰高级研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过准实验比较无LLM、无限制LLM和引导式LLM三种条件,发现引导式LLM使用能促进以推理为导向的交互模式,提升无辅助测验表现,并改善自我评估校准,表明LLM作为教育工具需通过支架设计实现推理伙伴而非答案获取工具。

Comments 10 pages, conference: Proceedings of the 34th International Conference on Computers in Education. Asia-Pacific Society for Computers in Education

详情

展开后加载摘要…

URL PDF HTML 收藏