arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 4182 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 1022 篇

2606.18190 2026-06-17 cs.CR cs.LG 新提交 57%

Multi-Source Cybersecurity Logs: An ATT&CK-Labeled Dataset and SLM Evaluation

多源网络安全日志:一个ATT&CK标记数据集及小语言模型评估

Abir Ashab Niloy, Ahmed Ryan, Imamul Hossain Rafi, Md Erfan, Md Rayhanur Rahman

机构 * Windows endpoints(Windows终端)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 为解决多阶段网络攻击检测中缺乏带ATT&CK技术标签的多源日志数据集问题,构建了包含870个会话(70个攻击、800个良性)和约230万事件的多源日志数据集,并基于该数据集微调三个小语言模型,在分块分类任务上准确率从约8%提升至90%-97%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18068 2026-06-17 cs.AI 新提交 57%

Agentic AI-based Framework for Mitigating Premature Diagnostic Handoff and Silent Hallucination in Healthcare Applications

基于Agentic AI的框架:缓解医疗应用中的过早诊断交接和无声幻觉

Divyansh Srivastava, Shreya Ghosh, Anshul Verma, Rajkumar Buyya

机构 * Distributed Systems (qCLOUDS) Lab, School of Computing Information Systems, The University of Melbourne, Australia 2Department of Computer Science Engineering, School of Electrical Computer Sciences (SECS), Indian Institute of Technology Bhubaneswar, India 3Department of Computer Science Banaras Hindu University, Varanasi, India

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出多智能体框架,通过确定性编排约束和两个安全机制(神经符号状态跟踪门和语义熵不确定性量化门)解决LLM在医疗对话中的过早诊断交接和无声幻觉问题,诊断精度提升11.3个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17973 2026-06-17 cs.CL 新提交 57%

Fine-tuning LLMs for Passive Depression Severity Estimation from AI Mental Health Dialogue

基于AI心理健康对话的被动抑郁严重程度评估:微调大语言模型

Olivier Tieleman, Ziyi Zhu, Ting Su, Samuel J. Bell, Thomas D. Hull, Caitlin A. Stamatis

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过微调Qwen3.5-27B模型,利用伪标签增强数据,从AI心理健康对话中预测PHQ-9总分,实现无需自评问卷的被动抑郁监测。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17417 2026-06-17 cs.SD cs.LG 新提交 57%

A Closer Look at Failure Modes in Temporal Understanding of Large Audio-Language Models

大型音频语言模型时间理解失败模式的深入分析

Apoorva Kulkarni, Kaousheik Jayakumar, Sreyan Ghosh, Sarah Wiegreffe, Dinesh Manocha, Ramani Duraiswami

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文通过行为与因果机制分析,揭示大型音频语言模型在时间推理中因模态不平衡而失败,并提出注意力重分配方法提升准确率。

Comments Accepted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15121 2026-06-17 cs.CL 新提交 57%

When Cognitive Graphs Meet LLMs: BDEI Cognitive Pathways for Panic Emotional Arousal Prediction

当认知图遇见大语言模型:恐慌情绪唤醒预测的BDEI认知路径

Mengzhu Liu, Long Qin, Chuan Ai, Zhengqiu Zhu, Hongru Liang, Chen Gao, Yong Li, Xin Lu, Quanjun Yin

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出PanicCognitivePath框架,通过心理安全距离模型融合多域信号,引入显式情绪节点构建BDEI认知路径,将LLM限制于单步参数估计,实现恐慌情绪唤醒时间预测,准确率提升10.68%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09376 2026-06-17 cs.CL 新提交 57%

Precision Is Not Faithfulness: Coverage-Aware Evaluation of Grounded Generation with a Complete Oracle

精确性不等于忠实度:基于完全神谕的覆盖感知接地生成评估

Juan S. Santillana

机构 * Globant

专题命中 推理评测 :verifier(abstract);分类 cs.CL

AI总结 针对参考无关忠实度指标仅测量精确性而忽略召回率的问题,提出利用完全神谕(F1赛事和NOAA天气预报)测量覆盖度,并设计结合精确性与覆盖度的综合指标及验证器引导生成方法。

Comments 9 pages. v2: adds Anthropic Claude + 3 additional fine-tuned bases (1B-7B); 6 frontier families x 3 languages. Code https://github.com/vectrayx/precision-is-not-faithfulness Demo https://huggingface.co/spaces/jsantillana/faithful-strategy-engineer-f1

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17029 2026-06-16 cs.CL 新提交 57%

DEEPRUBRIC: Evidence-Tree Rubric Supervision for Efficient Reinforcement Learning of Deep Research Agents

DEEPRUBRIC: 基于证据树规则监督的高效深度研究智能体强化学习

Minghang Zhu, Chuyang Wei, Junhao Xu, Yilin Cheng, Zhumin Chen, Jiyan He

机构 * Shandong University(山东大学) Zhongguancun Academy(中关村学院) Fudan University(复旦大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出DeepRubric框架,通过构建证据树生成查询-规则对,确保奖励信号准确评估查询所需信息,以13倍少的RL GPU时间达到与先前最优模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16987 2026-06-16 cs.AI 新提交 57%

Consensus-based Agentic Large Language Model Framework for Harmonized Tariff Schedule Code Classification

基于共识的智能体大语言模型框架用于协调制度海关编码分类

Truong Thanh Hung Nguyen, Khanh Van Quynh Nguyen, Hoang-Loc Cao, Tri Duong, Phuc Ho, Van Pham, Loc Nguyen, Hung Cao

机构 * Analytics Everywhere Lab, University of New Brunswick(新不伦瑞克大学无处不在分析实验室) University of Economics Ho Chi Minh City(胡志明市经济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出一种多智能体LLM框架,通过信息检索、语义检索、证据推理、共识验证和分层投票等方法,解决加拿大10位HTS编码分类难题,在3300条数据上验证了证据驱动和人工参与的必要性。

Comments Accepted at the 3rd International Conference of Resilience by Technology and Design (RTD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16897 2026-06-16 cs.CL 新提交 57%

Contrastive-Difference CKA Reveals Concept-Specific Structural Alignment Across Language Model Architectures

对比差异CKA揭示跨语言模型架构的概念特定结构对齐

Xueping Gao

机构 * Alibaba Cloud(阿里云)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出对比差异CKA(CKA_Delta)方法,发现不同LLM架构在概念表示上存在几何收敛与功能可迁移性分离的现象,能有效区分概念特定相似性与通用相似性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16629 2026-06-16 cs.CL 新提交 57%

Islamic Large Language Models: From Knowledge Acquisition to Trustworthy and Hallucination-Resistant AI

伊斯兰大语言模型:从知识获取到可信且抗幻觉的人工智能

Mohammed Amine Mouhoub

机构 * Paris Dauphine University(巴黎多芬纳大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 综述伊斯兰大语言模型领域,提出构建可信、抗幻觉的伊斯兰AI需结合阿拉伯语NLP、检索增强生成、教法学派推理及专家评估等关键技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16484 2026-06-16 cs.CV cs.AI cs.MM 新提交 57%

Unified Multimodal Model for Brain MRI Imputation and Understanding

统一多模态模型用于脑MRI补全与理解

Zhiyun Song, Che Liu, Tian Xia, Avinash Kori, Wenjia Bai

机构 * Department of Computing, Imperial College London(伦敦帝国理工学院计算机系) Department of Brain Sciences, Imperial College London(伦敦帝国理工学院脑科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出UniBrain模型,通过统一训练策略联合处理脑MRI模态补全与图像理解,采用自对齐和动态隐藏状态机制,在多疾病数据集上实现高性能。

Comments Early accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16038 2026-06-16 cs.SE cs.AI 新提交 57%

Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents

Open-SWE-Traces:推进软件工程智能体的双模式多语言蒸馏

Wasi Uddin Ahmad, Nikolai Ludwig, Somshubra Majumdar, Boris Ginsburg

机构 * NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 为解决软件工程智能体训练数据稀缺问题,构建包含20万条轨迹、覆盖9种编程语言的数据集,采用混合推理合成方法,微调Qwen3-30B-A3B系列模型,在SWE-bench基准上取得领先性能。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15971 2026-06-16 cs.CL 新提交 57%

SAG: SQL-Retrieval Augmented Generation with Query-Time Dynamic Hyperedges

SAG: 查询时动态超边的SQL检索增强生成

Yuchao Wu, Junqin Li, XingCheng Liang, Yongjie Chen, Yinghao Liang, Linyuan Mo, Guanxian Li

机构 * Zleap AI

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出SAG架构,通过SQL查询动态构建局部超边索引,避免全局图维护,在多跳推理基准上达到最优召回率,支持亿级数据生产部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15890 2026-06-16 cs.AI 新提交 57%

UrbanWell: Benchmarking Multimodal Large Language Models for Spatio-Temporal Urban Wellbeing Analytics

UrbanWell: 面向时空城市福祉分析的多模态大语言模型基准测试

Yanxin Xi, Xiang Su, Jie Feng, Yu Liu, Sasu Tarkoma, Pan Hui

机构 * University of Helsinki(赫尔辛基大学) Zhongguancun Academy(中关村学院) University of Oxford(牛津大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出UrbanWell基准,通过卫星和街景图像联合建模,系统评估多模态大语言模型在环境、空间可达性、城市形态、活力和主观感知等5类城市福祉指标上的时空推理能力,并定义时序预测和趋势分类任务。

Comments accepted by KDD Datasets and Benchmarks Track 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15349 2026-06-16 cs.CY cs.AI 新提交 57%

LearnOpt: Recovering the Latent Cognitive Structure of Standardized Examinations via Knowledge Graphs and Constrained Optimization

LearnOpt: 通过知识图谱和约束优化恢复标准化考试的潜在认知结构

Joy Bose, Om Thomas

机构 * Independent Researchers(独立研究者)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 提出LearnOpt框架,利用知识图谱和约束优化从历史试题中恢复潜在认知结构,生成个性化学习计划;在NEET和JEE Advanced考试数据上验证了潜在结构的稳定性和可检测的转变。

Comments 26 pages, 2 figures, 6 tables. Code, data, and calibration tooling: https://github.com/joyboseroy/learnopt. Datasets on HuggingFace: joyboseroy/neet-skill-tags-2016-2024, joyboseroy/jee-advanced-skill-tags-2016-2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15325 2026-06-16 cs.CL 新提交 57%

Prior over Evidence: Stereotype-Driven Diagnosis in LLM-Based L2 Pronunciation Feedback

先验优于证据:基于LLM的二语发音反馈中的刻板印象驱动诊断

Rong Wang, Kun Sun

机构 * University of Tuebingen(蒂宾根大学) Tongji University(同济大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究测试了LLM在二语发音反馈中是否基于语音证据而非预训练先验进行诊断,发现评分准确性与推理脱钩,音素级反馈收敛于固定困难音素集,且声学证据仅在直接探测目标维度时改善评分。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15044 2026-06-16 cs.CL 新提交 57%

Equity with Efficiency: An Empirical Study of Tokenizers for Multilingual Large Language Models

公平与效率:多语言大语言模型分词器的实证研究

Kieron Seven Jun Wei Lee, Muhammad Reza Qorib, Andrew Ivan Soegeng, Hwee Tou Ng

机构 * National University of Singapore(新加坡国立大学) Carnegie Mellon University(卡内基梅隆大学) SAP

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文系统比较了11种东南亚语言上的公平分词器,发现Parity-aware BPE在效率与公平的权衡中处于帕累托前沿,而Morphology-Driven Byte Encoding在语义推理上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14817 2026-06-16 cs.IR cs.AI 新提交 57%

Combining Retrieval-Augmented Text Generation with LLMs for Reading Content Recommendations

结合检索增强文本生成与大型语言模型的阅读内容推荐

Sooyeon Kim, Piotr S. Maciąg

机构 * Institute of Computer Science, Warsaw University of Technology(计算机科学学院,华沙技术大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.AI

AI总结 提出结合检索增强生成(RAG)与大型语言模型的系统,通过四个模块实现个性化阅读内容生成,实验表明RAG将相关性和接地性提升26-35个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11349 2026-06-16 cs.AI cs.HC 新提交 57%

Knowing When to Ask: Self-Gated Clarification for Hierarchical Language Agents

知道何时提问:分层语言代理的自门控澄清机制

Aijing Gao, Yiming Kang, Mengdie Flora Wang, Jae Oh Woo

机构 * Amazon Web Services(亚马逊云科技)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出ACTION-RATING框架,将澄清请求纳入代理的动作空间,与导航共享序数尺度,在分层推理中实现自门控澄清,通过强制性和机会性两种信息寻求模式提升决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14239 2026-06-15 cs.AI 新提交 57%

SkillAudit: Ground-Truth-Free Skill Evolution via Paired Trajectory Auditing

SkillAudit: 通过配对轨迹审计实现无真实反馈的技能进化

Haowen Gao, Haoran Chen, Can Wang, Shasha Guo, Liang Pang, Zhaoyang Liu, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 提出SkillAudit框架,通过配对轨迹审计和过程对齐对比评估,无需真实反馈即可进化智能体技能,在89个任务中平均奖励达73.9%。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14068 2026-06-15 cs.CL 新提交 57%

Harsher on Male? Evaluating LLMs on Gender-Asymmetric Moral Framing Across Diverse Conflict Scenarios

对男性更严厉?评估LLM在不同冲突场景中的性别不对称道德框架

Guangzong Si, Dong Wang, Zhenhao Li, Yifan Yu, Panwang Pan, Wentao Zhu

机构 * University of Science and Technology of China(中国科学技术大学) Eastern Institute of Technology, Ningbo(宁波东方理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出GAMA-Bench基准,通过性别镜像场景评估LLM对相同负面行为的回应,发现模型对男性更倾向于惩罚和责备,对女性则更强调共情和治疗。

Comments underreview

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14037 2026-06-15 cs.CL 新提交 57%

Right or Wrong, Models Comply: Directional Blindness in LLM Moral Judgment

对或错,模型都顺从:LLM 道德判断中的方向盲从

Jihye Kim, Jeffrey Flanigan

机构 * University of California, Santa Cruz(加州大学圣克鲁兹分校)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL

AI总结 本文提出顺从不对称性(A = BCR/HCR)双向诊断指标,发现大语言模型在事实判断中更顺从有益提示(A=1.58),但在道德判断中几乎同等顺从有益和误导提示(A=1.04),揭示了方向盲从这一对齐失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13931 2026-06-15 cs.CL 新提交 57%

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

DLawBench: 通过多轮法律咨询评估大语言模型

Li Zhang, Yuzhen Shi, Yiran Hu, Jingwen Zhang, Wenbo Lv, Yubo Ma, Wei Wang, Rongyao Shi, Yuanyang Qiu, Xinran Xu, Yuemeng Qi, Linlin Miao, Jaromir Savelka, Yun Liu, Kevin Ashley, Bing Zhao, Hu Wei, Lin Qu

机构 * University of Pittsburgh(匹兹堡大学) Alibaba Group(阿里巴巴集团) University of Waterloo(滑铁卢大学) Shandong University(山东大学) Skylenage China University of Political Science and Law(中国政法大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Fordham University(福特汉姆大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出DLawBench基准,通过模拟四种客户类型(合作、依赖、退缩、对抗)的多轮对话,评估大语言模型在真实法律咨询中的交互能力。

Comments 37 pages, 8 figures, 26 tables. Code and data: https://github.com/SKYLENAGE-AI/DLawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13808 2026-06-15 cs.CL 新提交 57%

The Culture Funnel: You Can't Align What isn't in the Data

文化漏斗:你无法对齐不在数据中的内容

Ananya Sahu, Mehrnaz Mofakhami, Daniel D'Souza, Thomas Euyang, Julia Kreutzer, Marzieh Fadaee

机构 * Cohere Labs(Cohere实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对当前文化对齐方法依赖推理时干预而忽视训练数据的问题,提出文化数据漏斗概念,通过多维标签框架分析预训练、微调、对齐和推理数据集,发现后训练阶段文化信号急剧下降,多语言性虽增强地理多样性但未能确保平衡,所提标签可提升下游文化基准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13218 2026-06-12 cs.CL 新提交 57%

When Similar Means Different: Evaluating LLMs on Arabic--Hebrew Cognates

当相似意味着不同:评估大语言模型在阿拉伯语-希伯来语同源词上的表现

Junhong Liang, Noor Abo Mokh, Bashar Alhafni

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·穆扎伊德人工智能大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对阿拉伯语和希伯来语同源词、假朋友和借词,构建SemCog Bench基准(1858对词对),评估LLM跨语言语义理解,发现模型依赖表面形式相似性,在假朋友和借词上表现差,上下文帮助有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12969 2026-06-12 cs.AI 新提交 57%

Multi-Modal Agents for Power Distribution Defect Detection: An Evaluation of Foundation Models

用于配电缺陷检测的多模态智能体:基础模型评估

Quan Quan

机构 * Quan Quan

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出多模态智能体框架,系统评估基础模型在感知、推理和工具使用三方面的能力,用于配电缺陷检测的闭环自动化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12821 2026-06-12 cs.AI cs.ET 新提交 57%

GeoNatureAgent Benchmark: Benchmarking LLM Agents for Environmental Geospatial Analysis Across Frontier and Open-Weight Foundation Models

GeoNatureAgent Benchmark:面向前沿与开源基础模型的环境地理空间分析LLM智能体基准测试

Gabriel Diaz-Ireland, Diego Prieto-Herráez, Mario García Peces, Javier Velázquez, Devika Jain

机构 * Universidad Católica de Ávila (UCAV)(阿维拉天主教大学) Johns Hopkins University(约翰霍普金斯大学) Independent Researcher(独立研究者) Center for Geographic Analysis, Harvard University(哈佛大学地理分析中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出首个通过结构化工具调用真实API评估环境分析智能体的基准,包含93个任务,发现Claude Sonnet 4领先,但开源模型在成本效益上占优,且比较任务普遍未解决。

Comments Preprint. 10 pages, 8 figures. Submitted to ACM SIGSPATIAL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12599 2026-06-12 cs.CL 新提交 57%

Constrained Semantic Decompression in LLMs through Persian Proverb-Conditioned Story Generation

通过波斯谚语条件故事生成实现LLM中的约束语义解压缩

Zahra Habibzadeh, Paria Khoshtab, Amir Mesbah, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究所,卡塔姆大学,伊朗) School of Electrical and Computer Engineering, College of Engineering, University of Tehran, Tehran, Iran(电气与计算机工程学院,工程学院,德黑兰大学,伊朗)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出约束语义解压缩任务,通过波斯谚语条件故事生成测试大语言模型的抽象到实现能力,构建PAND数据集,发现解压缩差距,并表明显式推理和迭代细化可部分缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12320 2026-06-11 cs.AI cs.CC cs.CR cs.SE 新提交 57%

A Five-Plane Reference Architecture for Runtime Governance of Production AI Agents

生产AI代理运行时治理的五平面参考架构

Krti Tallam

机构 * Kamiwaza

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对生产AI代理打破传统数据边界治理假设的问题,提出由推理平面和四个执行平面组成的五平面参考架构,通过可组合原语实现运行时治理,阻断七种威胁并验证四个正确性不变式。

Comments 65 pages, 3 figures, 5 tables. Reference architecture with a reference implementation of the policy-engine core and microbenchmark results; full-system evaluation identified as future work

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12250 2026-06-11 cs.CL 新提交 57%

Reassessing High-Performing LLMs on Polish Medical Exams: True Competence or Bias-Driven Performance?

重新评估高性能大语言模型在波兰医学考试中的表现:真实能力还是偏差驱动?

Antoni Lasik, Jakub Pokrywka, Łukasz Grzybowski, Jeremi Ignacy Kaczmarek, Gabriela Korzańska, Janusz Świeczkowski-Feiz, Oskar Pastuszek, Paulina Hoffman, Jakub Tomasz Dąbrowski, Wojciech Kusa

机构 * NASK National Research Institute(NASK国家研究所) Adam Mickiewicz University(亚当·密茨凯维奇大学) ARAAI Poland(ARAAI波兰) Poznań University of Medical Sciences(波兹南医科大学) Centre of Postgraduate Medical Education, Poland(波兰研究生医学教育中心) T. Marciniak Lower Silesian Specialist Hospital(T. 马尔奇尼亚克下西里西亚专科医院) Medical University of Warsaw(华沙医科大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 通过引入扩展和更具挑战性的波兰医学考试基准,减少MCQA伪影,发现标准MCQA分数高估了LLM的真实临床能力,最佳模型在更难的设置下分数下降28.4和31个百分点。

Comments 26 pages total with references and appendix, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏