Validity, Reliability, and Transparency in Artificial Intelligence Regulation
人工智能监管中的有效性、可靠性与透明度
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本文针对现有AI监管框架未将AI推断有效性作为部署前提的不足,结合印度《普塔斯瓦米》判决的信息自决原则,提出含有效性评估、部署后监测的结构化可操作AI监管框架。
科学与医疗
医学智能、临床 AI、医学影像、病理、诊断和医疗健康大模型。
人工智能监管中的有效性、可靠性与透明度
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本文针对现有AI监管框架未将AI推断有效性作为部署前提的不足,结合印度《普塔斯瓦米》判决的信息自决原则,提出含有效性评估、部署后监测的结构化可操作AI监管框架。
BlockPython:一种支持从积木式编程向Python编程过渡的进程感知智能体平台
机构 * East China Normal University(华东师范大学) ; Tsinghua University(清华大学) ; University of Washington(华盛顿大学)
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 BlockPython是支持从积木式编程向Python过渡的平台,以双向转换为核心,通过四阶段引导学习者,利用进程证据诊断困难,为相关系统设计提供参考。
Comments AIED 2026 Interactive Event Track
C³PO:评估全模态模型中的跨模态组合与反事实性能
机构 * Microsoft Research India(微软研究院印度分院) ; IIIT Hyderabad(印度国际信息技术研究院(海得拉巴))
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本研究推出C³PO基准数据集,评估全模态模型的跨模态组合与反事实性能,发现模型存在模态主导问题,需改进架构以支持持续跨模态注意力。
飞行前深思熟虑:面向无人机“看见并到达”导航的视觉引导空间深思熟虑
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 针对无人机“看见并到达”导航中语义-控制失配问题,提出视觉-语言航路点预测框架DBFly,通过空间机动决策链、隐式飞行走廊和感知终端收敛的停止策略,使成功率较SOTA基线平均提升25.07个百分点。
Comments 13 pages, 9 figures
面向时间敏感血液样本采集与配送的动态调度
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 针对血液样本配送延迟问题,提出基于马尔可夫决策过程的神经近似动态规划调度框架,通过对偶值函数分解提升按时配送样本量占比,减少对外部快递的依赖。
DiagChain:用于评估大语言模型智能体基于证据的攻击链重构的诊断基准
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 研究针对LLM智能体攻击链重构基准的不足,提出DiagChain基准与ECRAG方法,经6种LLM评估发现模型在证据整合与排序环节存在瓶颈,为网络安全智能体改进提供了诊断依据。
保序分布回归的生存版本
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本研究提出S-IDR,将IDR扩展至右删失场景,无调参且适配多类型协变量,在基准套件及肝移植MELD评分验证案例中表现良好,配套多语言包可用。
Comments 65 pages, 16 figures, 3 tables. Main text 35 pages; appendices contain all proofs
联合贝叶斯布尔矩阵分解及其在多发性骨髓瘤染色体拷贝数变异中的应用
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 研究针对现有布尔矩阵分解未利用相关数据集共享潜在结构的问题,提出JBBMF模型,通过共享潜在结构联合分解二元矩阵,在模拟和多发性骨髓瘤数据应用中提升了因子恢复与分析效果。
MechGeo:在Lean 4中自动形式化与证明欧几里得几何
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 MechGeo是基于Mathlib的智能体框架,可在Lean 4中自动形式化欧几里得几何问题并构造认证证明,在43道IMO几何题及Lean-IMO-Bbench上取得显著成果,为可信形式几何提供实用基础。
Comments 43 pages
面向数据与AI流水线的智能体自修复:一种采用开源软件的低成本、厂商无关架构
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本文对比现有AI辅助流水线运维方案的不足,提出采用开源工具的低成本厂商无关智能体自修复流水线架构,可帮助团队减少人工处理流水线问题的工作量。
Comments 19 pages, 5 figures
长视野搜索智能体的搜索行为与失败模式诊断
机构 * Renmin University of China(中国人民大学) ; National University of Singapore(新加坡国立大学)
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本研究通过轨迹级诊断区分长视野搜索智能体的检索与利用差距,发现搜索努力与答案质量弱相关,为优化深度研究系统提供了查询构建、证据管理等方向。
基于语言模型的高风险决策:来自急诊分诊的见解
机构 * Microsoft(微软) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本研究以急诊分诊为案例,将语言模型的高风险决策置于概率决策框架内,发现语言模型可根据效用调整建议,强调高风险场景下需将其作为概率决策系统评估。
Comments 29 pages
MedUPS:利用大语言模型辅助罕见医疗病例的诊断
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本研究提出MedUPS对齐框架及MedUPSQA数据集,通过强化学习使大语言模型对齐临床中游决策,提升了不同规模模型的下一步临床决策准确率,且小模型表现优于部分大模型。
Comments 13 pages, 6 figures
通过互补多视图可解释性理解Linux中的在线故障预测
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本文构建并评估Linux的可解释在线故障预测流水线,其跨工作负载检测准确率达91%-94%、误报率低于1%,但诊断对工作负载转移更敏感,留一模式评估下未见故障模式诊断准确率为0%,凸显互补可解释性机制的价值。
Comments Accepted for publication in the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE) 2026
Ekova:用于自我发现对话的人格支持智能体
机构 * ModelsLive Inc.(ModelsLive公司)
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 该研究提出人格支持范式,构建了DSD数据集、DeepSupport系统及Ekova智能体,经OrthoTune训练的模型在相关指标上较基线平均提升16.3%。
Comments Accepted to the COLM 2026 Lifelong Agents Workshop
超导体的复合量子几何
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 该研究基于BdG哈密顿量,在三个条件下揭示超导态量子几何可分解为正常态与配对量子几何的复合结构,推导了相关解析公式,为超导体设计及非常规超导电性实验诊断提供了依据。
FDD-ON的开发:一种用于变风量(VAV)暖通空调(HVAC)系统故障检测与诊断的本体
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 该研究开发了用于VAV HVAC系统故障检测与诊断的本体FDD-ON,整合相关语义与库,经公开数据集评估,为推进可扩展的FDD解决方案提供了基础语义框架。
Comments 39 pages, nine figures and 19 tables
部署壁垒:企业人工智能部署时代的诊断框架与工具
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 该研究针对企业生成式AI试点落地难问题,提出部署壁垒诊断框架与工具,通过评估平台消除摩擦的能力,助力企业将AI平台决策从基准比较转向架构比较。
Comments 19 pages, 6 figures, 8 tables. Introduces the Deployment Wall framework, the Seam Index diagnostic instrument (with an evidence-anchored scoring protocol), and the Deployment Debt construct; includes six falsifiable propositions and a research agenda
IyawoBench v2.0:尼日利亚基层医疗中大型语言模型临床分诊的扩展诊断评估
专题命中 诊断辅助 :clinical AI(abstract)
AI总结 IyawoBench v2.0评估尼日利亚基层医疗的大型语言模型临床分诊,提出含三类失效模式的框架及新指标,发现前沿模型存缺陷,最优模型随部署场景变化,为中低收入国家临床AI选择提供基准。
现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持
机构 * Atman Labs(阿特曼实验室) ; Oxford University Hospitals(牛津大学医院) ; University of Oxford(牛津大学) ; NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) ; Imperial College London(伦敦帝国理工学院) ; Technical University of Munich(慕尼黑工业大学) ; Massachusetts General Hospital(麻省总医院) ; Mass General Brigham(麻省总医院布里格姆医疗系统) ; Harvard Medical School(哈佛医学院) ; Barts Health NHS Trust(巴特保健国民保健信托基金会) ; the University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。
Comments 3 figures
并非所有 token 都应获得同等权重:面向长思维链(Long-CoT)推理的反事实敏感性权重重分配
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) ; Institute of Wireless Communications Technology, Shanghai Jiao Tong University(上海交通大学无线通信技术研究所)
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 针对长思维链推理中均匀分配 token 权重的缺陷,提出反事实敏感性权重重分配方法,在数学推理基准上优于 GRPO,验证了特权诱导方向不可靠的诊断。
Comments 20 pages, 6 figures, 11 tables
MemeBench:大型视觉语言模型在解读依赖文化的梗图时所缺失的内容
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 研究针对LVLMs解读文化类梗图的知识缺口问题,推出诊断基准MemeBench及实体引导检索基线KAR,验证了检索手段可提升梗图解读的VIKR成功率。
Comments 17 pages, 5 figures, and 13 tables
解决生成式AI(GenAI)方案比评估更好吗?
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 通过220名大三算法课学生的随机A/B交叉研究发现,评估GenAI方案与传统解题的整体成绩无显著差异,仅作业成绩局部更高,需刻意支架式教学才能获得学习收益。
Comments 11 pages
拓扑因果数据分析的数学框架
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 该研究提出拓扑因果数据分析(TCDA)框架,区分结果级与分布级TCDA,构建对应识别与表示方法,明确观测拓扑在因果发现中的作用,为结构化对象的因果分析提供数学基础。
PhoPS:面向勘测时代天文学的自动测光流水线
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 针对现代天文勘测的海量数据需求,研究人员开发了开源自动测光天体测量流水线 PhoPS,通过动态 Gaia DR3 索引与 RANSAC 零点模型提升精度,适用于小行星光变等天文研究。
Comments 11 pages, 9 figures, 3 tables
生成还是判断?基于范式视角的对话中基于大语言模型(LLM)的情感-原因对抽取
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 该研究针对对话情感-原因对抽取,对比LLM的生成与判断范式,发现对级判断更优,引入辅助检索器后在三个数据集上实现F1提升,明确任务分解与候选范围的关键作用。
智能体交流前:多智能体系统中的事前失败风险推断
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本研究针对多智能体系统中幻觉级联失败的问题,提出事前风险推断框架HalluProp,通过建模内在幻觉风险与传播机制实现早期诊断,性能优于事后方法,可提升系统可靠性。
用于物理一致性多输出符号回归的共享符号主干
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本文提出神经进化符号回归方法,以共享符号主干实现耦合多输出系统的物理一致性,在弱可识别共享因子场景下优于独立方法,是结构化共享机制提取器。
Comments 20 pages, 1 figure
GuideSkill:面向基于指南的临床推理的可执行大语言模型智能体技能演化框架
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 本文提出与模型无关的GuideSkill框架,通过可执行技能结合指南流程与病例诊断模式,在多基准和骨干模型上显著提升临床推理性能,技能可靠且实用。
超越认知:认知分裂症与作为技术符号机器的大语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 诊断辅助 :diagnosis(abstract)
AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。