What Do Compliance Detectors Read? An Audit of Activation Probes and Guard Models
合规检测器读取什么?激活探针与防护模型的审计
机构 * Lexsi Labs(雷克西实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究通过审计合规检测器发现其存在规则盲视问题,引入无需训练的ICS检测器,发布相关基准以推动规则盲视的进一步研究。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
合规检测器读取什么?激活探针与防护模型的审计
机构 * Lexsi Labs(雷克西实验室)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究通过审计合规检测器发现其存在规则盲视问题,引入无需训练的ICS检测器,发布相关基准以推动规则盲视的进一步研究。
UI-Mate:利用上下文内演示推进开放权重基础图形用户界面智能体
机构 * Tencent Hy Frontier Team(腾讯 Hy 前沿团队)
专题命中 推理评测 :verifier(abstract);分类 cs.AI
AI总结 UI-Mate是集成环境基训练栈与上下文内演示学习的GUI智能体,在多计算机使用基准上创开放权重SOTA,提升了长周期办公任务的执行可靠性
Comments UI-Mate Technical Report. Project page: https://ui-mate.github.io
当熵不够用时:在大语言模型输出长度预测中恢复丢失的语义
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究针对 LLM 服务中序列填充导致的算力浪费问题,提出 ESTP 框架结合熵与语义重要性预测输出长度,在 ForeLen 基准及端到端测试中均表现更优,可提升吞吐量并降低填充率。
将医疗大语言模型(LLM)基于因果知识图谱:框架、指标与心血管试点研究
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本研究提出以因果知识图谱为核心的医疗LLM评估框架,在心血管试点中验证其有效性,发现集成条件C4在因果推理相关指标上表现最优,未基于图的C1原始干预准确性最高但缺乏因果与证据基础。
面向工业异常检测的无分布虚警校准与经机会校正的空间评估
机构 * Tongji University(同济大学)
专题命中 推理评测 :planning(abstract);分类 cs.LG
AI总结 该研究针对工业异常检测现有指标的缺陷,提出结合无分布上限容差阈值与配对减交叉空间检验的方法,在多数据集上验证了其有效性,支持同时报告工作点性能与经机会校正的空间证据。
Comments 15 pages, 3 figures, 9 tables
评估分布式系统中智能体的代码修复能力
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 该研究推出分布式系统代码修复基准DDBench,评估10个LLM的代码修复能力,发现调试上下文可提升准确率且对强弱模型影响不同,分布式调试能凸显单进程基准未体现的推理能力。
Comments Under submission
基于基准的公开基准印度基础模型对比评估:能力与评估成熟度框架
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出能力与评估成熟度框架,对公开基准的印度基础模型与全球同类模型对比评估,发现其在传统基准表现尚可但参与新评估不足,还提出基准成熟度指数,指出能力差距或源于评估生态问题。
Comments 19 pages, 11 tables
Honeyquest for LLMs: 重新思考针对AI攻击者的网络欺骗
机构 * Horizon3.ai
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本研究提出自动评估框架,测试21个LLM(从8B到1T参数)对网络欺骗陷阱的反应,发现LLM比人类更容易上当,缺乏注意力转移效应,且存在认知-行动差距(73.4%识别陷阱但仍被利用),表明以人为中心的欺骗假设不适用于AI攻击者。
Comments 20 pages, 4 figures, 2 tables
追踪真相:面向视频大语言模型的物体感知时空监控
机构 * National University of Singapore(新加坡国立大学) ; VinUniversity(文大学) ; Nanyang Technological University(南洋理工大学)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出STEMO-Bench基准测试,通过分解查询验证时空监控能力,改进视频大语言模型的时空推理一致性。
Comments The authors are withdrawing this manuscript due to errors identified in the experimental evaluation and result aggregation, which affect several reported quantitative results and some conclusions. These issues require substantial re-evaluation of the experiments and analysis
大语言模型的阴暗面:基于代理的攻击向量用于系统级入侵
机构 * DIMES , University of Calabria , P. Bucci , 87036 , Rende (CS) , Italy(DIMES,卡利博里大学,P. Bucci,87036,Rende(CS),意大利) ; IMT School for Advanced Studies , Piazza San Francesco , 55100 , Lucca , Italy(IMT高级研究学院,圣弗朗西斯科广场,55100,卢卡,意大利)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 研究探讨了大语言模型作为推理引擎在自主代理中的安全漏洞,揭示其被用作攻击向量实现计算机入侵的机制,指出94.4%的模型易受直接提示注入攻击,83.3%易受RAG后门攻击,且多代理系统中100%的模型可通过代理信任利用攻击被入侵。
从法律论证中研究司法形式主义
机构 * Center for Critical Computational Studies(批判性计算研究所以) ; Goethe University Frankfurt(法兰克福歌德大学) ; Department for Legal Theory and Legal Doctrines, Faculty of Law(法学院法律理论与法律学说系) ; Charles University(查尔斯大学) ; Technical University of Darmstadt(达姆施塔特技术大学) ; Research Center Trustworthy Data Science and Security of the University Alliance Ruhr & Ruhr University Bochum(鲁尔大学博德姆大学可信数据科学与安全研究所以)
专题命中 推理评测 :reasoning(abstract);分类 cs.CL
AI总结 本文通过自动化方法分析捷克最高法院判决中的法律论证,建立MADON数据集,验证了东欧司法形式主义的主张,提升了司法决策分类的准确性和可解释性。
Comments pre-print under review
通过合成任务扩展实现AI科学家
机构 * Princeton University(普林斯顿大学) ; Microsoft Research(微软研究院)
专题命中 推理评测 :reasoning(abstract);分类 cs.AI
AI总结 本文提出一种合成环境生成管道,用于训练能从实践中学习的机器学习代理。通过真实数据集验证和自调试循环,生成高质量合成任务,提升Qwen3-4B和Qwen3-8B在MLGym上的性能,AUP指标分别提升9%和12%。
HarnessEval-W:将视觉世界评估智能体化
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究提出智能体化评估流程HarnessEval-W,将LLM生态的harness范式应用于世界模型基准测试,对18个世界模型的330个案例评估,其判断与人类偏好一致且提供可验证诊断,已开源并邀社区贡献。
Comments Project Page: https://mirros-lab.github.io/HarnessEval-W
SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。
Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture
用图约束的多实例学习工作流分解全切片图像报告生成
机构 * Faculty of Technology, Natural Sciences and Maritime Sciences, University of South-Eastern Norway(东南挪威大学技术、自然科学与海洋科学学院) ; Center for Cancer and Blood Diseases, Vestfold Hospital Trust(西福尔信托医院癌症与血液疾病中心) ; Faculty of Biomedical Engineering, Silesian University of Technology(西里西亚工业大学生物医学工程学院)
专题命中 推理评测 :reasoning(abstract)
AI总结 该研究提出图约束的多实例学习分解框架,结合Virchow2嵌入与器官条件图,提升WSI报告生成性能,明确器官路由是域转移瓶颈,支持错误定位。
Comments Accepted at the MICCAI 2026 REG Challenge
RoE-FND:结合大语言模型与经验学习实现有效且可泛化的循证假新闻检测
专题命中 推理评测 :reasoning(abstract)
AI总结 本文提出RoE-FND框架,结合LLM与自反经验学习构建经验库,推理时检索经验裁决对立推演,在5个FND基准上优于基线且跨数据集泛化性强。
TrustCLIP:通过对抗性重建学习隐私视觉特征
机构 * Meta ; Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) ; University of Tübingen(图宾根大学) ; National University of Singapore(新加坡国立大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 研究视觉和视觉语言模型中视觉特征隐私问题,提出TrustCLIP框架,以特征条件生成器为隐私对手,优化编码器特征与下游模块投影,降低生成式反演保真度并保持下游任务性能。
Comments https://atnikos.github.io/trustclip/ Update affiliations
PerFACT: 基于LLM驱动的数据集合成与融合动作分块变换器的运动策略
机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University(J. Mike Walker ’66机械工程系,德克萨斯A&M大学) ; Zachry Department of Civil and Environmental Engineering, Texas A&M University(Zachry土木与环境工程系,德克萨斯A&M大学)
专题命中 推理评测 :planning(abstract)
AI总结 PerFACT通过LLM驱动的数据集合成和融合动作分块变换器,提升机械臂运动规划的泛化能力和效率。
MME-VideoOCR:评估多模态大语言模型在视频场景中基于OCR的能力
机构 * Kling Team(Kling团队) ; PKU(北京大学) ; THU(清华大学) ; CASIA(中国科学院自动化研究所) ; CUHKSZ(香港科技大学) ; NTU(国立台湾大学) ; NJU(南京大学) ; XJTU(吉林大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 本文推出MME-VideoOCR视频OCR基准,评估18个最先进MLLMs的视频OCR能力,发现现有模型在需视频整体理解的任务中表现有限,最优模型准确率仅73.7%,明确了高分辨率输入等对视频OCR的重要性。
Comments Accepted by NeurIPS 2025
FDABench:异构数据上分析查询的数据代理基准
专题命中 推理评测 :reasoning(abstract)
AI总结 提出FDABench基准,通过2007个任务覆盖六种数据模态,并设计PUDDING框架自动构建数据集,以评估数据代理在异构数据上的推理能力。
Comments Accepted to KDD'26
重新审视基于语音大语言模型的直接语音到文本翻译:比CoT提示更好的扩展性?
机构 * Barcelona Supercomputing Center, Spain(巴塞罗那超级计算中心,西班牙) ; Universitat Politècnica de Catalunya, Spain(加泰罗尼亚理工大学,西班牙) ; DFKI GmbH, Saarland Informatics Campus, Saarbrücken, Germany(德意志联邦计算机研究中心(DFKI) GmbH,萨尔布吕肯,德国)
专题命中 其他推理 :CoT(title,title_cn);chain-of-thought(abstract);分类 cs.CL
AI总结 本文比较了CoT和直接提示在增加S2TT数据量下的表现,发现直接提示在数据增加时表现更优,可能成为更大资源下的更有效方法。
Comments To appear in Proc. ICASSP 2026, May 04-08, 2026, Barcelona, Spain
通过联合多任务学习增强科学课堂话语分析以进行推理组件分类
机构 * Department of Computer Science, Kennesaw State University(肯纳邦大学计算机科学系) ; Bagwell College of Education, Kennesaw State University(肯纳邦大学巴格威尔教育学院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文提出ADAS系统,通过联合多任务学习对教师和学生话语进行类型和推理组件分类,解决少数类标签不平衡问题,提升课堂话语分析效率。
纠缠于表征:大型语言模型中文化偏见的机制性探究
机构 * University of Copenhagen(哥本哈根大学) ; KAIST(韩国科学技术院)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出Culturescope方法,通过机制性可解释性探讨LLMs中文化偏见的来源,揭示低资源文化对文化偏见的抗性及模型参数知识的限制。
Comments 22 pages, 15 figures
DR.GAP:采用解耦推理的性别感知提示缓解大语言模型中的偏见
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 该研究针对大语言模型的性别偏见问题,提出DR.GAP方法,通过生成无性别推理轨迹作为上下文示例,在不修改模型参数的情况下缓解偏见,且可扩展至视觉语言模型,经多任务多模型实验验证有效。
SEER:基于选择性视觉-文本压缩的长上下文推理
机构 * The University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; University of Cambridge(剑桥大学) ; University of Technology Sydney(悉尼科技大学) ; The University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 SEER是结合视觉压缩效率与文本推理精度的框架,经监督微调后在LongBench等长上下文基准测试中,准确率优于Glyph-9B、Qwen3-8B等基线模型,可提升提取精度并保留提示token节省量。
Comments COLM 2026, Third Conference on Language Modeling
ReasonCast:基于选择性语义推理的智能体需求预测
机构 * Taobao and Tmall Group, Alibaba Group(阿里巴巴集团淘宝天猫集团)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 ReasonCast是结构化语义干预框架,通过选择性语义推理结合多类信息,在三类场景降低WMAPE,且可避免稳定期无差别干预的负面影响。
基于多智能体闭环推理的多模态光谱有机结构解析
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出多智能体系统MACROS,经海量光谱数据训练后可实现零样本泛化,提升结构解析速度与准确性,为全自动结构解析及自主实验室发展奠定基础。
大语言模型(LLMs)从针对性的合成多语言数据中提升性能
机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Uniphore(优尼佛(Uniphore)公司)
专题命中 其他推理 :reasoning(abstract,abstract_cn);分类 cs.CL、cs.AI
AI总结 本研究提出HOTFIXR数据生成框架,通过探测学生模型多语言弱点生成合成多语言数据,可提升大语言模型的多语言性能,降低微调引发的灾难性遗忘。
Proteus:面向长上下文序列建模的增量式内存激活机制
机构 * Mila(米拉计算科学研究所) ; Google(谷歌公司)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Proteus 是一种增量式内存激活机制,可嵌入多种神经内存架构,应用于 SWLA 等模型后,能在长上下文相关任务上实现性能提升,证明调度有效容量对序列建模的适用性。
模型催眠:通过叠加阈下效应对AI进行强控制
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。