Adversarial Attacks on Deep OCR Systems
针对深度OCR系统的对抗攻击
专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI
AI总结 本文提出首个针对生成式OCR视觉语言模型的纯黑盒对抗攻击,将其转化为零阶优化问题,在Deep-OCR上验证了攻击有效性并揭示解码器故障,还表明可控有目标改写更难实现。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
针对深度OCR系统的对抗攻击
专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI
AI总结 本文提出首个针对生成式OCR视觉语言模型的纯黑盒对抗攻击,将其转化为零阶优化问题,在Deep-OCR上验证了攻击有效性并揭示解码器故障,还表明可控有目标改写更难实现。
用于结直肠癌治疗规划的智能体生成式大语言模型
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);post-training(abstract)
AI总结 本研究提出智能体生成式大语言模型GatorOnco,经大规模生物医学文本训练与领域适配,在结直肠癌治疗规划的临床评估中性能优于开源LLM,达到专家级水平,可缩小生成式AI在高风险诊疗规划领域的应用差距。
MonitorBench: 一个用于大型语言模型链式思维可监控性的综合基准
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; University of Washington(华盛顿大学) ; University of California San Diego(加州大学圣地亚哥分校)
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);prompting(abstract)
AI总结 本文提出MonitorBench,通过1514个测试实例和两种压力测试设置,评估LLM链式思维的可监控性,发现决策关键因素对中间推理过程的影响程度影响可监控性,更高级的LLM表现出更低的可监控性。
Comments COLM 2026
ReMIND:编排模块化大语言模型以实现可控的意外发现 一种受REM启发的突发创意构思系统设计
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 研究旨在解决大语言模型生成新颖连贯想法的挑战,提出ReMIND四阶段框架,通过独立LLM模块区分探索与稳定。经多任务评估,发现新颖性增强分两阶段,不同LLM家族有不同倾向,为计算创造力研究提供通用框架。
SIMMER: 基于世界模型评估LLM可执行规划中的潜在故障
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出SIMMER基准,通过人工策划的厨房领域符号世界模型,评估LLM规划中的潜在故障;实验发现前沿模型最多17%无错误计划,56%含潜在故障,多数不可逆;反事实预演可减少72%潜在故障和75%不可逆案例。
Comments Accepted at COLM 2026
SymDiag:基于神经符号验证的LLM推理可解释诊断
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Xinjiang Future Enterprise Incubator Co., Ltd.(新疆未来企业孵化器有限公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SymDiag是一种神经符号框架,将LLM推理验证重构为结构化故障诊断,可定位推理故障步骤、分离翻译与推理错误,在多类基准中提升了不可靠推理检测与推理修复反馈效果。
KumbhDoot:面向大规模集会公共服务助手的可扩展、大语言模型(LLM)限定架构
专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大壶节这类高风险低连接性的大规模集会,提出KumbhDoot架构,以相似度优先、LLM限定为核心,解决默认LLM助手成本高、易幻觉等问题,适配公共服务场景。
LLM推理轨迹中的认知片段实现可解释的人类项目难度预测
机构 * Virginia Tech(弗吉尼亚理工大学) ; University of Maryland(马里兰大学) ; MBZUAI(穆桑大学人工智能研究所) ; University of Pittsburgh(匹兹堡大学)
专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Epi2Diff框架,将大型推理模型的推理轨迹映射为认知片段序列,通过推理规模、努力分配和状态转换建模项目难度,在真实数据集上优于基线方法。
Comments 32 pages, 8 figures, 10 tables
思考与非思考:基于稀疏自编码器的大语言模型推理机制可解释性研究
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本研究基于稀疏自编码器分析DeepSeek-R1-Distill-Qwen-7B的推理机制,揭示思考与非思考模式的神经差异,为大语言模型推理可解释性提供新见解。
Social Gym与SPaRTan:通过多智能体游戏锦标赛对LLM社会推理进行基准测试与改进
专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 该研究推出Social Gym多智能体社会游戏环境与SPaRTan自博弈反思迁移方法,前者可客观基准测试LLM社会推理,后者可提升GPT-5-mini的弱角色表现,为改进LLM社会推理提供了可复现基础。
SAKE:通过强化学习进行复杂LLM推理的结构代理知识外推
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 推理与问题求解 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI
AI总结 SAKE通过强化学习训练LLM自主检索和外推结构化知识,提升生物医学和常识领域推理性能,同时减少90%以上token使用。
从相关性到执行效用:面向基于技能的大语言模型智能体的奖励感知动态执行门控
机构 * Tongji University(同济大学) ; The University of Sydney(悉尼大学) ; University of Science and Technology of China(中国科学技术大学) ; Nankai University(南开大学) ; Johns Hopkins University(约翰斯·霍普金斯大学) ; City University of Hong Kong(香港城市大学) ; University of Surrey(萨里大学)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对基于技能的LLM智能体执行决策难题,提出RADEG轻量型决策层,通过学习代理模型预测执行效用,在288个rollout的评估中减少不必要执行并优于基线方法
用于主观任务的大语言模型推理:失败模式、缓解措施与动态推理路由
机构 * Duke University(杜克大学) ; Netflix(网飞公司)
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 该研究针对主观任务中LLM推理的失败模式,提出带条件长度惩罚的后训练算法缓解推理崩溃,还发现推理风格不匹配是主观验证误差主因,给出算法补丁与架构蓝图。
Comments 20th ACM Conference on Recommender Systems (RecSys 2026)
Agent-MD:用于有状态GCMC-MD模拟流程的带事件驱动升级机制的选择性大语言模型干预框架
机构 * The Hong Kong Polytechnic University(香港理工大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Agent-MD框架将LLM推理选择性用于GCMC-MD分子模拟流程的构建与事件审查,结合确定性执行,在蒙脱石水蒸汽脱附模拟中完成多周期计算,识别问题并揭示体系依赖的低湿度响应,实现可复现的代理辅助分子模拟。
Comments 7 figures, 2 tables
无验证器的测试时扩展的一致性方法
专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 本文针对现有基于置信度的无验证器测试时扩展(VF-TTS)方法在复杂任务上失效的问题,提出一致性(consilience)框架,通过评估置信度时间不对称性提升LLM推理性能,在数学和代码生成任务上优于基线。
ZetaGPT:无位置编码的状态空间注意力语言模型的参考实现
专题命中 推理与问题求解 :language model(title,abstract);RLHF(abstract,abstract_cn);small language model(abstract);pretraining(abstract)
AI总结 ZetaGPT是首款无显式位置编码的开源小型语言模型,它将因果状态空间方程与自注意力结合,提供全开源训练流水线,为无位置编码语言模型的研究提供紧凑可复现的参考实现。
VectraYX-Vision-1B:一款具备结构化视觉推理与原生工具使用能力的20亿参数以下西班牙语/拉丁美洲网络安全多模态模型
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);分类 cs.CL
AI总结 本研究推出VectraYX-Vision-1B,一款20亿参数以下西班牙语/拉丁美洲网络安全多模态模型,支持结构化推理与工具调用,针对网络UI优化,同时报告了其视觉定位的负面结果及相关修复方案,开源了模型与数据。
Comments 11 pages, 1 figure
大型语言模型中数学泛化的融合训练
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究针对思维模式融合(TMF)训练动态开展系统性研究,揭示两种模式间的非对称相互作用与负相关关系,为设计TMF训练设置提供指导。
Comments ACL SRW 2026
Poli-Bias:理解与测量大型语言模型在国际政治冲突中的偏差
机构 * Technical University Munich(慕尼黑工业大学)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI
AI总结 本研究提出细粒度反事实框架Poli-Bias,通过交换国家身份的成对提示对比响应,分解偏差维度,发现13个LLMs存在因国家身份导致的政治偏差,可用于审计LLMs的政治公正性与谄媚性。
界限幻觉:通过Merlin-Arthur协议为RAG系统提供信息论保证
机构 * Aleph Alpha Research(Aleph Alpha研究机构) ; Lab1141(Lab1141实验室)
专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 通过Merlin-Arthur协议训练RAG系统,提升模型对证据的依赖性,减少幻觉并增强信息论指标。
Comments 45 pages, 30 figures
面向多模态大语言模型的多分支策略优化
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Sichuan University(四川大学) ; Shanghai University(上海大学) ; Huawei Technologies Ltd.(华为技术有限公司)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 该研究针对多模态大语言模型统一信用分配的缺陷,提出MBPO框架,通过树结构与分支相对优势分配信用,结合时间回放缓冲区提升性能,在多模态推理基准上优于基线。
Comments 10 pages,8 figures
RareLens:通过对齐不同的大语言模型推理实现端到端罕见病护理
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI
AI总结 针对罕见病诊断难题,RareLens系统利用不同大语言模型推理的差异,通过四个协同模块实现全病程临床决策支持,在真实数据集和外部研究中表现出色,证明对齐模型推理是高不确定性临床决策的有效策略。
Comments 100 pages 7 figures
从推理到代理:大型语言模型强化学习中的信用分配
机构 * Independent Researcher(独立研究员)
专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL
AI总结 本文探讨了大型语言模型强化学习中信用分配问题,总结了47种方法,并提出了可重用的资源,指出从推理到代理的转变使信用分配更加复杂,推动了新的方法发展。
Comments 50 pages, 4 figures. v3: expanded to a unified 69-paper corpus through July 31, 2026; adds restored-state identification results, blind coding of a 42-paper full-text subset, a source-located reporting audit, the CA-ID Card, and replay-fidelity analysis
从专有大语言模型API窃取推理轨迹
专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究发现专有LLM API的加密推理轨迹存在跨会话、用户及模型的兼容性漏洞,开发了可扩展解密越狱方法,能提取模型推理、窃取PII等,还提出了对应缓解措施。
ComboShoppingBench:评估大型语言模型智能体在带优惠券的预算约束组合购物篮任务中的表现
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.CL、cs.AI
AI总结 本研究推出ComboShoppingBench组合购物基准,通过探索智能体、LLM评判者及确定性验证,发现各类LLM智能体在该基准上表现不佳,凸显其在约束感知组合购物上仍有巨大改进空间。
校准大语言模型推理的置信度边际过程监督
机构 * Johns Hopkins University(约翰霍普金斯大学)
专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
AI总结 本文提出RLCM框架,通过增强的边际过程奖励优化正确性和置信度可靠性,提升模型校准性能并保持准确性,同时实现更高效的置信度加权聚合。
智能体 harness:面向机器人自主的大语言模型驱动验证层
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Pacific Northwest National Laboratory(太平洋西北国家实验室)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 针对机器人规划模型的安全与伦理风险,提出LLM驱动的验证层作为中间件管控计划,实现近85%的类别准确率、97%的对抗性攻击遏制率,为机器人自主提供可靠保障。
Comments 7 pages. Not yet finalized for conference submission
SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。
当评判者不应做决定时:证据锁定的非补偿选择界限在推理流程中限制大语言模型评判者的失效
机构 * School of Computing and Information Technology, University of Wollongong(伍伦贡大学计算与信息技术学院) ; CSIRO’s Data61(联邦科学与工业研究组织Data61研究院) ; School of Computer Science and Information Technology, Adelaide University(阿德莱德大学计算机科学与信息技术学院)
专题命中 推理与问题求解 :LLM(title,summary_cn);分类 cs.AI
AI总结 该研究针对推理流程中的LLM评判者,提出证据锁定的非补偿规则EL-DGR,在不改变评判者等条件下提升了GSM8K和HotpotQA任务性能,发现应限制评判者影响范围而非提升其准确率。
LAUDE: 基于LLM的硬件设计单元测试生成与调试
机构 * Dept. of Electrical and Computer Engineering, University of Illinois Chicago(伊利诺伊大学芝加哥分校电子与计算机工程系) ; Microsoft(微软公司)
专题命中 推理与问题求解 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 LAUDE利用大语言模型能力,实现硬件设计的单元测试生成与调试,有效检测和修复设计中的错误。
Comments 11 Pages, 9 Figures, 9 Tables Submitted to AAAI 2027