AttackonCTF: Defending Hardware Security Competition Benchmarks in the Age of LLMs
AttackonCTF: 在LLM时代捍卫硬件安全竞赛基准
专题命中 推理评测 :reasoning(abstract)
AI总结 针对LLM利用语法比较破解硬件安全竞赛基准的问题,提出首个面向LLM的语义保持混淆框架,将检测准确率降低78.6%,恢复基准可靠性。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
AttackonCTF: 在LLM时代捍卫硬件安全竞赛基准
专题命中 推理评测 :reasoning(abstract)
AI总结 针对LLM利用语法比较破解硬件安全竞赛基准的问题,提出首个面向LLM的语义保持混淆框架,将检测准确率降低78.6%,恢复基准可靠性。
长视频中的条件多事件时间定位
机构 * University of Central Florida(中佛罗里达大学) ; Qualcomm AI Research(高通人工智能研究院)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出CoMET-Bench基准和CoMET-Agent框架,解决长视频中基于组合时空条件定位所有事件的任务,F1@0.5提升6.1%。
自动驾驶谈判者:一个在隐藏意图下进行社会谈判和心理理论的交互式可验证基准
机构 * Owl Autonomous Imaging, Inc(Owl 自动成像公司)
专题命中 推理评测 :planning(abstract)
AI总结 提出一个文本多轮程序化生成环境,用于衡量自动驾驶中基于隐藏意图推断的隐式社会协调能力,通过特权模拟器状态计算奖励和诊断,当前最佳模型平均成功率仅0.68。
LLMs 具备可视化素养:现在呢?探索 LLM 可视化评估能力的实验
专题命中 推理评测 :chain-of-thought(abstract)
AI总结 通过实验评估最新 LLM 在可视化素养、指令遵循和图形完整性方面的能力,发现其可视化素养超越人类,但在指令遵循和识别误导性可视化方面仍有不足。
文档到LLM供应链中的语义完整性失败
专题命中 推理评测 :reasoning(abstract)
AI总结 研究文档到LLM应用中的隐藏提取层导致的split-view PDF攻击,发现25种提取间隙,评估16个处理栈和7个商业LLM服务,提出静态扫描工具。
DynaHMRC: 基于大语言模型的动态任务去中心化异构多机器人协作
机构 * University of Science and Technology of China (USTC)(中国科学技术大学) ; University of Macau (UM)(澳门大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出DynaHMRC去中心化框架,每个机器人作为角色感知的LLM智能体,通过四阶段闭环流程(自我描述、任务分配与领导竞标、领导者选举、反思执行)实现动态异构多机器人协作,并构建基准测试验证其高效性和可扩展性。
HSQ-VLM: 一种用于糖尿病视网膜病变可解释性的新型空间约束象限分割VLM模型
机构 * Pittsburgh, Pennsylvania(宾夕法尼亚州匹兹堡)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出HSQ-VLM,利用地标锚定笛卡尔交叉注意力机制和四象限拓扑潜在分割,实现眼底图像中病变的解剖精确量化与自然语言报告生成,在出血和微动脉瘤检测上达到99.6%和96.4%的灵敏度。
GridVQA-X: 评估多模态可解释性方法的框架
机构 * IIIT Hyderabad(印度海得拉巴国际信息技术学院) ; University of Virginia(弗吉尼亚大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出GridVQA-X诊断框架,通过合成数据生成数学保证的解释,并训练纯推理与捷径依赖的配对模型,揭示现有可解释性方法无法区分真实跨模态推理与浅层捷径。
Comments 23 pages, 15 Figures, Accepted for poster presentation at CVPR 2026 TRUE-V Workshop
GroupToM-Bench: 多模态大语言模型中群体心智理论和非线性社会涌现的基准测试
机构 * Xidian University(西安电子科技大学) ; National University of Singapore(新加坡国立大学) ; University of Electronic Science and Technology of China(电子科技大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 推理评测 :reasoning(abstract)
AI总结 针对多模态大语言模型在群体心智理论推理上的不足,提出GroupToM-Bench基准,通过七级认知审计框架评估模型从微观BDI状态到宏观结果预测的因果链,揭示模型在处理社会结构和非线性集体动态上的缺陷。
Comments ACL 2026 (Main Conference)
HanDyVQA:面向细粒度手-物交互动态的视频问答基准
机构 * Institute of Industrial Science, The University of Tokyo(东京大学工业科学研究所) ; National Institute of Advanced Industrial Science and Technology (AIST)(国家先进工业科学与技术研究院) ; Waseda University(早稻田大学) ; Visual Geometry Group, University of Oxford(牛津大学视觉几何组)
专题命中 推理评测 :reasoning(abstract)
AI总结 提出HanDyVQA基准,通过六类问题(11.1K QA对)和10.3K分割掩码,全面评估视频模型对手-物交互中操作与效果的细粒度时空推理能力,发现最佳模型Gemini-2.5-Pro仅73%准确率(人类97%)。
Comments CVPR 2026, Project page: https://masatate.github.io/HanDyVQA-project-page/
CoRA: 面向可靠思维链推理的置信度-理由对齐
机构 * Vanderbilt University(范德比尔特大学) ; Vanderbilt University Medical Center(范德比尔特大学医学中心) ; Intuit AI Research(Intuit AI研究)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL
AI总结 提出GRPO强化学习框架,联合奖励答案正确性、置信度与理由支持度,减少置信度与理由对齐误差,提升推理可靠性。
潜在思维流:大型语言模型中的高效潜在推理
机构 * Singapore Management University(新加坡管理大学) ; Ant Group(蚂蚁集团)
专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 提出Latent Thought Flow (LTF)方法,将推理建模为可变长度连续轨迹,通过连续GFlowNet训练采样器匹配奖励后验,在提升准确率9.5%的同时平均减少推理长度27.2%。
通过推理启用的任务对齐防御自适应提示注入攻击
机构 * University of Waterloo(滑铁卢大学) ; Zhejiang University(浙江大学) ; KTH Royal Institute of Technology(皇家理工学院)
专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 提出RETA方法,通过基于用户任务的多目标强化学习训练防御器,利用思维链推理验证行动一致性,并采用字典学习多样性奖励生成对抗样本,在六种自适应攻击下平均攻击成功率低于4%。
Nemotron 3 Ultra: 开放、高效的混合专家Mamba-Transformer模型用于智能体推理
机构 * NVIDIA(英伟达)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出550B总参数量、55B激活参数的混合专家Mamba-Attention语言模型Nemotron 3 Ultra,通过20T tokens预训练、1M上下文扩展及后训练,在推理吞吐量提升约6倍的同时保持与顶尖模型相当的精度。
VibeThinker-3B:探索小型语言模型中可验证推理的前沿
机构 * University of Science and Technology of China(中国科学技术大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 提出3B参数紧凑模型VibeThinker-3B,通过频谱到信号后训练范式(课程SFT、多域强化学习、离线自蒸馏)在可验证推理任务上达到前沿性能,匹配甚至超越大模型,并验证推理增强不损害指令可控性。
少即是多:用最小测试时干预提升大语言模型推理能力
机构 * HKUST(GZ)(香港科技大学(广州)) ; Kuaishou Technology(快手科技) ; AIML(人工智能实验室) ; ZJU(浙江大学) ; Ant Group(蚂蚁集团) ; HKUST(香港科技大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 针对大语言模型推理中高计算成本问题,提出最小测试时干预(MTI)框架,通过仅在不确定位置应用分类器自由引导和轻量负提示引导,在保持高效的同时提升推理准确性和稳定性。
Comments Code: https://github.com/EnVision-Research/MTI
AdaSTORM: 通过自适应时空多智能体协作扩展动态图上的LLM推理
机构 * Tianjin University, China(天津大学,中国) ; Beihang University, China(北航大学,中国)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出AdaSTORM框架,通过自适应分区和时空解耦的多智能体协作,将动态图推理扩展到千节点规模,准确率超90%,无需外部工具。
DeepRoot: 一个基于知识图谱协调的多智能体系统,用于历史医学文本的治疗推理
机构 * University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; University of Cambridge(剑桥大学) ; University of Toronto(多伦多大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出DeepRoot多智能体系统,通过联合构建和利用验证知识图谱,将接地与推理分离并组合,从历史医学文本中恢复药物-疾病治疗关系,显著优于基线LLM和工具调用LLM。
Journal ref ICML 2026 GenBio; ACM CAIS 2026 Workshop AI Agents for Discovery in the Wild
法律领域推理中大语言模型的神经元级分析
机构 * Institute of Science Tokyo(东京科学大学) ; NII(国立信息学研究所) ; AIST(产业技术综合研究所)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 通过神经元归因分数识别并抑制关键神经元,发现存在任务特异性神经元和跨任务通用神经元,法律领域神经元重叠度高且分布受输入格式影响。
AdaSR: 自适应流式推理与分层相对策略优化
机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Southeast University(东南大学) ; Xi’an Jiaotong-Liverpool University(西交利物浦大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 提出AdaSR框架,通过分层相对策略优化(HRPO)实现流式输入下的自适应推理,在推理准确率、计算效率和流式延迟间取得更好平衡。
ESG叙述评分中重度推理LLM部署的有限边际收益:一项关于日本上市公司的4模型共识研究
机构 * Kansai University(关西大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 通过4模型共识设计,研究在ESG叙述评分中,重度推理模型相比非推理模型是否带来显著收益,发现其边际收益有限且成本高昂。
Comments 12 pages. Earlier version available on SSRN, Abstract ID 6683303
推理即模式匹配:人类与LLM日常推理中的共享机制
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 研究通过比较人类和25个LLM在日常因果推理中的错误模式,发现两者均表现出模式匹配而非抽象世界模型驱动的推理,并识别出LLM中驱动响应的注意力头可预测人类推理错误。
Comments 13 pages main text, 51 pages supplementary text
AgenticRec:面向推荐的智能体框架与渐进式工具集成推理优化
机构 * Xiamen University(厦门大学)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI
AI总结 提出AgenticRec框架,将推荐建模为工具集成推理过程,并设计两阶段训练范式,通过隐式反馈激活和渐进偏好细化提升推荐准确性。
哎呀,等等:话语标记在推理模型中的重要性
机构 * NAVER AI Lab(NAVER人工智能实验室)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文研究话语标记(如“wait”)在推理轨迹中的作用,发现数据高效微调可部分复现其模式,但不如大规模后训练与高置信答案转换对齐。
理解大语言模型在抽象摘要中的推理能力
机构 * ALOHA Lab, University of Hawaii at Manoa(夏威夷大学马诺亚分校ALOHA实验室)
专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本研究通过大规模比较8种推理策略和3种大型推理模型在8个数据集上的表现,发现推理并非万能,其效果依赖于策略和摘要设置,且存在质量与事实准确性之间的权衡。
Comments 27 pages,15 figures
在LLMs中协调语义与协同:基于推理的序列推荐嵌入生成器
专题命中 其他推理 :reasoning(title,abstract)
AI总结 提出ReaEmb框架,通过潜在推理增强对比学习和协同奖励强化学习,利用LLM推理能力并显式注入协同信号,解决序列推荐中的长尾问题。
Comments 11pages,5figures
HiMPO:面向长周期智能体的后见知情记忆策略优化以减少纠缠信用分配
机构 * Unicom Data Intelligence, China Unicom(联通数据智能有限公司,中国联通) ; Data Science & Artificial Intelligence Research Institute, China Unicom(中国联通数据科学与人工智能研究院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 提出HiMPO框架,通过比较记忆更新前后的任务相关信息估计局部效用,并利用后见相关性作为回顾性滤波器,减少记忆写入动作的信用纠缠,提升长周期智能体性能。
Comments Preprint. 2 figures
现在谁应该主导解码?跟踪可靠轨迹以集成掩码扩散语言模型
机构 * KAIST(韩国科学技术院) ; AITRICS
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 针对掩码扩散语言模型集成问题,提出TIE框架,通过跟踪答案相关位置的置信度动态,迭代识别并传递可靠解码轨迹,实现多模型协同生成。
Comments preprint
HyDRA:异构LLM池的混合动态路由架构
机构 * Microsoft(微软)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本文提出HyDRA,一种能够根据查询预测细粒度多维能力需求并匹配配置定义模型配置的混合动态路由架构,实现了在异构LLM池中高效且无需重新训练的模型选择。
Comments preprint v2
问题到知识(Q2K):多智能体生成可检查的事实以实现产品映射
机构 * The University of Tokyo(东京大学) ; KISTI(韩国科学技术院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 Q2K通过多智能体框架利用大语言模型实现可靠的产品SKU映射,通过生成辨析问题、网络搜索和去重来提高准确性与鲁棒性,适用于复杂场景如捆绑识别和品牌来源辨析。
Comments Accepted by IEEE BigData 2025 Industry Track
Journal ref 2025 IEEE International Conference on Big Data (BigData), Macau, China, 2025, pp. 2646-2653