Distributional Alignment Games for Answer-Level Fine-Tuning
分布对齐博弈用于答案级微调
机构 * Google Research(谷歌研究) ; Microsoft Research(微软研究)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
分布对齐博弈用于答案级微调
机构 * Google Research(谷歌研究) ; Microsoft Research(微软研究)
专题命中 数学推理 :reasoning(abstract);分类 cs.LG
AI总结 本文提出分布对齐博弈框架,通过策略与目标的博弈达到答案级优化,统一了多样性与自改进方法,提升数学推理任务效率。
探索剪枝的极限:任务特定神经元、模型崩溃与任务特定大语言模型中的恢复
机构 * BRAC University(布拉格大学)
专题命中 数学推理 :reasoning(abstract);分类 cs.CL
AI总结 研究通过系统剪枝实验揭示任务特定语言模型中神经元的专有性,发现任务特定神经元对性能至关重要,剪枝策略影响模型鲁棒性和恢复能力。
对抗性欺骗的模仿游戏:生成AI中的链式推理
机构 * Information and Society Research Division, National Institute of Informatics(信息与社会研究部,国立信息研究所) ; Department of Information Engineering and Computer Science, Feng Chia University(信息工程与计算机科学系,逢甲大学)
专题命中 代码与定理证明 :reasoning(title,abstract);chain-of-thought(title,abstract);分类 cs.AI
AI总结 本文提出基于模仿游戏的对抗性欺骗防御框架,利用链式推理生成多模态代理,有效对抗生成AI中的演绎和归纳欺骗攻击。
Journal ref in IEEE Access, vol. 13, pp. 95085-95093, 2025
基于LLM的政策合规推理的知识图谱表示
机构 * University of Maine(缅因大学)
专题命中 代码与定理证明 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出一个框架,通过构建知识图谱从AI政策文档中检索相关信息,评估五种LLM在42个政策问答任务上的表现,证明知识图谱增强提升了模型性能,且开放的LLM发现模式达到或超越了正式本体。
TRUST:一种去中心化AI服务框架v.0.1
专题命中 代码与定理证明 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI
AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。
多智能体系统中信息污染的跟踪级分析
机构 * Cornell University(康奈尔大学) ; University of Illinois(伊利诺伊大学)
专题命中 代码与定理证明 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 研究多智能体系统中信息污染现象,通过跟踪差异量化污染影响,提出污染表现类型分类及测量框架,揭示验证防护失效原因。
组合与融合:重新审视多模态推理中的基础瓶颈
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.CL、cs.AI
AI总结 本文通过逻辑基础评估框架,发现多模态推理中模态交互的六个模式影响推理效果,指出任务组合和融合是主要瓶颈,提出通过分步提示和早融控制提升推理性能。
Comments Our code (https://github.com/DELTA-DoubleWise/OmniReason) and data (https://huggingface.co/datasets/ycwang11/OmniReason) are publicly available
对齐感知、推理、建模与交互:物理AI的综述
机构 * Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区) ; ETH Zurich(苏黎世联邦理工学院) ; ETH AI Center(苏黎世联邦理工学院人工智能中心) ; The Chinese University of Hong Kong(香港中文大学) ; Shanghai Jiao Tong University(上海交通大学) ; Yinwang Intelligent Technology Co., Ltd.(云网智能技术有限公司) ; Peking University and Beijing International Center for Mathematical Research(北京大学和北京国际数学研究中心)
专题命中 逻辑推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文综述了物理AI,探讨了理论物理推理与应用物理理解的区别,并分析了基于物理的方法如何提升AI在现实世界中的理解能力,推动更安全、可推广的AI系统。
AMMA: 一种面向低延迟1M上下文注意力服务的多芯片片内存架构
机构 * University of California, San Diego(加州大学圣迭戈分校) ; Columbia University(哥伦比亚大学) ; Yonsei University(延世大学) ; NVIDIA(NVIDIA公司) ; Samsung Semiconductor, Inc.(三星半导体公司)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 AMMA是一种面向低延迟1M上下文注意力服务的多芯片片内存架构,通过提高内存带宽和优化并行计算方案,显著降低注意力延迟和能耗。
从技能文本到技能结构:面向智能体技能的调度-结构-逻辑表示
机构 * Key Laboratory of Computational Linguistics, Ministry of Education, Peking University(计算语言学重点实验室,教育部,北京大学) ; School of Computer Science, Peking University(北京大学计算机学院) ; Department of Chinese Language and Literature, Peking University(北京大学中文语言文学系)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文提出调度-结构-逻辑(SSL)表示法,通过解耦技能调度信号、执行结构和逻辑证据,提升智能体技能的可搜索性和可审查性,实验表明其在技能发现和风险评估任务中优于纯文本基线。
Comments 21 pages, 1 figure
语言模型通过符号反思和模块化优化改进机械连杆设计
机构 * Idiap Research Institute(Idiap研究 institute) ; Honda Research Institute Europe(本田欧洲研究机构) ; Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系) ; National Biomarker Centre, CRUK-MI, University of Manchester(曼彻斯特大学国家生物标记中心)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出语言模型通过符号表示和模块化优化改进机械连杆设计,显著降低几何误差并提高结构有效性,展示出符号抽象在工程设计中的应用价值。
连接价值与行为:一种面向主动具身代理的分层框架
机构 * State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; School of Computer Science, Peking University(北京大学计算机学院) ; Tsinghua University(清华大学) ; Nat’l Eng. Research Center of Visual Technology, Peking University(北京大学视觉技术国家工程研究中心) ; Institute for AI, Peking University(北京大学人工智能研究院) ; State Key Laboratory of General Artificial Intelligence, Peking University(通用人工智能国家重点实验室,北京大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出ValuePlanner框架,通过分层认知架构分离高阶价值调度与低阶行动执行,结合LLM生成符号子目标并用PDDL规划器转化为行动计划,通过反馈机制提升自主性,实验表明其能生成连贯的长期自主行为。
METASYMBO: 多智能体语言引导的超材料发现 via 符号驱动的潜在进化
机构 * Virginia Tech(弗吉尼亚理工大学) ; Meta AI ; University of California Los Angeles(加州大学洛杉矶分校) ; Princeton University(普林斯顿大学) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出MetaSymbO框架,通过符号驱动的潜在进化实现语言引导的超材料发现,提升结构有效性和语言指导得分,验证其在实际应用中的有效性。
机器群体智能用于可解释的科学发现
机构 * Korea Research Institute of Chemical Technology(韩国化学技术研究院) ; Korea Advanced Institute of Science and Technology(韩国科学技术院)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出机器群体智能,结合符号主义与元启发式方法,实现自主进化发现 governing equations,无需人工知识,显著降低 extrapolation error。
代理编译:缓解LLM重跑危机以实现最小化推理成本的网络自动化
机构 * Selfotix
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文提出编译与执行架构,通过分离LLM推理与浏览器执行,将每项工作流的推理成本降至0.1美元以下,实现零样本编译成功率80-94%,并证明确定性编译可经济可行地实现大规模自动化。
Comments 12 pages, 4 figures, 2 tables. v2: Expanded literature review and clarified architecture limitations
基于团队连接通信约束的多智能体路径规划:通过自适应路径扩展和动态领导技术
机构 * George Mason University(乔治·马歇尔大学)
专题命中 逻辑推理 :planning(abstract);分类 cs.AI
AI总结 本文提出了一种新的多智能体路径规划框架,解决在团队连接通信约束下路径规划的问题。通过自适应路径扩展和动态领导技术,有效处理通信约束下的路径规划,实验证明在不同环境中能高效处理大量智能体。
Journal ref Journal of Artificial Intelligence Research, 85(46) (2026)
关于AI回答问题的认知反思:监视、博学、逻辑学家、对话者
机构 * The Hong Kong Polytechnic University(香港理工大学) ; Eindhoven University of Technology (TU/e)(埃因霍温理工大学)
专题命中 逻辑推理 :reasoning(abstract);分类 cs.AI
AI总结 本文探讨AI在金融、法律等领域被广泛依赖的问题,指出其缺乏逻辑验证和实证验证,可能导致误判和剽窃。提出需了解推理系统以使AI成为可信的对话伙伴。
Comments 22 pages, 1 figure
无法能力的逻辑
专题命中 逻辑推理 :reasoning(abstract)
AI总结 本文提出一种扩展的联盟逻辑,引入明确的无法能力算子,用于研究能力的模态概念,证明了其正确性、完备性和保守性,并分析了其模态行为。
Comments Preliminary draft, comments and feedback are welcome
PPA-Plan: 长上下文LLM推理中的前瞻性坑洞避免规划
机构 * Hanyang University(翰阳大学) ; University of California, Santa Barbara(加州大学圣芭芭拉分校)
专题命中 规划推理 :reasoning(title,abstract);planning(title,abstract);分类 cs.CL
AI总结 针对长上下文推理中计划生成不可靠的问题,PPA-Plan通过前瞻性策略预防逻辑错误,提升计划执行效果。
Comments Accepted to the Main Conference of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026). 27 pages, 6 figures
PRTS:通过对比表示实现的原始推理与任务系统
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
专题命中 规划推理 :reasoning(title,abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 PRTS通过目标引导强化学习重构预训练过程,学习统一嵌入空间以评估物理可行性,提升机器人任务执行与长期规划能力。
Comments 38 pages, 12 figures
受世界模型启发的大型语言模型代理 sarcasm 推理
机构 * Faculty of Business and Commerce, Kansai University(大阪 kansai 大学 商业与文理学院) ; Faculty of Medicine, The University of Tokyo(东京大学 医学部)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.CL
AI总结 本文提出 WM-SAR 模型,通过分解语义不一致性和意图进行 sarcasm 推理,实现高可解释性和性能提升。
具备主动感知的机器人规划与情境处理
机构 * SUNY Binghamton(纽约州立大学布法罗分校) ; CMU(卡内基梅隆大学) ; Ford Research(福特研究) ; Agility Robotics(敏捷机器人)
专题命中 规划推理 :planning(title,abstract);reasoning(abstract)
AI总结 本文提出VAP-TAMP框架,通过主动感知和情境评估提升机器人在动态环境中执行任务的能力,结合场景图进行任务与运动规划,通过仿真和移动机械臂平台验证有效性。
知识规划领域定义语言:官方指南
机构 * Free University of Bozen-Bolzano(博尔扎诺自由大学) ; University of Oxford(牛津大学)
专题命中 规划推理 :planning(title,abstract);分类 cs.AI
AI总结 本文提出EPDDL语言,通过抽象事件模型统一描述知识规划任务,解决现有规划器碎片化问题,提升可比性与可重复性。
AID: 从扩散模型中获取代理意图用于多代理信息路径规划
机构 * Department of Mechanical Engineering, National University of Singapore(新加坡国立大学机械工程系)
专题命中 规划推理 :planning(title,abstract)
AI总结 本文提出AID框架,利用扩散模型生成非自回归长时轨迹,通过行为克隆和强化学习优化,提升多代理信息路径规划效率与信息获取能力。
视觉提示对视觉语言模型合作行为的影响
机构 * ST Engineering, Singapore(1 ST工程,新加坡)
专题命中 规划推理 :CoT(abstract,abstract_cn);reasoning(abstract);分类 cs.AI
AI总结 本文研究了视觉提示如何影响视觉语言模型在囚徒困境中的合作行为,通过图像内容和颜色奖励矩阵实验,发现图像内容和颜色提示对模型决策模式有影响,不同模型的敏感性和缓解效果各异。
异质科学基础模型协作
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出Eywa框架,通过将语言模型与领域特定基础模型结合,提升科学领域多模态任务的推理能力,实验显示其在结构化数据任务中表现更优。
Comments Preprint. 57 Pages
CastFlow:学习用于时间序列预测的角色专用代理工作流
机构 * State Key Laboratory of Cognitive Intelligence, University of Science and Technology of China(认知智能国家重点实验室,中国科学技术大学)
专题命中 规划推理 :reasoning(abstract);planning(abstract);分类 cs.AI、cs.LG
AI总结 CastFlow通过动态代理框架实现多视角时间模式提取和多轮上下文特征获取,提升时间序列预测的准确性和适应性。
在大型语言模型中什么抑制了纳什均衡行为?机制证据和因果控制
机构 * DreamWorks Animation(梦工厂动画) ; University of Crete(希腊克里特大学)
专题命中 规划推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG
AI总结 研究通过实验揭示大型语言模型在战略决策中抑制纳什均衡的行为机制,发现模型在早期层面对对手历史编码精确,但纳什行动编码较弱,且通过后期层的亲社会覆盖抑制纳什行为。
Comments 11 pages, 5 figures, 4 tables
RosettaSearch:蛋白质序列设计的多目标推理时间搜索
机构 * AI for Good, Microsoft Redmond(微软红mond AI for Good) ; Google DeepMind(谷歌DeepMind) ; Google Research(谷歌研究) ; Institute for Protein Design University of Washington(蛋白质设计研究所华盛顿大学) ; Microsoft Research New England(微软新英格兰研究) ; Department of Biochemistry Institute for Protein Design University of Washington(生物化学系蛋白质设计研究所华盛顿大学)
专题命中 规划推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 RosettaSearch通过大语言模型作为生成优化器,在受控探索与利用中改进蛋白质序列设计,实现结构保真度提升2.5倍,适用于多种LLM家族和独立结构预测 oracle。
理解视觉语言模型在自动驾驶中的对抗转移性:跨架构分析
机构 * School of Computing, Clemson University, USA(克莱姆森大学计算机学院)
专题命中 规划推理 :reasoning(abstract);分类 cs.LG
AI总结 本文通过跨架构研究探讨视觉语言模型在自动驾驶中的对抗转移性,评估了三种架构在不同场景下的对抗效果,发现高跨架构有效性。
Comments 9 pages, 2 figures. Accepted at SAE WCX 2026
Journal ref SAE Technical Paper 2026-01-0170, SAE WCX 2026