Heterogeneous LLM Debate Under Adversarial Peers: Honest Gains, Replacement Costs, and Resilience
对抗性同伴下的异构LLM辩论:诚实增益、替代成本与韧性
专题命中 数学推理 :reasoning(abstract)
AI总结 研究异构LLM辩论中诚实与对抗性同伴对修正行为的影响,发现诚实同伴降低有害修正率,对抗性同伴则逆转,且异构性在已有对手时也能作为防御。
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
对抗性同伴下的异构LLM辩论:诚实增益、替代成本与韧性
专题命中 数学推理 :reasoning(abstract)
AI总结 研究异构LLM辩论中诚实与对抗性同伴对修正行为的影响,发现诚实同伴降低有害修正率,对抗性同伴则逆转,且异构性在已有对手时也能作为防御。
通过数学多模态模型识别非厄密系统拓扑不变量
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出利用多模态模型识别非厄密系统拓扑不变量,通过输入哈密顿量的本征值和本征向量,结合数学大语言模型进行复杂计算和推理,有效提取拓扑信息。
朴素和非承诺的复杂代理的通用停止行为,及其在概率扭曲中的应用
专题命中 数学推理 :reasoning(abstract)
AI总结 本文研究了在时间不一致的收益函数下停止扩散过程的问题,分析了朴素代理的连续再优化决策和复杂代理的均衡策略,并探讨了概率扭曲对停止策略的影响。
Journal ref Mathematical Finance, Vol. 30 (2020), Issue 1, pp 310-340
辅导效果指数:从四个对话信号预测LLM数学辅导质量
专题命中 数学推理 :reasoning(abstract)
AI总结 提出无需训练和外部评判的辅导效果指数(TEI),通过四个内部推理信号选择冻结模型,将预错误场景的改进率从59.0%提升至81.9%。
分歧的思维,趋同的基线:LLM与人类战略行为的有界理性解释
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出有界理性框架,将人类与LLM在战略博弈中的行为差异归因于计算约束的不同,并给出四个操作测试来区分两者的偏差项δ。
Comments 12 pages, 1 table, no figures. Theoretical prequel paper
基于视觉优势的在线策略蒸馏用于视觉-语言模型
机构 * Institute of Automation, CAS(中国科学院自动化研究所) ; School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学(UCAS)先进交叉学科学院) ; Hello Group Inc.(Hello集团有限公司) ; Sun Yat-sen University(中山大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出了一种基于视觉优势的在线策略蒸馏方法,用于提升视觉-语言模型对视觉输入的依赖性,通过引入视觉优势指标来区分关键视觉token与语言token,从而提高蒸馏效果。
测试时提示法用于黑盒视觉-语言模型
机构 * AlaaLab(Alaa实验室)
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出测试时提示法,通过单次VLM调用提升性能,无需开放权重模型访问,适用于前沿闭源模型。方法通过轻量提示生成器预测提示,引导VLM避开常见错误模式,提升自然图像VQA基准的准确率。
评估、利用和缓解基于LLM的代码生成中的语法鲁棒性故障
专题命中 数学推理 :reasoning(abstract)
AI总结 研究评估LLM在代码生成中语法鲁棒性,发现其在包含数学公式的提示下存在缺陷,提出预处理步骤提升鲁棒性,使鲁棒性从54.05%提升至74.42%。
Comments 12 pages, 12 figures. Attack strategies and more experimental evaluation is added. Result and big picture remains the same
Journal ref In Proceedings of the 2026 IEEE/ACM Third International Conference on AI Foundation Models and Software Engineering (FORGE'26), April 12-13, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 12 pages
MathFlow: 提升多模态大语言模型在视觉数学问题中的感知流
机构 * Zhejiang University(浙江大学) ; Intelligent Learning(智能学习) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出MathFlow框架,通过分离感知与推理阶段,提升多模态大语言模型在视觉数学问题中的表现,实验表明其在不同推理模型中均有效。
Comments Accepted by ACL 2026 Main Conference
Sci-Mind:基于认知的对抗辩论用于自主数学建模
专题命中 数学推理 :reasoning(abstract)
AI总结 Sci-Mind通过模仿人类科学发现过程,结合经验记忆回溯和对抗性认知辩证,提升自主数学建模的严谨性和代码可执行性。
在动态城市系统中发现支配的空间交互机制
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出统一微分方程形式,分解城市动态为时间不变的空间交互过程和自动态部分,通过U-Discovery框架整合假设生成、神经拟合和方程识别,发现支配空间交互规律。
Penguin-VL:探索基于大语言模型的视觉编码器的效率极限
机构 * Tencent AI Lab(腾讯AI实验室)
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出Penguin-VL,通过基于大语言模型的视觉编码器替代传统对比预训练,实现更高效的多模态理解,在文档理解、视觉知识和多视角视频理解等任务中超越现有领先VLM。
Comments Penguin-VL demonstrates that text-only initialized vision encoders can achieve superior performance in multimodal understanding tasks; Code: https://github.com/tencent-ailab/Penguin-VL
CovertComBench: 一个用于无线隐蔽通信中LLM的首个领域特定测试平台
专题命中 数学推理 :reasoning(abstract)
AI总结 CovertComBench是首个用于评估LLM在无线隐蔽通信中安全约束优化能力的领域特定测试平台,揭示了LLM在高阶数学推导上的不足,强调需通过外部工具增强构建可信无线AI系统。
Comments 6 pages, corrected a typo: "DeepSeek-R1:70B" was previously incorrectly written as "DeepSeek-V3.2:70B"
行为生成代理在电力调度和拍卖中的应用
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出利用生成代理在电力调度和拍卖中模拟人类决策,通过上下文学习模块提升LLM的决策灵活性和经济理性。
学习快速与缓慢思考以提升视觉语言模型
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Institute of Automation, CAS(中国科学院自动化研究所) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
专题命中 数学推理 :reasoning(abstract)
AI总结 DualMindVLM通过双模式思考机制提升视觉语言模型的推理效率和性能。
超越零散接受:通过最长稳定前缀实现DLMs的快速且一致推理
机构 * Alibaba Group(阿里巴巴集团) ; Tsinghua University(清华大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 通过最长稳定前缀调度器,提升DLMs推理速度3.4倍,同时保持输出质量。
Comments Accepted at ICLR 2026
具有Transformer和LLM生成公式性阿尔法的情感感知股价预测
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出一种结合Transformer和LLM的股价预测框架,利用LLM生成情感感知的公式性阿尔法以提升预测准确性并增强可解释性。
Comments This paper has been accepted by the journal Digital Finance
为拟合物体操纵的物理常识知识而引入分析概念
机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机学院) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出通过引入分析概念,将语义级常识知识接地到物理世界,以提升机器人对关节物体的通用精确操纵能力。
DeepEyes: 通过强化学习激励'图像思考'
机构 * Xiaohongshu Inc.(小红书公司) ; Xi’an Jiaotong University(西安交通大学)
专题命中 数学推理 :reasoning(abstract)
AI总结 DeepEyes通过强化学习实现图像引导的推理,无需预训练数据,提升多模态任务性能。
Comments Accepted by ICLR2026. Ziwei, Michael, Jack, and Chenxiao are equal-contribution. The list order is random
AgentConductor: 多智能体竞争级代码生成中的拓扑演化
专题命中 数学推理 :reasoning(abstract)
AI总结 AgentConductor通过动态拓扑生成和强化学习优化,提升多智能体系统在竞争级代码生成中的性能和效率。
Llama-Polya:基于波利亚问题解决框架的大型语言模型指令调优
专题命中 数学推理 :reasoning(abstract)
AI总结 Llama-Polya通过整合波利亚问题解决框架,提升大型语言模型在数学推理和教学对齐方面的能力。
数字行走的足迹:一种动态可视化任务,用于理解中学阶段的小数
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出一种动态可视化任务,通过生成小数的几何路径帮助中学学生理解小数结构和特性。
Comments in Spanish language
IVC-Prune: 在大型视觉-语言模型中揭示隐式的视觉坐标以进行视觉标记剪枝
机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) ; Xiaohongshu Inc(小红书公司)
专题命中 数学推理 :reasoning(abstract)
AI总结 IVC-Prune通过揭示LVLMs中隐式的视觉坐标,提出一种无训练、提示感知的视觉标记剪枝方法,有效减少标记数量并保持高性能。
Comments Accepted to ICLR 2026
多孔多边形环境中可见性研究:寻找最佳隐藏与监视位置
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出了一种归一化下降算法,用于在多孔多边形环境中寻找最优隐藏或监视位置,通过非光滑分析和随机性处理非凸度量问题,确保高概率收敛到局部极小值。
面向敏感性感知的语言模型
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出了一种方法,通过监督微调提升四比特量化LLMs的敏感性感知能力,使其在隐私保护方面表现更优,同时保持其他任务性能。
Comments 11 pages, 3 figures, 2 tables, AISTATS 2026; Project Page: https://drenfazlija.github.io/towards-sa-llms/
基于骨架化的对抗扰动在大视觉语言模型数学文本识别中的应用
机构 * Doshisha University Kyoto, 610-0394 Japan ; University of Brescia Brescia, 25134 Italy ; Independent Researcher Tokyo, Japan
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出基于骨架化的对抗扰动方法,用于评估大视觉语言模型在数学文本识别中的视觉能力和局限性,并通过ChatGPT验证其实际应用价值。
Comments accepted to ITC-CSCC 2025
Journal ref Proc. ITC-CSCC 2025
多智能体环境中基于大语言模型的动态策略适应
专题命中 数学推理 :reasoning(abstract)
AI总结 本文提出基于大语言模型和博弈论的动态策略适应框架,提升多智能体协作效率和灵活性。
大型语言模型能否正确解释有误的方程?
专题命中 数学推理 :reasoning(abstract)
AI总结 本文研究了大型语言模型在解析学生输入中存在错误的方程时的准确性,发现开源模型无法达到预期效果,并提出未来改进方向。
Comments Published in Physics Review Physics Education Research here: https://journals.aps.org/prper/abstract/10.1103/v8f8-s11v
Journal ref Phys. Rev. Phys. Educ. Res. 21, 020155 Published 15 December, 2025
专题命中 数学推理 :reasoning(abstract)
专题命中 数学推理 :reasoning(abstract)