arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-24 至 2026-07-24 共收录 37 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 37 篇

2607.20520 2026-07-24 cs.AI cs.HC cs.PL 新提交 91%

Representation Robustness Under Executable Reasoning Constraints in Large Language Models for Mathematical Problem Solving

数学问题解决中大型语言模型在可执行推理约束下的表示鲁棒性

Sagnik Nath, Edith Aurora Graf, Liang Zhang, Diego Zapata-Rivera

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 研究大型语言模型在数学问题解决中表示鲁棒性,通过改变问题表面表示评估五个模型,发现其对表示敏感,代码增强未统一提升鲁棒性,揭示了正确性等方面新权衡,强调表示应作为接口设计变量。

Comments presented at the 28th International Conference on Human-Computer Interaction (2026), Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08825 2026-07-24 cs.CL cs.IR 90%

Search-on-Graph: Iterative Informed Navigation for Large Language Model Reasoning on Knowledge Graphs

图上搜索:面向知识图谱的大语言模型推理的迭代式知情导航

Jia Ao Sun, Hao Yu, Fabrizio Gotti, Fengran Mo, Yihong Wu, Yuchen Hui, Zhan Su, Lingfeng Xiao, Jian-Yun Nie

机构 * Université de Montréal(蒙特利尔大学) McGill University(麦吉尔大学) Digital Media, CBC(数字媒体,CBC) Halmstad University College(哈姆斯塔德大学学院) University of Waterloo(滑铁卢大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 提出Search-on-Graph方法,通过让大语言模型自身基于知识图谱结构和完整推理历史选择关系路径,遵循观察-思考-导航范式,在六个KGQA基准上超越现有方法,无需任务特定微调。

Comments Accepted to KDD '26 (32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21187 2026-07-24 cs.LO cs.AI cs.SC 新提交 90%

Case study: proving sqrt(2) irrational with LPTP and an LLM

案例研究:使用LPTP和大语言模型证明√2是无理数

Fred Mesnard, Étienne Payet, Wim Vanhoof

专题命中 推理与问题求解 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究在逻辑编程环境下,从基本谓词定义出发,借助LPTP系统,简述√2无理数的证明并与LLM交互,最终获得由LLM部分生成、LPTP完全验证的完整形式证明。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 67-80

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21090 2026-07-24 cs.LG cs.AI cs.CL 新提交 89%

Training Large Language Models for Self-Explanation Faithfulness

训练用于自解释忠实性的大语言模型

Yeoktatt Cheah, María Pérez-Ortiz, Noah Y. Siegel, Oana-Maria Camburu

机构 * Imperial College London(帝国理工学院)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract);prompting(abstract)

AI总结 提出强化学习方法,将忠实性度量改为训练目标,研究模型能否检测及优化影响决策因素以提高自解释忠实性。实验用随机词和用户偏差插入,微调模型在忠实性度量上显著改进,交叉干预泛化有模型依赖等情况,为减少不忠实推理提供路径。

Comments To appear at the ICLR 2026 Workshop on Representational Alignment (Re-Align), 10 pages (long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21196 2026-07-24 cs.LO cs.AI 新提交 89%

Case study: solving P-99 with LPTP and an LLM

案例研究:使用LPTP和语言模型解决P-99问题

Fred Mesnard, Thierry Marianne, Étienne Payet, Wim Vanhoof

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 该研究以九十九个Prolog问题(P-99)为对象,借助向语言模型Claude提问,生成Prolog代码及测试文件,再用LPTP进行验证,完成了前三十三个问题的解决,介绍了具体过程与细节,为他人重现实验提供便利。

Comments In Proceedings ICLP 2026, arXiv:2607.17707

Journal ref EPTCS 450, 2026, pp. 209-222

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04019 2026-07-24 cs.LG cs.AI cs.CL 版本更新 88%

Simple Policy Gradients for Reasoning with Diffusion Language Models

为扩散语言模型进行推理的简单策略梯度

Anthony Zhan

机构 * Stanford University(斯坦福大学)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract_cn);large language model(abstract);post-training(abstract)

AI总结 本文提出 AGRPO 算法,通过优化 dLLM 的去噪步骤提升推理性能,实现多个任务上的显著增益。

Comments 19 pages. ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21085 2026-07-24 cs.CV 新提交 88%

Geo3R: Mitigating Spatial Reasoning Hallucination in Multimodal Large Language Models

Geo3R:减轻多模态大语言模型中的空间推理幻觉

Mingyu Wang, Weilin Jin, Wenbo Li, Haoyang Huang, Tong Jia, Ying Li

机构 * Peking University(北京大学) Joy Future Academy(京东探索研究院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 多模态大语言模型推理空间关系易产生幻觉,现有方法效果有限。本文定义空间推理幻觉及常见场景,提出无训练的Geo3R框架,结合几何证据和结构化3D推理减轻幻觉,实验证明该框架显著减少幻觉,优于现有模型和方法。

Comments Accepted by ACM MM 2026. This is the arXiv preprint version, not the camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11936 2026-07-24 cs.AI 版本更新 87%

From Noise to Diversity: Random Embedding Injection in LLM Reasoning

从噪声到多样性:在LLM推理中的随机嵌入注入

Heejun Kim, Seungpil Lee, Jewon Yeom, Jaewon Sok, Seonghyeon Park, Jeongjae Park, Taesup Kim, Sundong Kim

机构 * Gwangju Institute of Science and Technology(光州科学技术学院) Seoul National University(首尔国立大学) Microsoft Research(微软研究院)

专题命中 推理与问题求解 :LLM(title,title_cn);分类 cs.AI

AI总结 本文研究了随机软提示(RSPs),通过在输入中添加随机嵌入向量提升推理性能,揭示了注入过程对生成多样性的影响,并在推理和训练中均取得显著效果。

Comments Under review, ICML 2026 Mechanistic Interpretability Workshop (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20638 2026-07-24 cs.AI cs.AR cs.CL 新提交 87%

WaveformQA: Benchmarking LLM Temporal Reasoning on Digital Waveforms

WaveformQA:对数字波形上的大语言模型时间推理进行基准测试

Yichuan Liu, Daniel Cummings, Nick Vadlamudi

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型对数字波形的时间推理能力,提出开源问答基准WaveformQA,含360个不同难度问题,波形由开源设计生成。评估发现模型在简单查询有准确率,但复杂问题上因窗口限制等性能下降,JSON表示可提高准确率,框架支持扩展实验。

Comments 10 pages; abridged version published in IEEE International Conference on LLM-Aided Design (ICLAD), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09999 2026-07-24 cs.CL cs.LG 版本更新 86%

Silent Failures in Quantized LLM Reasoning: A Taxonomy-Based Analysis of Hollow Convergence and Failure Mode Shifts

量化语言模型推理中的无声失败:基于分类法的空洞收敛和失败模式转移分析

Renuka Oladri, Mohan Vamsi Varadaraju Priya, Jerry Wu

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究量化大语言模型推理中的无声失败,用六类失败分类法对五个模型在三种精度和四个基准下的思维链输出分类,发现空洞收敛等问题有精度和基准依赖性,且无法从文本特征可靠检测,揭示了标准评估管道未捕捉到的失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20500 2026-07-24 cs.AI 新提交 85%

FlowEdit: Information-Theoretic Control of LLM Reasoning Flows for Ill-posed Problems Involving Conflicts

FlowEdit:针对涉及冲突的不适定问题的大语言模型推理流的信息论控制

Sizhe Tang, Guangyu Jiang, Yu Li, Rongqian Chen, Ioannis G. Kevrekidis, Tian Lan

机构 * The George Washington University(乔治·华盛顿大学) Johns Hopkins University(约翰·霍普金斯大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究针对开放世界中因条件冲突等导致的不适定问题,提出FlowEdit框架利用信息论原理控制大语言模型推理流,能生成多样替代响应,实验证明其优于专有模型,提升了准确率和响应信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14502 2026-07-24 cs.AI 版本更新 84%

From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI

从聊天机器人到数字同事:向持久自主人工智能的范式转变

Yongheng Zhang, Ziang Liu, Jiaxuan Zhu, Shuai Wang, Xiangqi Chen, Haojing Huang, Jiayi Kuang, Siyu Chen, Ao Shen, Hao Wu, Qiufeng Wang, Qian-Wen Zhang, Junnan Dong, Wenhao Jiang, Ying Shen, Hai-Tao Zheng, Yinghui Li, Di Yin, Xing Sun, Philip S. Yu

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LLM从聊天机器人向数字同事的范式转变,通过认知核心(思考型LLM)和工具增强任务执行(OpenClaw工作站系统)两个维度,实现持久工作、状态持久化、可重用技能和自改进能力。

Comments The paper is available on the project website: https://from-chatbot-to-digital-colleague.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21306 2026-07-24 cs.LG cs.AI cs.CL cs.CY cs.HC 新提交 83%

AI Assistants Overassist

人工智能助手过度协助

Verona Teo, Raghav Jain, Tobias Gerstenberg, Max Kleiman-Weiner

机构 * Stanford University(斯坦福大学) University of California, San Diego(加利福尼亚大学圣地亚哥分校) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨大语言模型作导师时,其干预方式对学习的影响。介绍Int-Bench基准,模拟学生解题、教师决定干预。在多领域评估大语言模型教师干预情况,并与人类对比,发现其干预频繁且倾向提供完整方案,表明为短期成功而非深层学习优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21558 2026-07-24 cs.AI 新提交 83%

Beyond Sycophancy: Structured Resistance and Compliance in LLM Moral Reasoning

超越谄媚:大语言模型道德推理中的结构化抵抗与顺从

Baihui Wang, Bernard Koch

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型道德推理中超越谄媚的结构化抵抗与顺从,通过三项研究揭示其判断修正沿与人类社会心理学现象平行的三个维度结构化,为区分建设性信念修正与谄媚顺从提供原则基础,助力道德交互更好对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21550 2026-07-24 cs.LG 新提交 83%

X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment

X³-OPD:通过策略对齐将推理能力提炼到大型音频-语言模型中

Dongjie Fu, Di Cao, Xize Cheng, Zihan Zhang, Wenxu Jia, Yifu Chen, Shengpeng Ji, Yu Zhang, Tao Jin

机构 * Tencent Hunyuan(腾讯混元) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 针对大型音频-语言模型逻辑推理能力不足,提出X³-OPD跨模态策略蒸馏框架,借助教师模型指导与构建的三层对称语料库训练学生模型,实验证明该方法能提升音频推理及思维链质量,还能保留模型域转移下的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23146 2026-07-24 q-bio.QM 版本更新 82%

Lightweight Language Models are Prone to Reasoning Errors for Complex Computational Phenotyping Tasks

轻量语言模型在复杂计算表型任务中易出现推理错误

Sarah Pungitore, Shashank Yadav, David Maughan, Vignesh Subbian

专题命中 推理与问题求解 :language model(title);LLM(abstract,abstract_cn)

AI总结 研究探讨了轻量语言模型在复杂计算表型任务中的推理错误问题,通过扩展PHEONA框架评估了不同模型的推理准确性,并发现轻量推理模型在提示修改后表现显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20425 2026-07-24 cs.CL 新提交 79%

What is Good? Extracting and Testing Implicit Theories of Literary Quality from LLM Reasoning Traces

什么是好的?从大语言模型推理痕迹中提取并测试文学质量的隐含理论

Birger Moëll

机构 * Uppsala University(乌普萨拉大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.CL

AI总结 研究通过构建含30篇文本的基准从大语言模型推理痕迹提取文学质量隐含理论,经五次复制实验得模型判断写作质量的相关结论;还通过对经典散文段落退化探究该理论,发现其判断整体、作者特定且对结构更敏感,对相关领域有启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21552 2026-07-24 cs.AI cs.LG 新提交 79%

MIRROR: Learning from the Other View for Multi-Modal Reasoning

MIRROR:从其他视角学习以进行多模态推理

Wen Ye, Yuxiao Qu, Aviral Kumar, Xuezhe Ma

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型在几何问题多模态推理上的不足,构建ODA-Data数据集,提出模态感知互惠推理优化(MIRROR)方法,通过强化学习自我监督,提升多模态推理能力,在相关基准测试中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21036 2026-07-24 cs.CV 新提交 78%

GeoThreat: Transferable Targeted Adversarial Attacks on Large Vision-Language Models for Remote Sensing Image Interpretation

GeoThreat:用于遥感图像解释的大型视觉语言模型的可转移目标对抗攻击

Yimin Fu, Yuefeng Bai, Baicheng Pan, Zhunga Liu, Michael K. Ng

机构 * Department of Mathematics, Hong Kong Baptist University(香港浸会大学数学系) School of Automation, Northwestern Polytechnical University(西北工业大学自动化学院)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 研究针对大型视觉语言模型在遥感图像解释中的对抗攻击问题,提出GeoThreat方法,通过在概念和感知层面调制对抗表示,结合对抗目标相似性梯度等技术,实现可转移目标对抗攻击,实验证明该方法在可转移性和可控性上具有优越性。

Comments The code will be released at https://github.com/fuyimin96/GeoThreat upon acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07075 2026-07-24 physics.chem-ph cs.AI cs.CL cs.LG 75%

LatentChem: From Textual CoT to Latent Thinking in Chemical Reasoning

LatentChem: 从文本思维链到化学推理中的潜在思考

Xinwu Ye, Yicheng Mao, Yuxuan Liao, Jia Zhang, Yimeng Liu, Li Hao, Fang Wu, Zhiwei Li, Zehong Wang, Zhiyuan Liu, Zhenfei Yin, Li Yuan, Philip Torr, Huan Sun, xiangxiang Zeng, Mengdi Wang, Le Cong, Shenghua Gao, Xiangru Tang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对化学大语言模型依赖显式思维链导致的模态不匹配问题,提出LatentChem推理接口,通过连续思维向量和动态感知解耦化学逻辑与语言生成,在ChemCoTBench上以59.88%非平局胜率超越强CoT基线,并实现平均10.84倍推理步骤开销降低(5.96倍实际加速)。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20543 2026-07-24 cs.LG cs.AI 新提交 73%

When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion

当可验证奖励的强化学习缩小推理边界时:诊断Pass@k反转

Todd Zhou

机构 * Harvard University(哈佛大学)

专题命中 推理与问题求解 :post-training(abstract);language agent(abstract);分类 cs.AI、cs.LG

AI总结 研究RLVR中的Pass@k反转问题,提出双模式解释和PBA方法,通过实验表明PBA能提升\PassK{1}和覆盖率,诊断出普通GRPO丢失基础可解决提示,而PBA保留罕见阳性轨迹,强调训练后推理要兼顾优化强度与提示安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20440 2026-07-24 cs.CL cs.AI 新提交 73%

Answer-then-Edit: Reasoning Skeleton Editing for Anti-Distillation with Preserved Utility

先回答再编辑:用于保留效用的反蒸馏的推理骨架编辑

Fan Li, Mengting Pan, Sijia Xu, Xiaoyang Wang, Chen Chen, Wenjie Zhang

机构 * School of Computer Science and Engineering, UNSW Sydney(新南威尔士大学计算机科学与工程学院) School of Artificial Intelligence, Shenzhen University(深圳大学人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对专有大语言模型易受知识蒸馏影响的问题,提出骨架引导推理编辑框架SGRE,通过先回答再编辑的方式,借鉴认知负荷理论对推理痕迹进行修改,在降低蒸馏效果的同时保持推理准确性和痕迹自然度。

Comments 21 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20982 2026-07-24 cs.AI 新提交 70%

GuardianAgentBench: Where Agents Fail and How to Guard Them

GuardianAgentBench:智能体何处失败及如何防范

Vishal Ishwar Naik, Chenyu Xu, Donna Dong, Hussein Hassan, Abhishek Pradhan, Ofer Mendelevitch, Tallat Shafat, Humayun Irshad

机构 * Vectara, Inc.(Vectara公司) Anthropic(Anthropic公司) OpenAI(OpenAI公司) Google DeepMind(谷歌DeepMind) DeepSeek-AI(DeepSeek人工智能公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究大语言模型智能体安全可靠行为问题,提出GuardianAgentBench基准测试,含多阶段验证和攻击模式。实验发现模型有两种失败模式,性能随工具集和轮次深度下降。护栏实现优于系统提示防御,证明执行时结构干预可提升安全性且不影响正确行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20517 2026-07-24 cs.LG 新提交 70%

Multimodal CoLRAG-TF: Triple-Filtered Retrieval for Complex PDFs

多模态CoLRAG-TF:复杂PDF的三重过滤检索

Takato Yasuno

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究针对异构PDF集合检索增强生成的挑战,提出多模态CoLRAG-TF四轴融合架构,集成多种技术。构建多模态索引,经贝叶斯优化确定融合权重。实验显示其检索召回率高,多跳答案相似性提升显著,还适用于视觉输入,提供通用框架。

Comments 18 pages, 8 tables, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20506 2026-07-24 cs.AI 新提交 70%

Optimizing Hypergraph-Based RAG: Toward Better Fact Extraction and Chunk Retrieval

优化基于超图的RAG:迈向更好的事实提取和块检索

Houda Khrouf, Pedro Fillastre, Sebastiao Correia

机构 * Qlik(思略特)

专题命中 推理与问题求解 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 研究旨在优化基于超图的RAG,以解决事实提取和块检索问题。方法是采用自一致性提示改进提取,运用个性化PageRank算法增强块检索,贡献在于提升了相关任务的性能。

Comments APIA 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01437 2026-07-24 cs.AI 版本更新 70%

Post-Hoc Reasoning in Chain of Thought: Decoding and Steering Pre-Committed Answers

在生成链式推理前解码答案:来自预CoT探测器和激活引导的证据

Kyle Cox, Darius Kianersi, Adrià Garriga-Alonso

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究发现,模型在生成链式推理前已确定答案,通过激活引导实验揭示了预CoT过程中的因果关系及潜在错误模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20990 2026-07-24 cs.ET 新提交 67%

LivePhys: Transforming Static Physics Problems into Interactive Simulations via a Scan-to-Play Framework

LivePhys:通过扫描即播放框架将静态物理问题转化为交互式模拟

Xiaowei Dai, Ziyu Luo, Xiangwen Zhang, Xiaoming Chen, Juan Wu, Yonghong Ke

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 研究针对教科书中静态物理问题学习的高认知负担,提出LivePhys框架,通过多模态处理构建中间表示,用大语言模型推理并由物理引擎执行生成交互式模拟,显著提升模拟性能并降低学习者认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20503 2026-07-24 cs.AI cs.LG cs.LO 新提交 62%

LeanFlow: A Case Study in Workflow-Driven Lean Autoformalization

LeanFlow:工作流驱动的精益自动形式化案例研究

Lazar Milikic, Simon Guilloud, Khanh Nguyen, Viktor Kuncak

机构 * Moonshot AI(月球计划人工智能公司) epfl-lara(洛桑联邦理工学院拉腊实验室)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究通过对两篇数学论文案例研究,探讨文档到项目形式化中运行时机制对相关指标的影响,使用Kimi2.6和GPT5.5进行消融实验,报告多项数据,展示LeanFlow在特定任务上的表现及校准成果。

Comments 14 pages, 3 figures, ICML 2026: AI for Math Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21401 2026-07-24 cs.CV cs.AI 新提交 57%

When Are Reasoning-Based Guardrails Not Efficient? ResponseGuard: A Fast Vision-Language Guard for Real-Time Moderation

基于推理的防护栏何时效率不高?ResponseGuard:用于实时审核的快速视觉语言防护工具

Dongbin Na

机构 * POSTECH(浦项科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 研究视觉语言防护栏筛查回复是否需推理,提出无链式推理的ResponseGuard,通过对请求、回复和图像的单一合并表示一次前向传递读取有害裁决,在回复有害性检测上优于基于推理的防护栏,且时间成本低,还发现了差距原因及推理防护栏注意力问题。

Comments 8 pages, 6 figures, 3 tables. Project page: https://ndb796.github.io/ResponseGuard ; Code: https://github.com/ndb796/ResponseGuard

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21268 2026-07-24 cs.MA cs.AI econ.GN q-fin.EC 新提交 57%

pAI-Econ-claude: A Gated Human-in-the-Loop Multi-Agent Architecture for AI-Assisted Economic Theory Development

pAI-Econ-claude:用于人工智能辅助经济理论发展的门控人在回路多智能体架构

Chen Zhu, Xiaolu Wang, Weilong Zhang

机构 * China Agricultural University(中国农业大学) University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 研究针对经济学等领域中基于大语言模型智能体输出缺乏正确性信号的可靠性问题,提出pAI-Econ-claude门控人在回路多智能体架构,经实验评估,该架构能提高可审计性,证明不可逆人类判断分配比纯智能体自主性更具信息性。

详情

展开后加载摘要…

URL PDF HTML 收藏