arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 863 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 863 篇

2410.03882 2026-06-23 cs.HC 版本更新 75%

JumpStarter: Human-AI Planning with Task-Structured Context Curation

JumpStarter:基于任务结构化上下文策展的人机协作规划

Xuanming Zhang, Sitong Wang, Jenny Ma, Alyssa Hwang, Zhou Yu, Lydia B. Chilton

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出JumpStarter系统,通过任务结构化上下文策展框架动态分解目标、限定上下文范围,实现细粒度个性化与复用,用户研究显示规划质量显著优于ChatGPT。

Comments 29 pages, 20 Figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01444 2026-06-16 cs.AI cs.CL cs.LG 版本更新 75%

Dual-Uncertainty Guided Policy Learning for Multimodal Reasoning

双不确定性引导的多模态推理策略学习

Rui Liu, Dian Yu, Tong Zheng, Runpeng Dai, Zongxia Li, Wenhao Yu, Zhenwen Liang, Linfeng Song, Haitao Mi, Pratap Tokekar, Dong Yu

机构 * Tencent Hunyuan(腾讯文汇) University of Maryland(马里兰大学) University of North Carolina(北卡罗来纳大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DUPL方法,通过量化感知不确定性和输出不确定性来引导策略更新,在多个多模态推理基准上显著提升模型准确率,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10523 2026-06-16 cs.CV 版本更新 75%

Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies

计算机视觉中的推理:分类、模型、任务与方法论

Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris

机构 * Department of Computer Science and Engineering, Birbhum Institute of Engineering and Technology(计算机科学与工程系,比罗尔理工学院) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文对计算机视觉中的推理进行系统分类,涵盖关系、符号、时间、因果和常识推理,并综述了从图模型到多模态大语言模型的实现方法及评估协议,指出开放挑战并设定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19802 2026-06-16 cs.CR cs.IR 版本更新 75%

KnowML: Improving Generalization of ML-NIDS with Attack Knowledge Graphs

KnowML: 利用攻击知识图提升ML-NIDS的泛化能力

Xin Fan Guo, Xinran Zheng, Albert Merono Penuela, Lorenzo Cavallaro, Sergio Maffeis, Fabio Pierazzi

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn)

AI总结 提出KnowML框架,通过LLM构建攻击知识图并编码到特征空间,解决异常检测NIDS因特征空间缺陷导致的泛化问题,在仅用良性流量训练时实现高达99%检测率且误报率≤0.0137%。

Comments Accepted at EuroS&P 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05430 2026-06-12 cs.RO 版本更新 75%

Active Semantic Perception

主动语义感知

Huayi Tang, Pratik Chaudhari

机构 * General Robotics, Automation, Sensing and Perception (GRASP) Laboratory(通用机器人、自动化、传感与感知实验室)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种基于紧凑多层场景图和大语言模型的主动语义感知方法,用于高效探索未知环境,在仿真和真实机器人上验证了优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05922 2026-06-11 cs.AI cs.CL cs.LG 版本更新 75%

Evolving Agents in the Dark: Retrospective Harness Optimization via Self-Preference

回顾性工具优化:通过轨迹回滚上的自我偏好改进LLM智能体

Wenbo Pan, Shujie Liu, Chin-Yew Lin, Jingying Zeng, Xianfeng Tang, Xiangyang Zhou, Yan Lu, Xiaohua Jia

机构 * City University of Hong Kong(香港城市大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 推理与问题求解 :LLM(title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出一种自监督方法RHO,利用历史轨迹回滚和自偏好选择优化智能体工具集,无需真实标签,在SWE-Bench Pro上通过单轮优化将通过率从59%提升至78%。

Comments Code: https://github.com/wbopan/retro-harness ; Project website: https://paper-rho.wenbo.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11996 2026-08-05 cs.CL cs.AI 版本更新 74%

Filtered Reasoning Score: Evaluating Reasoning Quality on a Model's Most-Confident Traces

过滤推理得分:在模型最自信的轨迹上评估推理质量

Manas Pathak, Xingyao Chen, Shuozhe Li, Amy Zhang, Liu Leqi

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出过滤推理得分,用于评估模型推理质量,区分相似准确率的模型,并提高对输入提示和生成配置变化的鲁棒性。

Comments Accepted at the Conference on Language Modeling (COLM) 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28114 2026-08-05 cs.AI 版本更新 74%

Language model agents show in-group trust bias invisible to standard behavioural audits

指令调优语言模型代理中类似人类的内群体偏见

Messi H. J. Lee

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :language model(title);分类 cs.AI

AI总结 通过多代理模拟,发现指令调优语言模型在群体标签可见时表现出内群体信任偏见、行动同质性和网络同配性,且这种歧视在标准审计中不可见,但会累积为结构性不平等。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24268 2026-07-31 cs.CL 版本更新 74%

Accuracy Hides How Language Models Fail: Measuring Failure States Under Matched Output Budgets

准确性掩盖了语言模型的失败方式:在匹配输出预算下测量失败状态

Zongyou Yang, Yinghan Hou

专题命中 推理与问题求解 :language model(title);分类 cs.CL

AI总结 研究指出语言模型基准测试中准确性分数掩盖问题,引入两层评估框架分离执行证据与正确性。通过实验表明不同模型在匹配输出限制下执行组合不同,验证策略会影响准确性估计,强调评估应同时报告执行状态、覆盖范围和评分者来源。

Comments 7 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05183 2026-08-18 cs.CL cs.AI cs.HC 版本更新 73%

The Granularity Gap: A Multi-Dimensional Cross-Generational Audit of Sycophancy in Gemini Models

粒度差距:Gemini 模型中谄媚行为的多维纵向审计

Patrick Keough

机构 * Independent Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 通过多维度分级评估(Likert 0-4),揭示 Gemini 模型在连续尺度上的谄媚行为,发现粗粒度二值指标掩盖了大量社会顺从行为,且代际进步非单调,存在对齐税(谄媚与真实性负相关)。

Comments v2: Major correction. Three v1 claims withdrawn (U-shaped detection curve, recalibration remedy, one reliability figure); the central 29% result survives. Adds a four-judge panel over a stratified 1,200-response sample, 10,792 votes with written reasoning. Data unchanged from v1. 21 pages, 8 figures, 18 tables. Itemized changelog and code: https://github.com/pskeough/The-Granularity-Gap

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21137 2026-08-18 cs.CL cs.AI 版本更新 73%

Enhancing Science Classroom Discourse Analysis through Joint Multi-Task Learning for Reasoning-Component Classification

通过联合多任务学习增强科学课堂话语分析以进行推理组件分类

Jiho Noh, Mukhesh Raghava Katragadda, Raymond Carl, Soon Lee

机构 * Department of Computer Science, Kennesaw State University(肯纳邦大学计算机科学系) Bagwell College of Education, Kennesaw State University(肯纳邦大学巴格威尔教育学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出ADAS系统,通过联合多任务学习对教师和学生话语进行类型和推理组件分类,解决少数类标签不平衡问题,提升课堂话语分析效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18334 2026-08-18 cs.SE cs.AI cs.LG 版本更新 73%

Can LLMs Reason Like Automated Theorem Provers for Rust Verification? VCoT-Bench: Evaluating via Verification Chain of Thought

LLMs能否像自动定理证明器一样进行Rust验证?VCoT-Bench:通过验证思维链进行评估

Zichen Xie, Wenxi Wang

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出VCoT-Bench,通过验证思维链评估LLMs在Rust验证中的能力,揭示其在不同证明类型和缺失证明情况下的脆弱性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08837 2026-08-13 cs.LG cs.AI 版本更新 73%

Prompt-Driven Exploration

提示驱动的探索

Sunshine Jiang, John Marangola, David Zhang, Raghuram Kowdeed, Ruiyang Luo, Nitish Dashora, Richard Li, Pulkit Agrawal, Zhang-Wei Hong

机构 * Massachusetts Institute of Technology(麻省理工学院) MIT-IBM Computing Research Lab(麻省理工学院-IBM计算研究实验室) Improbable AI Lab(英普罗巴布尔人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中探索难的问题,提出提示驱动的探索策略(PDE),利用视觉-语言模型对轨迹视频推理,从弱策略轨迹中优化提示,实现后验采样,能让强化学习从零奖励起步学习成功策略并提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07801 2026-08-13 cs.CL cs.AI 版本更新 73%

TEMPER: Testing Emotional Perturbation in Quantitative Reasoning

TEMPER:量化推理中的情感扰动测试

Atahan Dokme, Benjamin Reichman, Larry Heck

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过构建TEMPER基准,研究情感框架对量化推理准确性的影响,发现情感扰动降低准确率2-10个百分点,但通过中性化可恢复性能,揭示情感风格影响而非内容腐败。

Comments Published as a conference paper at COLM 2026. 30 pages, 4 figures, 29 tables. Dataset: https://huggingface.co/datasets/atahandokme/temper-5400 Code: https://github.com/atahandokme/temper-colm2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16057 2026-08-12 cs.CL cs.AI 版本更新 73%

Frontier AI performance across the business disciplines: a case-grounded benchmark of knowledge work and analytical reasoning

跨商业学科的前沿人工智能性能:基于案例的知识工作和分析推理基准

Ajay Patel, Kartik Hosanagar, Ramayya Krishnan, Chris Callison-Burch, Karim Lakhani

机构 * The Wharton School, University of Pennsylvania(宾夕法尼亚大学沃顿商学院) Carnegie Mellon University(卡内基梅隆大学) Harvard Business School, Harvard University(哈佛大学哈佛商学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对人工智能在白领分析性知识工作衡量上的差距,利用顶尖商学院案例教学法构建BusinessCaseBench基准,发现前沿AI模型在此基准上得分高且能力提升快,为商学院及相关职业角色带来启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10453 2026-08-11 cs.CL cs.AI 版本更新 73%

Reasoning about Intent for Ambiguous Requests

意图推理以应对歧义请求

Irina Saparina, Mirella Lapata

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出生成结构化响应以枚举歧义请求的不同解释,通过强化学习训练模型提升覆盖有效解释的召回率和抑制虚假解释的精确率,实验表明方法在覆盖有效答案方面优于基线方法。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06465 2026-08-11 cs.CL cs.AI 版本更新 73%

Multi-objective Evolutionary Merging Enables Efficient Reasoning Models

多目标进化融合实现高效推理模型

Mario Iacobelli, Adrian Robert Minut, Tommaso Mencattini, Donato Crisostomi, Andrea Santilli, Iacopo Masi, Emanuele Rodolà

机构 * Sapienza University of Rome(罗马大学) Independent Researcher(独立研究员) EPFL(瑞士联邦理工学院洛桑) NVIDIA(英伟达)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Evo-L2S框架,通过多目标优化解决长到短推理问题,减少生成推理轨迹长度同时保持或提升推理准确性。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24210 2026-08-11 cs.CL cs.AI 版本更新 73%

From Leaky Thoughts to Private Reasoning: Controlling What LRMs Say to Themselves

从泄露思维到私有推理:控制LRM对自己说的话

Haritz Puerto, Haonan Li, Xudong Han, Timothy Baldwin, Iryna Gurevych

机构 * Mohamed bin Zayed University of Artificial Intelligence, UAE(穆罕默德·本·扎耶德人工智能大学,阿联酋)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对大型推理模型(LRM)推理过程中隐私泄露问题,提出通过指令跟随(IF)训练和分阶段解码策略(Staged Decoding)增强隐私保护,在IF和隐私基准上分别提升高达20.9和51.9个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14265 2026-08-07 cs.CL cs.LG 版本更新 73%

STATe-of-Thoughts: Structured Action Templates for Tree-of-Thoughts

STATe-of-Thoughts:用于树状思维的结构化动作模板

Zachary Bamberger, Till R. Saenger, Gilad Morad, Ofra Amir, Brandon M. Stewart, Amir Feder

机构 * Technion(以色列理工学院) Princeton University(普林斯顿大学) Independent(独立作者) Hebrew University(希伯来大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 STATe通过结构化动作模板提升文本生成的多样性和可控性,通过显式动作序列捕捉可解释特征,增强生成质量与可解释性。

Comments Accepted to COLM 2026. Version 3. 11 pages main, 85 pages total, 23 tables, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15669 2026-08-06 cs.LG cs.AI cs.RO 版本更新 73%

DeepThinkVLA: Enhancing Reasoning Capability of Vision-Language-Action Models

DeepThinkVLA: 提升视觉-语言-动作模型的推理能力

Cheng Yin, Yankai Lin, Wang Xu, Sikyuen Tam, Xiangrui Zeng, Zhiyuan Liu, Zhouping Yin

机构 * Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) Gaoling School of Artificial Intelligence, Renmin University of China, China(中国人民大学 Gallagher 人工智能学院) Beijing Zhongguancun Academy, China(北京中关村学院)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文通过系统实验发现,Co-T推理需满足解码对齐和因果对齐两个条件,提出DeepThinkVLA模型在LIBERO等任务中取得显著提升。

Comments 26 pages, 7 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新 73%

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07395 2026-07-29 cs.CV cs.AI cs.LG 版本更新 73%

When Prompts Ignore Structure: Graph-Based Attribute Reasoning for Calibrated VLMs

当提示忽略结构时:基于图的属性推理用于校准视觉语言模型

Tanay Sodha, Aditya Sharma, Ramya Hebbalaguppe, Vinti Agarwal, Pranav Murthy Yeluripaty

机构 * Birla Institute of Technology and Science, Pilani(贝拉科技与科学学院皮拉尼分校) TCS Research(塔塔咨询服务公司研究院)

专题命中 推理与问题求解 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型测试时自适应中可靠置信度估计问题,提出ARGTCA方法,将(类,属性)对表示为符号属性图节点,用对比目标训练图注意力网络,引入两种属性选择策略,实验证明该方法能有效降低校准误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20952 2026-07-28 cs.LG cs.CL 版本更新 73%

The Weight of Silence: A Causal Case for Weights Over the Scratchpad in Latent Chess Reasoning

沉默的权重:潜在国际象棋推理中权重优于暂存器的因果案例

Ishan S. Kshirsagar

专题命中 推理与问题求解 :language model(abstract);SFT(abstract);分类 cs.CL、cs.LG

AI总结 研究国际象棋模型潜在推理,通过分阶段潜在推理课程训练并强化学习,发现强化学习增加对干扰的鲁棒性而非依赖思维内容,反驳潜在思维是推理时暂存器的假设,表明其主要作用是塑造模型参数,还展示了强化学习在国际象棋领域的有效提升。

Comments 28 pages, 5 figures, preprint also available at Zenodo: https://zenodo.org/records/21619703 v2: added statistical significance testing on the n=1000 causal battery replication (Appendix A.8), added SVD-based weight-space rank analysis (Appendix A.11), corrected false-checkmate rate to reflect larger-sample data

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09239 2026-07-28 cs.CL cs.LG 版本更新 73%

Repeated-Token Counting Reveals a Dissociation Between Representations and Outputs

重复标记计数揭示了表示与输出之间的脱节

Sohan Venkatesh

机构 * Manipal Institute of Technology Bengaluru(班加罗尔Manipal理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究发现大语言模型在重复标记计数任务中表现不佳,但通过线性探针发现错误源于多层感知机块的固定错误覆盖,而非表示层的缺陷。

Comments Code is available at https://github.com/sohv/counting-failure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01348 2026-07-28 cs.CL cs.LG 版本更新 73%

Does Faithfulness-Guided Alignment Hurt Accuracy? Unlocking Accurate and Faithful Post-Retrieval Reasoning

CRAFT: 通过强化学习进行多跳问答的校准推理与答案忠实轨迹

Yu Liu, Wenxiao Zhang, Diandian Guo, Cong Cao, Fangfang Yuan, Qiang Sun, Yanbing Liu, Jin B. Hong, Zhiyuan Ma

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CRAFT通过强化学习框架提升多跳问答的推理准确性和答案忠实度,结合确定性奖励和判官奖励,增强推理轨迹的可审计性与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13935 2026-07-27 cs.AI cs.LG stat.ML 版本更新 73%

Statistical Early Stopping for Reasoning Models

统计早停法用于推理模型

Yangxinyu Xie, Tao Wang, Soham Mallick, Yan Sun, Georgy Noarov, Mengxin Yu, Tanwi Mallick, Edgar Dobriban

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出基于统计原理的早停方法,通过监控不确定性信号来提高大语言模型在推理任务中的效率和可靠性,尤其在数学推理中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04344 2026-07-21 cs.LG cs.AI 版本更新 73%

UnMaskFork: Test-Time Scaling for Masked Diffusion via Deterministic Action Branching

UnMaskFork:通过确定性动作分支实现Masked Diffusion的测试时扩展

Kou Misaki, Takuya Akiba

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 UnMaskFork通过确定性动作分支提升Masked Diffusion在测试时的扩展能力,优于现有方法并在复杂任务中表现优异。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23071 2026-07-21 cs.CL cs.AI 版本更新 73%

From Evidence to Trajectory: Abductive Reasoning Path Synthesis for Retrieval-Augmented Generation Agents Development

从证据到轨迹:用于检索增强生成智能体开发的溯因推理路径合成

Muzhi Li, Jinhu Qi, Yihong Wu, Minghao Zhao, Liheng Ma, Yifan Li, Xinyu Wang, Zhenghan Tai, Zixing Song, Yingxue Zhang, Ho-fung Leung, Irwin King

机构 * The Chinese University of Hong Kong, Sha Tin, NT, Hong Kong(香港中文大学) Université de Montréal, Montréal, Quebéc, Canada(蒙特利尔大学) McGill University, Montréal, Quebéc, Canada(麦吉尔大学) Mila - Quebéc AI Institute, Montréal, Quebéc, Canada(魁北克AI研究院) Huawei Noah’s Ark Lab, Montréal, Quebéc, Canada(华为诺亚实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对检索增强生成智能体开发缺乏可执行轨迹问题,提出EviPath范式,通过溯因子任务规划、忠实子问题回答、对话微调三个阶段合成推理路径,实验表明基于此训练的模型在开放域问答中显著优于基线。

Comments KDD 2026 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22402 2026-07-20 cs.CL cs.FL cs.LG 版本更新 73%

Bifocal Attention: Harmonizing Geometric and Spectral Positional Embeddings for Algorithmic Generalization

双焦点注意力:协调几何与谱域的位置嵌入以实现算法泛化

Kanishk Awadhiya

机构 * Indian Institute of Technology, Delhi(印度理工学院德里分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出双焦点注意力机制,通过协调几何与谱域的位置嵌入,解决算法泛化中的结构间隙问题,提升模型对递归推理的处理能力。

Comments There is issue with affiliation, any further updates will be communicated but right now removal is necessary

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24267 2026-07-15 cs.CL cs.AI 版本更新 73%

Pigeonholing: how bad prompts hurt models, causing collapse and mistakes

鸽笼效应:不良提示导致模型崩溃和犯错

Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究不良上下文导致大语言模型性能下降和模式崩溃的“鸽笼效应”,发现重复错误答案、收敛于狭窄答案集等问题,并提出RLVR合成错误缓解方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏