arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 5804 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 5804 篇

2603.19944 2026-04-21 q-fin.TR q-fin.ST 67%

Large Language Models and Stock Investing: Is the Human Factor Required?

大语言模型与股票投资:是否需要人类因素?

Ricardo Crisostomo, Diana Mykhalyuk

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文研究大语言模型能否生成可靠的股市预测,发现其预测能力受限于推理错误,需人类监督以提升表现。

Comments 33 pages; 6 tables; 2 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16858 2026-04-21 cs.CV 67%

Q-DeepSight: Incentivizing Thinking with Images for Image Quality Assessment and Refinement

Q-DeepSight:利用图像激励思考用于图像质量评估与细化

Xudong Li, Jiaxi Tan, Ziyin Zhou, Yan Zhong, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Peking University(北京大学) Beijing Institute of Technology(北京理工大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Q-DeepSight框架,通过多模态链式思考与工具增强证据获取,提升图像质量评估与细化的准确性与可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21686 2026-04-21 cs.CL cs.AI cs.LG 67%

Matrix: Peer-to-Peer Multi-Agent Synthetic Data Generation Framework

矩阵:基于点对点的多智能体合成数据生成框架

Dong Wang, Yang Li, Ansong Ni, Ching-Feng Yeh, Youssef Emad, Xinjie Lei, Liam Robbins, Karthik Padthe, Hu Xu, Xian Li, Asli Celikyilmaz, Ramya Raghavendra, Lifei Huang, Carole-Jean Wu, Shang-Wen Li

机构 * FAIR at Meta(Meta 的 FAIR)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Matrix框架,通过去中心化设计实现多智能体协同生成高质量、多样化的合成数据,提升数据生成效率2-15倍,适用于多智能体对话、网络推理数据提取等场景。

Comments MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12634 2026-04-15 cs.AI cs.CL cs.LG cs.MA 67%

RPRA: Predicting an LLM-Judge for Efficient but Performant Inference

RPRA:为高效且高性能推断预测一个LLM判断者

Dylan R. Ashley, Gaël Le Lan, Changsheng Zhao, Naina Dhingra, Zhipeng Cai, Ernie Chang, Mingchen Zhuge, Yangyang Shi, Vikas Chandra, Jürgen Schmidhuber

机构 * Meta Platforms, Inc.(Meta公司) The Swiss AI Lab IDSIA (USI-SUPSI)(瑞士AI实验室IDSIA) Center of Excellence for Generative AI, KAUST(生成式人工智能卓越中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了通过预测LLM判断者评分来提升小模型推断性能的方法,通过零样本预测、上下文报告卡和监督微调三种方法,发现大模型在零样本预测中表现优异,而小模型通过微调或报告卡显著提升预测准确性,达到最高55%的改进。

Comments 10 pages in main text + 6 pages of references + 36 pages of appendices, 12 figures in main text + 37 figures in appendices, 2 tables in main text + 3 table in appendices, 13 prompts in appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10161 2026-04-14 cs.SD 67%

From Speech to Profile: A Protocol-Driven LLM Agent for Psychological Profile Generation

从语音到档案:一种基于协议的LLM代理用于心理档案生成

Xingjian Yang, Yudong Yang, Zhixing Guo, Yongjie Zhou, Nan Yan, Lan Wang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Key Laboratory of Biomedical Imaging Science and System, Chinese Academy of Sciences(中国科学院生物医学成像科学与系统重点实验室)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出StreamProfile框架,通过增量处理咨询语音,提取证据并生成可追溯的心理档案,有效避免幻觉和长上下文遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00487 2026-04-14 cs.MA cs.GT cs.SY eess.SY 67%

Competition and Cooperation of LLM Agents in Games

博弈中的大语言模型代理竞争与合作

Jiayi Yao, Cong Chen, Baosen Zhang

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 研究大语言模型代理在资源分配和Cournot竞争博弈中的行为,发现多轮提示和非零和上下文促进合作,基于公平性推理提出分析框架。

Comments Submitted to CDC'2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15593 2026-04-14 cs.CL cs.AI cs.LG 67%

Parallelism and Generation Order in Masked Diffusion Language Models: Limits Today, Potential Tomorrow

掩码扩散语言模型中的并行性与生成顺序:今日的限制,明日的潜力

Yangyang Zhong, Yanmei Gu, Zhengqing Zang, Xiaomeng Li, Yuqi Ding, Xibei Jia, Yuting Shen, Zhenzhong Lan, Liwang Zhu, Weiping Liu, Junlin Zhou, Haisheng Liu, Zhong Xin Yu, Pengxin Luo, Donglian Qi, Yunfeng Yan, Junbo Zhao

机构 * Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Shanghai Jiao Tong University(上海交通大学) University of Chinese Academy of Social Sciences(中国社会科学院大学) Westlake University(西湖大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究评估了八种主流MDLM在58个基准上的表现,发现其并行性和生成顺序受任务领域和正确性影响显著,且在需要逆向信息的任务中表现更优,提出生成后编辑范式以提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09494 2026-04-13 cs.CL cs.AI cs.IR cs.LG 67%

RecaLLM: Addressing the Lost-in-Thought Phenomenon with Explicit In-Context Retrieval

RecaLLM:通过显式上下文检索解决‘思维迷失’现象

Kyle Whitecross, Negin Rahimi

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RecaLLM通过交替推理与显式上下文检索解决推理过程中因长上下文导致的检索性能下降问题,显著提升了RULER和HELMET基准测试表现。

Comments Code, data, and models available at https://github.com/kswhitecross/RecaLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17421 2026-04-09 cs.CL cs.AI cs.LG 67%

LongSpec: Long-Context Lossless Speculative Decoding with Efficient Drafting and Verification

LongSpec: 长上下文无损推测解码与高效草稿生成与验证

Penghui Yang, Cunxiao Du, Fengzhuo Zhang, Haonan Wang, Tianyu Pang, Chao Du, Bo An

机构 * Sea AI Lab(Sea AI实验室) Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LongSpec通过三种创新解决长上下文场景下的推测解码问题,实现3.26倍速度提升和2.25倍时间减少,适用于长上下文理解任务。

Comments Accepted by ACL'25 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15195 2026-04-08 cs.CR cs.AI cs.CL cs.LG 67%

Weight space Detection of Backdoors in LoRA Adapters

LoRA适配器中后门的权重空间检测

David Puertolas Merenciano, Ekaterina Vasyagina, Kevin Zhu, Javier Ferrando, Maheep Chaudhary

机构 * Algoverse AI Research Independent(独立研究者)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种无需运行模型即可检测LoRA适配器后门的方法,通过分析权重矩阵的谱统计特征,利用逻辑回归分类器在三种模型家族上实现100%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.14971 2026-04-08 cs.CV cs.AI cs.CL cs.LG 67%

Sim-CLIP: Unsupervised Siamese Adversarial Fine-Tuning for Robust and Semantically-Rich Vision-Language Models

Sim-CLIP: 无监督的孪生对抗微调用于鲁棒且语义丰富的视觉-语言模型

Md Zarif Hossain, Ahmed Imteaj

机构 * Florida Atlantic University(佛罗里达大西洋大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Sim-CLIP通过无监督对抗微调提升CLIP视觉编码器的鲁棒性,同时保持语义表示。采用孪生架构和余弦相似度目标,避免大批次对比学习和额外动量编码器,实现低计算开销的鲁棒训练。

Comments Accepted at IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04982 2026-04-08 cs.IR cs.AI cs.CL cs.LG 67%

CURE:Circuit-Aware Unlearning for LLM-based Recommendation

CURE:基于电路的LLM推荐系统去学习

Ziheng Chen, Jiali Cheng, Zezhong Fan, Hadi Amiri, Yunzhi Yao, Xiangguo Sun, Yang Zhang

机构 * University of Massachusetts Lowell(马萨诸塞大学洛厄尔分校) Zhejiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CURE框架,通过分离模型组件并按功能分类,解决LLM推荐系统去学习中的梯度冲突问题,提升去学习效果和模型稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21343 2026-04-07 cs.CL cs.AI cs.LG 67%

Self-Improving Pretraining: using post-trained models to pretrain better models

自我改进预训练:利用后训练模型来预训练更好的模型

Ellen Xiaoqing Tan, Jack Lanchantin, Shehzaad Dhuliawala, Danwei Li, Thao Nguyen, Jing Xu, Ping Yu, Ilia Kulikov, Sainbayar Sukhbaatar, Jason Weston, Xian Li, Olga Golovneva

机构 * FAIR at Meta(Meta FAIR)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种新的预训练和中训练方法,通过利用已有的强后训练模型来重写预训练数据并判断策略模型的 rollout,从而在早期训练中引入安全、事实性、生成质量和推理能力等关键行为,提升模型整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00267 2026-04-02 cs.CV 67%

Omni-MMSI: Toward Identity-attributed Social Interaction Understanding

Omni-MMSI:迈向基于身份的社会互动理解

Xinpeng Li, Bolin Lai, Hardy Chen, Shijian Deng, Cihang Xie, Yuyin Zhou, James Matthew Rehg, Yapeng Tian

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Santa Cruz(加州大学圣克鲁兹分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出Omni-MMSI任务,要求从原始音频、视觉和语音输入中全面理解社会互动,通过身份属性的社会线索识别与推理,提升AI助手对人类互动的感知与响应能力。

Comments Accepted to CVPR 2026. Project page: https://sampson-lee.github.io/omni-mmsi-project-page

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29232 2026-04-01 cs.CL cs.AI cs.LG 67%

Long-Document QA with Chain-of-Structured-Thought and Fine-Tuned SLMs

长文档问答与结构化思维链及微调大语言模型

Zhuowen Liang, Xiaotian Lin, Zhengxuan Zhang, Yuyu Luo, Haixun Wang, Nan Tang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) EvenUp, USA(美国EvenUp公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出LiteCoST框架,通过结构化思维链和微调小语言模型,实现高精度低延迟的长文档问答,采用双支柱方法提升准确性和效率。

Comments 26 pages, 17 figures, 10 tables. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09094 2026-03-31 cs.CV 67%

Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

基于事件中心因果推理的物理合理视频生成

Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出基于事件链的因果推理和跨模态提示模块,用于生成物理合理视频,通过物理公式约束和时间对齐提示提升视频生成的因果连贯性与物理合理性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26045 2026-03-30 cs.LG cs.AI cs.CL cs.NE 67%

H-Node Attack and Defense in Large Language Models

H-Node攻击与防御在大语言模型中

Eric Yocam, Varghese Vaidyan, Yong Wang

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出H-Node对抗噪声消除框架,通过识别并防御Transformer大语言模型中的幻觉表示,利用逻辑回归探针定位幻觉节点,通过白盒对抗攻击增强这些维度,并采用自适应防御抑制幻觉节点,提升模型鲁棒性。

Comments 17 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20730 2026-03-24 cs.IR cs.AI cs.CL cs.LG 67%

Do LLMs Understand Collaborative Signals? Diagnosis and Repair

大语言模型理解协作信号吗?诊断与修复

Shahrooz Pouryousef, Ali Montazeralghaem

机构 * Google(谷歌)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究大语言模型在推荐任务中处理协作信息的能力,通过检索增强生成方法提升其推理性能,实验表明在提供清晰信息时LLM优于传统矩阵分解模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09233 2026-03-19 cs.LG cs.AI cs.CL 67%

GIFT: Reconciling Post-Training Objectives via Finite-Temperature Gibbs Initialization

GIFT:通过有限温度吉布斯初始化调和后训练目标

Zhengyang Zhao, Lu Ma, Yizhen Jiang, Xiaochen Ma, Zimo Meng, Chengyu Shen, Lexiang Tang, Haoze Sun, Peng Pei, Wentao Zhang

机构 * Peking University(北京大学) Meituan(美团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出GIFT方法,通过将监督视为有限温度能量势,解决后训练阶段目标不一致问题,实验表明其在强化学习初始化中优于传统SFT及其他基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09892 2026-03-11 cs.LG cs.AI cs.CL 67%

MSSR: Memory-Aware Adaptive Replay for Continual LLM Fine-Tuning

MSSR: 为持续LLM微调的内存感知自适应回放

Yiyang Lu, Yu He, Jianlong Chen, Hongyuan Zha

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MSSR通过估计样本级别的记忆强度并自适应地安排复习,有效缓解持续LLM微调中的灾难性遗忘问题,同时保持快速适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03517 2026-03-05 cs.LG cs.AI cs.CL 67%

MMAI Gym for Science: Training Liquid Foundation Models for Drug Discovery

MMAI Gym for Science: 训练液态基础模型用于药物发现

Maksim Kuznetsov, Zulfat Miftahutdinov, Rim Shayakhmetov, Mikolaj Mizera, Roman Schutski, Bogdan Zagribelnyy, Ivan Ilin, Nikita Bondarev, Thomas MacDougall, Mathieu Reymond, Mihir Bafna, Kaeli Kaymak-Loveless, Eugene Babin, Maxim Malkov, Mathias Lechner, Ramin Hasani, Alexander Amini, Vladimir Aladinskiy, Alex Aliper, Alex Zhavoronkov

机构 * Insilico Medicine Liquid AI

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MMAI Gym for Science通过训练液态基础模型,实现了在药物发现任务中超越大模型的性能,同时保持高效和广泛适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03325 2026-03-05 cs.CL cs.AI cs.LG 67%

IntPro: A Proxy Agent for Context-Aware Intent Understanding via Retrieval-conditioned Inference

IntPro:一种通过检索条件推理的代理代理,用于基于情境的意图理解

Guanming Liu, Meng Wu, Peng Zhang, Yu Zhang, Yubo Shu, Xianliang Huang, Kainan Tu, Ning Gu, Liuxin Zhang, Qianying Wang, Tun Lu

机构 * Fudan University(复旦大学) Lenovo Group Ltd(联想集团有限公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 IntPro通过检索条件推理学习适应个体用户,提升基于情境的意图理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22556 2026-02-27 cs.LG cs.AI cs.CL 67%

Stable Adaptive Thinking via Advantage Shaping and Length-Aware Gradient Regulation

通过优势塑造和长度感知梯度调节实现稳定的自适应思维

Zihang Xu, Haozhi Xie, Ziqi Miao, Wuxuan Gong, Chen Qian, Lijun Li

机构 * Beihang University(北航) Shanghai AI Laboratory(上海人工智能实验室) Beijing University of Posts and Telecommunications(北京邮电大学) Renmin University of China(中国人民大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种两阶段框架,通过混合微调和自适应强化学习,结合正确性保持优势塑造和长度感知梯度调节,提升大型推理模型在低复杂度查询中的稳定自适应推理能力。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21221 2026-02-26 cs.LG cs.AI cs.CL 67%

Latent Context Compilation: Distilling Long Context into Compact Portable Memory

潜在上下文编译:将长上下文编译为紧凑便携内存

Zeju Li, Yizhou Zhou, Qiang Xu

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出潜在上下文编译方法,通过LoRA模块将长上下文压缩为紧凑内存,无需合成数据即可提升LLM部署效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21220 2026-02-26 cs.CL cs.AI cs.LG 67%

Field-Theoretic Memory for AI Agents: Continuous Dynamics for Context Preservation

场论记忆用于人工智能代理:连续动态以保持上下文

Subhadip Mitra

机构 * Rotalabs

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于场论的记忆系统,通过连续动态保持上下文,提升多会话推理和时间推理性能。

Comments 15 pages, 6 figures. Code: https://github.com/rotalabs/rotalabs-fieldmem

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05165 2026-02-24 cs.LG cs.AI cs.CL 67%

EBPO: Empirical Bayes Shrinkage for Stabilizing Group-Relative Policy Optimization

EBPO:经验贝叶斯收缩用于稳定群体相对策略优化

Kevin Han, Yuhang Zhou, Mingze Gao, Gedi Zhou, Serena Li, Abhishek Kumar, Xiangjun Fan, Weiwei Li, Lizhu Zhang

机构 * Meta AI

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EBPO通过经验贝叶斯收缩方法稳定群体相对策略优化,有效降低估计方差并提升训练稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14689 2026-02-17 cs.CR cs.AI cs.CL cs.LG 67%

Exposing the Systematic Vulnerability of Open-Weight Models to Prefill Attacks

揭示开放权重模型对预填充攻击的系统性漏洞

Lukas Struppek, Adam Gleave, Kellin Pelrine

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究揭示了开放权重模型对预填充攻击的系统性漏洞,通过评估多种策略发现其普遍易受攻击,强调了加强防御的必要性。

Comments 54 pages, 7 figures, 35 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10138 2026-02-12 cs.CV cs.AI cs.CL cs.LG 67%

Multimodal Information Fusion for Chart Understanding: A Survey of MLLMs -- Evolution, Limitations, and Cognitive Enhancement

多模态信息融合用于图表理解:MLLMs的综述——演变、局限与认知增强

Zhihang Yi, Jian Zhao, Jiancheng Lv, Tao Wang

机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) Engineering Research Center of Machine Learning(机器学习工程研究中心) China Telecom Institute of AI(中国电信人工智能研究院)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了多模态大语言模型在图表理解中的应用,分析了其演变、局限及未来发展方向,旨在推动更稳健的系统发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14671 2026-02-12 cs.CL cs.AI cs.LG 67%

TableDART: Dynamic Adaptive Multi-Modal Routing for Table Understanding

TableDART: 表格理解的动态自适应多模态路由

Xiaobo Xing, Wei Yuan, Tong Chen, Quoc Viet Hung Nguyen, Xiangliang Zhang, Hongzhi Yin

机构 * The University of Queensland, Australia(昆士兰大学) Griffith University, Australia(格里菲斯大学) University of Notre Dame, USA(诺丁汉大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TableDART通过动态选择文本、图像或融合视角,提升表格理解的准确性和效率,避免昂贵的多模态模型微调。

Comments Accepted to ICLR 2026. 26 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09331 2026-02-11 cs.CL cs.AI cs.LG 67%

Beyond Uniform Credit: Causal Credit Assignment for Policy Optimization

超越均匀信用:为策略优化的因果信用分配

Mykola Khandoga, Rui Yuan, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出反事实重要性加权方法,通过因果信用分配提升语言模型推理性能,无需辅助模型或外部标注,实验验证其在GSM8K上的有效性。

Comments 12 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏