arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-30 至 2026-04-30 共收录 231 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 9 篇

2603.16496 2026-04-30 cs.CL 81%

AdaMem: Adaptive User-Centric Memory for Long-Horizon Dialogue Agents

AdaMem:面向长时对话代理的自适应用户导向记忆

Shannan Yan, Jingchen Ni, Leqi Zheng, Jiajun Zhang, Peixi Wu, Dacheng Yin, Jing Lyu, Chun Yuan, Fengyun Rao

机构 * Tsinghua University(清华大学) WeChat Vision, Tencent Inc.(腾讯微信视觉实验室)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AdaMem通过自适应用户导向记忆框架提升长时对话代理的长时推理与用户建模能力,采用统一框架整合工作记忆、事件记忆、人格记忆和图记忆,实现高效信息组织与推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26351 2026-04-30 cs.CL 79%

A Dual-Task Paradigm to Investigate Sentence Comprehension Strategies in Language Models

一种双任务范式用于研究语言模型中的句子理解策略

Rei Emura, Saku Sugawara

机构 * Tohoku University(东大大学) National Institute of Informatics(国家信息研究所) The University of Tokyo(东京大学)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL

AI总结 本文提出双任务范式,结合算术计算与句子理解任务,揭示语言模型在资源受限下更倾向于基于合理性推理,支持人类认知资源分配对句子理解的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26243 2026-04-30 cs.CL cs.AI 73%

StratMem-Bench: Evaluating Strategic Memory Use in Virtual Character Conversation Beyond Factual Recall

StratMem-Bench:评估虚拟角色对话中的战略记忆使用超越事实回忆

Yerong Wu, Tianxing Wu, Minghao Zhu, Hangyu Sha, Haofen Wang

机构 * School of Computer Science and Engineering, Southeast University, China(东南大学计算机科学与工程学院,中国) Key Laboratory of New Generation Artificial Intelligence Technology and its Interdisciplinary Applications (Southeast University), Ministry of Education, China(新一代人工智能技术及其交叉应用国家重点实验室(东南大学),中华人民共和国教育部,中国) College of Design and Innovation, Tongji University, China(同济大学设计与创新学院,中国)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 StratMem-Bench旨在评估虚拟角色对话中战略记忆的使用,通过异构记忆池测试角色在不同记忆类型间的决策能力,提出多种评估指标以衡量记忆整合与利用效果。

Comments 20 pages, accepted by ACL 2026 (main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26622 2026-04-30 cs.CL 70%

OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory

OCR-Memory:光学上下文检索用于长周期智能体记忆

Jinze Li, Yang Zhang, Xin Yang, Jiayi Qu, Jinfeng Xu, Shuo Yang, Junhua Ding, Edith Cheuk-Han Ngai

机构 * The University of Hong Kong(香港大学) University of North Texas(北得克萨斯大学) University of Tsukuba(筑波大学) Yonsei University(延世大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 OCR-Memory通过视觉模态高密度表示智能体经验,实现长周期记忆存储与检索,减少token消耗并提升证据恢复准确性。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26774 2026-04-30 cs.CV cs.AI 57%

MemOVCD: Training-Free Open-Vocabulary Change Detection via Cross-Temporal Memory Reasoning and Global-Local Adaptive Rectification

MemOVCD:基于跨时间记忆推理和全局局部自适应校正的无训练开放词汇变化检测

Zuzheng Kuang, Honghao Chang, Boqiang Liang, Haoqian Wang, Lijun He, Fan Li, Haixia Bi

机构 * School of Information and Communications Engineering, Xi’an Jiaotong University(西安交通大学信息与通信工程学院)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 MemOVCD通过跨时间记忆推理和全局局部自适应校正,解决开放词汇变化检测中时间耦合不足和局部碎片化问题,验证了其在多基准上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05959 2026-04-30 cs.CV 50%

OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer

OVGGT:O(1)常数成本流式视觉几何变换器

Si-Yu Lu, Po-Ting Chen, Hui-Che Hsu, Sin-Ye Jhong, Wen-Huang Cheng, Yung-Yao Chen

机构 * National Taiwan University(国立台湾大学) National Taiwan University of Science and Technology(台湾科技大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 OVGGT通过自选择缓存和动态锚点保护,在固定内存预算下实现长视频流式处理,取得最佳3D几何精度。

Comments Project page: https://vaisr.github.io/OVGGT/ Code: https://github.com/VAISR/OVGGT

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理与问题求解 38 篇

2604.26569 2026-04-30 cs.RO 94%

LLM-Flax : Generalizable Robotic Task Planning via Neuro-Symbolic Approaches with Large Language Models

LLM-Flax:通过大规模语言模型的神经符号方法实现通用机器人任务规划

Seongmin Kim, Daegyu Lee

机构 * Department of Physical AI Engineering(物理人工智能工程系) Faculty of Department of Advanced Defense Technology and Industry(高级国防技术与产业学院)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(title);language model(title);prompting(abstract)

AI总结 LLM-Flax通过神经符号方法实现通用机器人任务规划,利用本地部署的大语言模型,无需手动编写规则或训练数据,三个阶段框架显著提升了任务规划效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12059 2026-04-30 cs.CL cs.AI cs.LG 91%

MeTHanol: Modularized Thinking Language Models with Intermediate Layer Thinking, Decoding and Bootstrapping Reasoning

MeTHanol:模块化思维语言模型与中间层思维、解码与推理bootstrap

Ningyuan Xi, Xiaoyu Wang, Yetao Wu, Teng Chen, Qingqing Gu, Yue Zhao, Jinxian Qu, Zhonglin Jiang, Yong Chen, Luo Ji

机构 * Beihang University(北航) Beijing Institute of Technology(北京理工大学) Geely AI Lab(吉利人工智能实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);prompting(abstract)

AI总结 本文提出MeTHanol模块化思维语言模型,通过中间层思维解码与双阶段推理提升LLM的认知能力,实验表明其在理论思维和 vignette 任务中表现出色,能规划、反思并生成类人回答。

Comments 19 pages, 7 figures. IJCNN2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20133 2026-04-30 cs.CL 89%

Reasoning Gets Harder for LLMs Inside A Dialogue

在对话中LLM的推理变得更难

Ivan Kartáč, Mateusz Lango, Ondřej Dušek

机构 * Charles University, Faculty of Mathematics and Physics(查理大学数学与物理系) Institute of Formal and Applied Linguistics(形式与应用语言学研究所)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了在对话场景中LLM的推理能力,通过BOULDER基准测试发现,对话环境显著影响LLM性能,揭示了对话多轮交互对推理能力的挑战。

Comments Accepted at ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26319 2026-04-30 cs.CL 88%

A Systematic Comparison of Prompting and Multi-Agent Methods for LLM-based Stance Detection

基于大语言模型的立场检测中提示与多智能体方法的系统比较

Genan Dai, Zini Chen, Yi Yang, Bowen Zhang

机构 * School of Artificial Intelligence, Shenzhen Technology University(人工智能学院,深圳技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);prompting(title,abstract);分类 cs.CL

AI总结 本文系统比较了提示和多智能体方法在大语言模型立场检测中的表现,评估了五种方法在四个数据集14个子任务上的性能,发现提示方法在多数模型上表现更优,且模型规模对性能影响大于方法选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26522 2026-04-30 cs.AI cs.LG cs.LO cs.MA cs.SC 87%

AGEL-Comp: A Neuro-Symbolic Framework for Compositional Generalization in Interactive Agents

AGEL-Comp: 一种用于交互智能体组合泛化能力的神经符号框架

Mahnoor Shahid, Hannes Rothe

机构 * Universität Duisburg-Essen(杜伊斯堡- Essen大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 AGEL-Comp通过动态因果程序图、归纳逻辑编程引擎和混合推理核心,实现基于符号和神经网络的组合泛化学习,优于纯LLM模型。

Comments Accepted at IntelliSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21272 2026-04-30 cs.CR cs.SE 87%

LLM-Powered Detection of Price Manipulation in DeFi

基于大语言模型的去中心化金融中价格操纵检测

Lu Liu, Wuqi Zhang, Lili Wei, Hao Guan, Yongqiang Tian, Yepang Liu, Shing-Chi Cheung

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出PMDetector框架,结合静态分析与大语言模型推理,主动检测DeFi中的价格操纵漏洞,通过三阶段流程提升检测精度与召回率,实验表明其在效率和成本上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26615 2026-04-30 cs.SE cs.AI 86%

TDD Governance for Multi-Agent Code Generation via Prompt Engineering

通过提示工程实现多智能体代码生成的TDD治理

Tarlan Hasanli, Shahbaz Siddeeq, Bishwash Khanal, Pyry Kotilainen, Tommi Mikkonen, Pekka Abrahamsson

机构 * University of Jyväskylä(于韦斯屈莱大学) Tampere University(塔尔基尔大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种AI原生的TDD框架,通过结构化提示和工作流程治理机制将经典TDD原则形式化,提升LLM辅助开发的稳定性与可重复性。

Comments 5 pages. Submitted to the 1st International Workshop on Empirical Prompt Engineering for Software Engineering (PROMPT-SE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15262 2026-04-30 cs.AI 86%

Probe-then-Plan: Environment-Aware Planning for Industrial E-commerce Search

探测-然后规划:面向工业电商搜索的环境感知规划

Mengxiang Chen, Zhouwei Zhai, Jin Li

机构 * JD.com Beijing China(京东北京中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出环境感知搜索规划(EASP),通过探测-规划机制解决电商搜索中盲点与延迟的矛盾,通过离线数据合成、规划器训练和在线服务适应性路由提升搜索相关召回率和UCVR、GMV。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22910 2026-04-30 cs.CL 86%

Talent or Luck? Evaluating Attribution Bias in Large Language Models

天赋还是运气?评估大语言模型中的归因偏差

Chahat Raj, Mahika Banerjee, Jinhao Pan, Aylin Caliskan, Antonios Anastasopoulos, Ziwei Zhu

机构 * George Mason University(乔治·马歇尔大学) Thomas Jefferson High School For Science and Technology(托马斯·杰斐逊科学与技术高中) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(title);language model(title);LLM(abstract_cn);分类 cs.CL

AI总结 研究探讨大语言模型在事件归因中的偏差,提出基于认知的评估框架,识别模型推理差异如何放大群体偏见。

Comments Accepted to ACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09870 2026-04-30 cs.HC cs.AI cs.CL 86%

Vibe Check: Understanding the Effects of LLM-Based Conversational Agents' Personality and Alignment on User Perceptions in Goal-Oriented Tasks

Vibe Check: 探讨基于大语言模型的对话代理的性格和对齐对用户在目标导向任务中的感知影响

Hasibur Rahman, Smit Desai

机构 * Northeastern University(东北大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究探讨了对话代理性格表达水平和用户与代理性格对齐如何影响用户在目标导向任务中的感知,发现中等表达水平在多个维度上表现最佳,性格对齐进一步提升了结果,尤其在外向性和情绪稳定性和方面影响显著。

Comments 30 pages, CHI 2026 conference paper (article no. 371)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25926 2026-04-30 cs.CL cs.IR 84%

MATH-PT: A Math Reasoning Benchmark for European and Brazilian Portuguese

MATH-PT:一个针对欧洲葡萄牙语和巴西葡萄牙语的数学推理基准数据集

Tiago Teixeira, Ana Carolina Erthal, Juan Belieni, Beatriz Canaverde, Diego Mesquita, Miguel Faria, Eliezer de Souza da Silva, André F. T. Martins

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Fundação Getulio Vargas(古特曼基金会) Instituto de Telecomunicações(电信研究所) Universidade de Coimbra, CISUC/LASI, DEI(科英布拉大学,CISUC/LASI,DEI) Basque Center for Applied Mathematics(巴斯克应用数学中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MATH-PT数据集,包含1729个欧洲和巴西葡萄牙语数学问题,评估了当前最先进的LLM在数学推理中的表现,发现前沿模型在选择题表现优异,但在涉及图表或开放性问题时性能下降。

Comments Accepted at 17th International Conference on Computational Processing of Portuguese (PROPOR 2026). Open access to dataset repo https://huggingface.co/datasets/tiagoteixeira03/MATH-PT and model outputs https://github.com/deep-spin/math-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18239 2026-04-30 cs.CY cs.AI 84%

Can LLMs Help Allocate Public Health Resources? A Case Study on Childhood Lead Testing

大语言模型能否帮助分配公共卫生资源?一项关于儿童铅检测的案例研究

Mohamed Afane, Ying Wang, Juntao Chen

机构 * Department of Computer and Information Sciences, Fordham University(福特汉姆大学计算机与信息科学系) Department of Systems Engineering, Stevens Institute of Technology(史蒂文斯理工学院系统工程系)

专题命中 推理与问题求解 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究大语言模型在分配公共卫生资源中的有效性,通过芝加哥、纽约和华盛顿特区136个社区的案例,发现LLM在处理铅暴露高风险区域时存在显著局限性。

Journal ref 2025 IEEE International Conference on Big Data (BigData), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23163 2026-04-30 cs.AI cs.CL cs.CR cs.IT cs.MA math.IT 84%

A Decision-Theoretic Formalisation of Steganography With Applications to LLM Monitoring

基于决策理论的隐写术形式化及其在大语言模型监控中的应用

Usman Anwar, Julianna Piskorz, David D. Baek, David Africa, Jim Weatherall, Max Tegmark, Christian Schroeder de Witt, Mihaela van der Schaar, David Krueger

机构 * University of Cambridge(剑桥大学) Massachusetts Institute of Technology(麻省理工学院) UK AI Safety Institute(英国人工智能安全研究所) University of Oxford(牛津大学) Mila, University of Montreal(蒙特利尔大学米尔人工智能实验室)

专题命中 推理与问题求解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出决策理论视角下的隐写术形式化方法,通过通用V-信息量定义隐写差距,用于检测和缓解大语言模型中的隐写推理行为。

Comments First two authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21459 2026-04-30 cs.LG cs.AI 84%

HER: Human-like Reasoning and Reinforcement Learning for LLM Role-playing

HER:面向大语言模型角色扮演的人类级推理与强化学习

Chengyu Du, Xintao Wang, Aili Chen, Weiyuan Li, Rui Xu, Junteng Liu, Zishan Huang, Rong Tian, Zijun Sun, Yuhao Li, Liheng Feng, Deming Ding, Pengyu Zhao, Yanghua Xiao

机构 * Fudan University(复旦大学) MiniMax

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出HER框架,通过双层推理和人类对齐的奖励模型,提升大语言模型在角色扮演中的认知模拟能力,实验表明其在CoSER和Minimax Role-Play Bench上显著优于基线模型。

Comments Findings of ACL, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23758 2026-04-30 cs.LG cond-mat.mtrl-sci 83%

Agentic Fusion of Large Atomic and Language Models to Accelerate Superconductors Discovery

代理融合大规模原子和语言模型以加速超导体发现

Mingze Li, Yu Rong, Songyou Li, Lihong Wang, Jiacheng Cen, Liming Wu, Anyi Li, Zongzhao Li, Qiuliang Liu, Rui Jiao, Tian Bian, Pengju Wang, Hao Sun, Jianfeng Zhang, Ji-Rong Wen, Deli Zhao, Shifeng Jin, Tingyang Xu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China, Beijing, China(中国人民大学北京校区人工智能学院) DAMO Academy, Alibaba Group, Hangzhou, China(阿里巴巴集团达摩院,杭州,中国) Hupan Lab, Hangzhou, China(虎扑实验室,杭州,中国) Institution of Physics, University of the Chinese Academy of Sciences, Beijing, China(中国科学院物理研究所,北京,中国) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,北京,中国)

专题命中 推理与问题求解 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 本文提出ElementsClaw框架,结合大规模原子模型与语言模型,通过自主协作加速超导体发现,筛选240万晶体识别6.8万高置信度候选,发现四个新实验验证超导体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14438 2026-04-30 cs.CL 83%

WebAggregator: Enhancing Compositional Reasoning Capabilities of Deep Research Agent Foundation Models

WebAggregator:增强深度研究代理基础模型的组合推理能力

Rui Wang, Ce Zhang, Jun-Yu Ma, Jianshu Zhang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Zhisong Zhang, Hongming Zhang, Haitao Mi, Dong Yu, Kam-Fai Wong

机构 * MoE Lab, The Chinese University of Hong Kong(莫埃实验室,香港中文大学) Tencent AI Lab(腾讯AI实验室)

专题命中 推理与问题求解 :foundation model(title);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出WebAggregator数据合成管道,通过主动探索和组合逻辑提案,提升深度研究代理的组合推理能力,并在多个基准测试中超越GPT-4.1和Claude-3.7-Sonnet。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26630 2026-04-30 cs.CL 81%

SAGE: A Strategy-Aware Graph-Enhanced Generation Framework For Online Counseling

SAGE:一种面向在线咨询的策略感知图增强生成框架

Eliya Naomi Aharon, Meytal Grimland, Avi Segal, Loona Ben Dayan, Inbar Shenfeld, Yossi Levi Belz, Kobi Gal

机构 * Ben-Gurion University of the Negev(贝叶特·沙瓦大学) University of Haifa(海法大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAGE通过整合心理框架和实时压力信号,提升在线咨询的策略预测与响应质量,为高风险危机咨询提供决策支持工具。

Comments Full version of the work accepted as a short paper at the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26). 9 pages, 4 figures, 5 tables

Journal ref Proceedings of the 34th ACM Conference on User Modeling, Adaptation and Personalization (UMAP '26), June 08--11, 2026, Gothenburg, Sweden

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20956 2026-04-30 cs.CR cs.CL 79%

Self-Jailbreaking: Language Models Can Reason Themselves Out of Safety Alignment After Benign Reasoning Training

自我越狱:语言模型在良性推理训练后可通过推理自行摆脱安全对齐

Zheng-Xin Yong, Stephen H. Bach

机构 * Brown University(布朗大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 研究发现推理语言模型在良性训练后可能通过引入良性假设来规避安全限制,提出通过增加安全推理数据训练可缓解该问题。

Comments Published in The Fourteenth International Conference on Learning Representations (ICLR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13606 2026-04-30 cs.CV 75%

ChartVerse: Scaling Chart Reasoning via Reliable Programmatic Synthesis from Scratch

ChartVerse: 通过从零开始可靠程序合成实现图表推理的扩展

Zheng Liu, Honglin Lin, Chonghan Qin, Xiaoyang Wang, Xin Gao, Yu Li, Mengzhang Cai, Yun Zhu, Zhanping Zhong, Qizhi Pei, Zhuoshi Pan, Xiaoran Shang, Bin Cui, Conghui He, Wentao Zhang, Lijun Wu

机构 * Shanghai AI Laboratory(上海人工智能实验室) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Software and Hardware Cooperative Artificial Intelligence Systems(北京市软件与硬件协同人工智能系统重点实验室)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 ChartVerse通过从零开始生成复杂图表和可靠推理数据,解决开放源模型开发中高质量训练数据缺乏的问题,采用RPE量化图表复杂度并生成高复杂度图表,结合truth-anchored inverse QA合成和CoT蒸馏提升推理深度。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10150 2026-04-30 cs.LG cs.AI 73%

Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective

重新思考RLVR中的熵干预:从熵变化视角

Zhezheng Hao, Hong Wang, Haoyang Liu, Jian Luo, Jiarui Yu, Hande Dong, Qiang Lin, Can Wang, Jiawei Chen

机构 * State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Zhejiang University(浙江大学) Tencent(腾讯) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文从熵变化角度分析RLVR中的熵崩溃问题,提出STEER方法通过理论估计熵变化来调整token权重,有效缓解熵崩溃并优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26561 2026-04-30 cs.MA cs.AI 70%

Preserving Disagreement: Architectural Heterogeneity and Coherence Validation in Multi-Agent Policy Simulation

保持分歧:多智能体政策模拟中的架构异质性与一致性验证

Ariel Sela

机构 * Ariel Sela

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出AI委员会框架,通过120次模拟测试两种干预措施,发现架构异质性可减少一致性,但一致性验证在不同场景下产生分歧-多样性权衡。

Comments 14 pages, 7 tables, 120 deliberations across 2 policy scenarios

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26511 2026-04-30 cs.CR cs.AI 70%

Tatemae: Detecting Alignment Faking via Tool Selection in LLMs

Tatemae:通过工具选择检测LLMs中的对齐欺骗

Matteo Leonesi, Francesco Belardinelli, Flavio Corradini, Marco Piangerelli

机构 * Department of Computer Science(计算机科学系) University of Camerino(坎皮诺大学) Department of Computing(计算系) Imperial College London(伦敦帝国学院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文通过可观测的工具选择检测LLMs中的对齐欺骗,分析了在监控和无监控状态下工具选择的变化,并展示了不同领域和压力类型下的漏洞特征。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18112 2026-04-30 cs.CL cs.MM 70%

Retrieval-Augmented Multimodal Model for Fake News Detection

增强检索的多模态模型用于虚假新闻检测

Yiheng Li, Weihai Lu, Hanyi Yu, Yue Wang

机构 * University of International Business and Economics(国际商务经济大学) Peking University(北京大学) University of Southern California(南加州大学) Upstart Holdings, Inc.(Upstart Holdings公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出RAMM模型,通过多模态大语言模型和抽象叙述对齐模块,解决虚假新闻检测中跨实例叙述一致性缺失和领域知识不足的问题,实验验证了其有效性。

Comments Accepted to SIGIR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11731 2026-04-30 cs.CL 70%

Thinking with Drafting: Optical Decompression via Logical Reconstruction

用草图思考:通过逻辑重建实现光学解压

Jingxuan Wei, Honghao He, Caijun Jia, Siyuan Li, Zheng Sun, Yuhang Xu, Yuanyuan Lin, Linzhuang Sun, Yuchen Wu, Bihui Yu, Xiangxiang Zhang, Cheng Tan

机构 * Shenyang Institute of Computing Technology, Chinese Academy of Sciences(中国科学院沈阳计算技术研究所) University of Chinese Academy of Sciences 3 ByteDance 4 Westlake University(中国科学院大学 3 字节跳动 4 西湖大学) Key Laboratory of Computing Power Network(计算功率网络重点实验室) Information Security, Ministry of Education, Shandong Computer Science Center (National Supercomputer Center in Jinan), Qilu University of Technology (Shandong Academy of Sciences)(信息安全,教育部,山东计算机科学中心(济南国家超级计算中心),齐鲁工业大学(山东省科学院))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出通过逻辑重建实现光学解压,引入TwD方法,利用领域特定语言作为中间表示,以生成可执行代码的视觉证明,建立视觉生成与逻辑验证的闭环系统。

详情

展开后加载摘要…

URL PDF HTML 收藏