arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-16 至 2026-07-16 共收录 239 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 15 篇

2607.05364 2026-07-16 cs.CL cs.AI cs.SD 版本更新 79%

REDDIT: Correcting Model-Generated Timestamp Drift in ASR without Forgetting via Replay-Based Distribution Editing

REDDIT:基于回放的分布编辑在无遗忘条件下校正ASR的模型生成时间戳漂移

Cheng-Kang Chou, Ming-To Chuang, Ke-Han Lu, Chan-Jan Hsu, Hung-yi Lee

机构 * National Taiwan University(台湾大学) Carnegie Mellon University(卡内基梅隆大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心(NTU AI-CoRE))

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.AI

AI总结 针对自回归ASR的非语音区间时间戳漂移问题,提出REDDIT两阶段后训练框架,仅用少量数据和参数更新校正时间戳,避免普通微调的灾难性遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13044 2026-07-16 cs.CL cs.AI 新提交 73%

The Perplexity Trap: When Patent Law Makes Human Writing Look Like AI

困惑陷阱:专利法何时让人类写作看起来像人工智能

Anubhab Banerjee

机构 * European Patent Office(欧洲专利局)

专题命中 指令微调 :LLM(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专利法下筛选疑似人工智能生成专利文本的难题,在消费级硬件条件下用多种策略进行基准测试,发现现有检测器误报率高,问题是结构性的,提出七特征语言复杂性逻辑回归方法,提升了准确率。

Journal ref Proceedings of the ICML 2026 Workshop on AI4Law

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05623 2026-07-16 cs.CL 版本更新 70%

NAVER LABS System Re-implementation for the IWSLT 2026 Instruction-Following Task

用于IWSLT 2026指令跟随任务的NAVER LABS系统重新实现

Anand Kamble, Aniket Tathe

机构 * NAVER LABS(NAVER实验室) Florida State University(佛罗里达州立大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 该研究为IWSLT 2026共享任务重新实现NAVER LABS系统,采用规定组件,保留三阶段方法,构建合成示例用于微调,其主要模型在EN-ZH语音翻译和英语SQA任务中取得了一定成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13926 2026-07-16 cs.RO 新提交 67%

S-squared-VLA: Decoupling Semantic and Spatial Streams in Vision-Language-Action Models for Autonomous Driving

S平方-VLA:自动驾驶视觉-语言-动作模型中语义与空间流的解耦

Jianguo Yu, Rukang Wang, Duanfeng Chu, Chen Wang, Renju Feng, Liping Lu

机构 * School of Mechanical and Electronic Engineering, Wuhan University of Technology(武汉理工大学机电工程学院) Intelligent Transportation Systems Research Center, Wuhan University of Technology(武汉理工大学智能交通系统研究中心) School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院)

专题命中 指令微调 :language model(abstract);SFT(abstract)

AI总结 研究针对自动驾驶中视觉语言模型生成低级控制动作的局限,提出S平方-VLA解耦语义和空间流,语义流用于意图推理,空间流保留空间特征并赋予先验,双流规划适配器融合二者,在基准测试中取得新的最先进水平,优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14070 2026-07-16 q-bio.GN cs.LG 新提交 57%

Screening of Biosecurity Features in Metagenomic Data with Evo 2 Probes

使用Evo 2探针筛选宏基因组数据中的生物安全特征

Jeremy Guntoro, Alexander Dack, Dylan Danno, Michaela Jančovičová, Križan Jurinović, Vanessa Smilansky

机构 * Department of Bioengineering, Imperial College London(帝国理工学院生物工程系) John Innes Centre(约翰·英尼斯研究中心) Independent Research Scientist(独立研究者)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 研究利用Evo 2探针在宏基因组数据中筛选生物安全特征,通过训练线性和注意力探针检测抗菌抗性及细菌毒力等,发现其在检测AMR等方面效果良好,可作为快速低成本首过检测层,明确了该方法的优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13988 2026-07-16 cs.LG 新提交 57%

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

TRACE:通过信用估计进行长期奖励分配的回合级奖励分配

Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 研究针对多轮智能体训练后的信用分配难题,提出TRACE方法,通过特定状态转换、对数概率获取及转换等步骤进行奖励分配。该方法无需额外训练,在长期复杂搜索任务中显著提升基础模型工具使用能力,在基准测试中表现良好且学习曲线更佳。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13158 2026-07-16 cs.CL 新提交 57%

Do LLMs Need Architectural Changes for Simultaneous Speech Translation? A Prefix-to-Prefix Data Driven Approach

语言模型进行同步语音翻译需要架构改变吗?一种前缀到前缀的数据驱动方法

Junkun Chen, Jian Xue, Ming Tang, Abdel Heba, Hoda Gholami, Ruchao Fan, Jinyu Li

机构 * Microsoft(微软)

专题命中 指令微调 :LLM(abstract);分类 cs.CL

AI总结 研究同步语音翻译中仅解码器语言模型面临的挑战,提出基于固定长度块、回退前缀及教师标记前缀到前缀目标的CSSEL-P2P方法,经实验其在可比延迟下提升了流质量,证明无需架构改变可有效实现同步语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 8 篇

2607.13430 2026-07-16 cs.CL 新提交 93%

Exploring Post-Training Alignment of Small Language Models for Biomedical Data-to-Text Generation: A Case Study of Medication Leaflet

探索用于生物医学数据到文本生成的小语言模型的训练后对齐:以药品说明书为例

Xi Yang, Guodong Liu, Chuqin Li, Fan Wu, Ergin Soysal, Min Jiang, Xing He, Jiang Bian, Yi Guo, Shams Zaman, Thomas Fuchs, Todd Sanger, Yonghui Wu

专题命中 后训练与偏好优化 :language model(title,abstract);small language model(title,abstract);post-training(title,abstract);SFT(abstract,abstract_cn)

AI总结 该研究对生物医学数据到文本生成任务训练小语言模型的方法进行比较分析,在药品说明书数据集上用基于Qwen的SLMs探索多种训练后方法,通过整理数据评估模型,结果显示对齐后的SLMs性能优异,GRPO跨数据集性能最稳健。

Comments 10 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11686 2026-07-16 cs.LG cs.AI 版本更新 88%

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

基于表示的语言模型探索:从测试时到训练后

Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 后训练与偏好优化 :language model(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。

Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13952 2026-07-16 cs.SD cs.AI eess.AS 版本更新 87%

LLM-Guided Reinforcement Learning for Audio-Visual Speech Enhancement

基于大语言模型的强化学习音频视觉语音增强

Chih-Ning Chen, Jen-Cheng Hou, Hsin-Min Wang, Shao-Yi Chien, Yu Tsao, Fan-Gang Zeng

机构 * Department of Electrical Engineering, National Taiwan University, Taiwan(台湾大学电子工程系) Research Center for Information Technology Innovation, Academia Sinica, Taiwan(中央研究院资讯科技创新研究中心) Center for Hearing Research, University of California Irvine, USA(加州大学尔湾分校听力研究中心)

专题命中 后训练与偏好优化 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的可解释奖励模型的音频视觉语音增强框架,利用语言模型生成语音增强的自然语言描述,并通过情感分析模型转换为评分作为PPO奖励,提升语音质量评估效果。

Comments 6 pages, 4 figures, Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 86%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13389 2026-07-16 cs.LG cs.CL 新提交 84%

Where Should RL Post-Training Compute Go? Model Size, Search, Learning, and Feedback

强化学习训练后计算资源应投向何处?模型大小、搜索、学习与反馈

Patrick Wilhelm, Odej Kao

机构 * Technische Universität Berlin(柏林工业大学)

专题命中 后训练与偏好优化 :post-training(title,abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 研究强化学习训练后计算资源分配问题,引入浮点运算核算框架,通过LoRA适配的Qwen2.5策略发现条件分配前沿,揭示模型选择与训练分配关联及奖励系统对核算影响,提出RACE协议,建议相关论文报告总浮点运算及计算分配方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13323 2026-07-16 cs.CV 新提交 67%

SARFA: Segment Anything with Radiomic Feature Alignment

SARFA:基于放射组学特征对齐的任意分割

Tyler Ward, Abdullah Imran

机构 * University of Kentucky(肯塔基大学)

专题命中 后训练与偏好优化 :preference optimization(abstract);prompting(abstract)

AI总结 针对医学成像中目标分割模糊问题,提出SARFA框架,通过概率性提示生成掩码,基于弗雷歇放射组学距离和直接偏好优化进行训练,在CT和MRI基准测试中优于现有方法,有效提升医学图像分割效果。

Comments 15 pages, 9 figures, 5 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13866 2026-07-16 cs.CY econ.GN q-fin.EC 版本更新 67%

AI Alignment Amplifies the Role of Race, Gender, and Disability in Hiring Decisions

人工智能对齐放大了种族、性别和残疾在招聘决策中的作用

Ze Wang, Guobin Shen, Michael Thaler

专题命中 后训练与偏好优化 :language model(abstract);post-training(abstract)

AI总结 研究探讨语言模型在招聘决策中是否使用人口统计数据,发现对女性和黑人候选人有优势,对残疾候选人有劣势,且对齐过程放大了这些差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13931 2026-07-16 cs.CV 新提交 50%

SIVA-RL: Sensitivity-Invariance Visual Alignment for Multimodal Reinforcement Learning

SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐

Cheng Tang, Junzhi Ning, Min Cen, Wei Li, Xinyi Zeng, Pinxian Zeng, Rongbin Li, Qiming Zhu, Yuqiang Li, Junjun He, Yirong Chen, Ming Hu

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of Macau(澳门大学)

专题命中 后训练与偏好优化 :language model(abstract)

AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。

Comments 27 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 7 篇

2607.13591 2026-07-16 cs.CL cs.AI 新提交 91%

Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents

作为受控过程的记忆:为大语言模型智能体学习自适应内存管理

Eric Hanchen Jiang, Zhi Zhang, Yuchen Wu, Levina Li, Dong Liu, Xiao Liang, Rui Sun, Yubei Li, Edward Sun, Haozheng Luo, Zhaolu Kang, Aylin Caliskan, Kai-Wei Chang, Ying Nian Wu

机构 * University of California Los Angeles(加利福尼亚大学洛杉矶分校) University of Washington(华盛顿大学) Northwestern University(西北大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究LLM智能体内存管理问题,提出MemCon框架将内存操作建模为马尔可夫决策过程,通过在线策略自适应管理内存,该框架与后端无关,实验表明其在多基准测试中优于基线,提升任务成功率并减少令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05969 2026-07-16 cs.CL 版本更新 88%

MemDefrag: Latent Memory Defragmentation for Large Language Models

MemDefrag:大语言模型的潜在内存碎片整理

Ruiyi Yan, Zhuoyuan Mao, Yiwen Guo

机构 * Kyoto University(京都大学) LIGHTSPEED Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对大语言模型潜在内存更新时因编码问题致性能降,提出MemDefrag框架,利用中间层追踪信号整理内存碎片、超容时用信息引导遗忘机制,实验显示其在知识保留等方面优于其他模型且泛化性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15026 2026-07-16 cs.OS cs.AI cs.PF 版本更新 88%

TuxBot: Semantic-Aware Online OS Tuning with Large Language Models

SemaTune: 基于大语言模型的语义感知在线操作系统调优

Georgios Liargkovas, Mihir Nitin Joshi, Hubertus Franke, Kostis Kaffes

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 SemaTune通过语义感知的在线操作系统调优框架,利用大语言模型进行有限制的指导,提升稳定状态下的性能,通过快速和慢速循环更新配置并验证,实现比传统方法更高的性能提升。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11076 2026-07-16 cs.DC 版本更新 83%

SmartSwap: Swap-Based Memory Optimization for LLM Training under Varying Operator Sequences

SmartSwap:在不同算子序列下基于交换的大语言模型训练内存优化

Zibo Wang, Yuhang Zhou, Zhibin Wang, Shipeng Li, Xinjing Huang, Chendong Cai, Bingxu Mu, Yuqing Sun, Zhiheng Hu, Bin She, Shu You, Guanghuan Fang, Rong Gu, Wanchun Dou, Guihai Chen, Chen Tian

专题命中 长上下文与记忆 :LLM(title,comments);large language model(abstract);language model(abstract)

AI总结 针对大语言模型训练内存需求大问题,提出Chameleon方法,通过引入轻量级在线分析器、生成有效交换策略及优化执行模块,能降低分析开销,适应算子序列变化,提升训练模型性能。

Comments Accepted to DAC 2026. Previously titled "Chameleon: Taming Dynamic Operator Sequences for Memory-Intensive LLM Training."

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13285 2026-07-16 cs.AI cs.SE 新提交 77%

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

Harness手册:使不断演进的智能体框架具有可读性、可导航性和可编辑性

Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang

机构 * Tencent(腾讯) Indiana University(印第安纳大学) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 研究智能体框架演进中行为定位难的问题,提出通过Harness手册和行为引导的渐进式披露,以行为为中心自动合成框架表示并辅助规划,提高行为定位和编辑计划质量,助力复杂智能体系统发展。

Comments 29 pages, 6 figures. Project page: https://ruhan-wang.github.io/Harness-Handbook/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02023 2026-07-16 cs.CL cs.AI 版本更新 73%

Not All Needles Are Found: How Fact Distribution and Don't Make It Up Prompts Shape Retrieval, Reasoning, and Hallucination in Long-Context LLMs

并非所有线索都能被发现:事实分布和“不要编造”提示如何影响长上下文语言模型中的检索、推理和幻觉

Amirali Ebrahimzadeh, Seyyed M. Salili

机构 * Department of Electrical Engineering & Computer Science University of Michigan(电气工程与计算机科学系 密歇根大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型中事实分布和反幻觉提示对检索、推理及幻觉的影响,通过扩展基准评估多个模型,识别出分布崩溃和安全代价两种失败模式,发现许多失败源于无效上下文利用,强调特定模型稳健性和上下文管理的重要性。

Comments 16 pages, 8 figures, 2 tables. Accepted at the FAGEN Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08448 2026-07-16 cs.RO 版本更新 50%

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 27 篇

2607.13072 2026-07-16 cs.RO cs.AI eess.SP 新提交 92%

HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models

HRO:用于基于大语言模型的零样本目标导航的分层房间到物体框架

Luyuan Jia, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 针对零样本目标导航问题,提出LLM驱动的分层房间到物体(HRO)框架,引导智能体粗到细探索导航至目标物体,实验表明该框架在Gibson和HM3D数据集上优于现有基于LLM的方法。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12811 2026-07-16 cs.CL cs.AI q-bio.NC 版本更新 90%

Left-right asymmetry in predicting brain activity from LLMs' representations emerges with their formal linguistic competence

在LLM表示中预测脑活动的左右不对称性随着其正式语言能力的出现而出现

Laurent Bonnasse-Gahot, Christophe Pallier

机构 * Centre d’Analyse et de Mathématique Sociales CNRS, EHESS, Paris, France(分析与数学社会中心 CNRS,EHESS,巴黎,法国) Cognitive Neuroimaging Unit CNRS, INSERM, CEA, Neurospin Center, 91191 Gif-sur-Yvette, France(认知神经成像单元 CNRS,INSERM,CEA,Neurospin中心,法国91191 Gif-sur-Yvette)

专题命中 推理与问题求解 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究发现LLM的正式语言能力与大脑预测活动的左右不对称性同步发展,且与算术或世界知识任务无关。

Journal ref Neurobiology of Language 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13248 2026-07-16 cs.CL 新提交 89%

GSM-Plus-BN: A Perturbation-Based Benchmark for Bangla Mathematical Reasoning in Large Language Models

GSM-Plus-BN:大语言模型中孟加拉语数学推理的基于扰动的基准测试

Bidyarthi Paul, Nahida Jannat Mayouree, Md. Asif Karim, Sagar Chandra Nath, Swastika Kundu

机构 * Southeast University(东南大学) Ahsanullah University of Science and Technology(阿山努拉科技大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 研究针对大语言模型中孟加拉语数学推理评估缺乏的问题,引入GSM-Plus-BN数据集,用9000个样本评估六个开源LLMs,对比标准提示和思维链提示,发现大模型鲁棒性好,思维链提示有提升,但与英语基准有差距,为相关研究提供新资源和基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04197 2026-07-16 cs.CL cs.AI 88%

Large Language Models are In-Context Molecule Learners

大语言模型是上下文分子学习者

Jiatong Li, Wei Liu, Zhihao Ding, Wenqi Fan, Yuqiang Li, Qing Li

机构 * Department of Computing, The Hong Kong Polytechnic University(计算机系,香港理工大学) Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 ICMA通过上下文分子微调使LLMs无需额外训练即可实现分子-文本对齐,证明LLMs具备上下文分子学习能力。

Comments Accepted by IEEE TKDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 88%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 推理与问题求解 :large language model(title);language model(title);foundation model(abstract);prompting(abstract)

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-07-16 cs.AI 版本更新 88%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13860 2026-07-16 cs.CV 新提交 88%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract)

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13394 2026-07-16 cs.CL cs.LG 新提交 87%

GFlowRL: Scaling Distribution-Matching RL to Large Language Models

GFlowRL:将分布匹配强化学习扩展到大型语言模型

Xiaodong Liu, Michael Xu, Jack W. Stokes, Paul Smolensky, Doug Burger, Jianfeng Gao

机构 * Microsoft Research(微软研究院)

专题命中 推理与问题求解 :large language model(title);language model(title);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究旨在将GFlowNet风格的RL扩展到大型语言模型,提出GFlowRL算法,去除辅助分区网络,用批内蒙特卡罗估计替代学习的分区函数,并通过两个稳定器实现奖励分布匹配,在多个基准测试中表现出色,能稳定扩展到不同架构。

Comments 31 pages, 8 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏