arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-20 至 2026-03-20 共收录 263 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 14 篇

2603.18641 2026-03-20 cs.CL 57%

A Comparative Empirical Study of Catastrophic Forgetting Mitigation in Sequential Task Adaptation for Continual Natural Language Processing Systems

连续自然语言处理系统中序列任务适应中灾难性遗忘缓解的比较实证研究

Aram Abrahamyan, Sachin Kumar

机构 * Zaven P. and Sonia Akian College of Science and Engineering(泽文·皮和索尼亚·阿基安科学与工程学院) American University of Armenia(亚美尼亚美国大学) Yerevan(亚美尼亚共和国首都耶莱范) Armenia(亚美尼亚)

专题命中 指令微调 :language model(abstract);分类 cs.CL

AI总结 本文通过CLINC150数据集,比较了三种连续学习策略在连续意图分类中的表现,发现MIR是最可靠的策略,组合策略在不同架构上表现各异,揭示了连续学习机制与架构联合选择的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18544 2026-03-20 eess.IV cs.AI cs.CV 57%

SCISSR: Scribble-Conditioned Interactive Surgical Segmentation and Refinement

SCISSR:基于涂鸦的交互式手术分割与细化

Haonan Ping, Jian Jiang, Cheng Yuan, Qizhen Sun, Lv Wu, Yutong Ban

机构 * Global College, Shanghai Jiao Tong University, Shanghai, China(上海交通大学全球学院,上海,中国)

专题命中 指令微调 :prompting(abstract);分类 cs.AI

AI总结 SCISSR通过轻量级涂鸦编码器将自由手绘涂鸦转换为密集提示嵌入,实现手术场景分割的交互式迭代细化,优于点提示方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13032 2026-03-20 cs.CV 50%

Multimodal OCR: Parse Anything from Documents

多模态OCR:从文档中解析一切

Handong Zheng, Yumeng Li, Kaile Zhang, Liang Xin, Guangwei Zhao, Hao Liu, Jiayu Chen, Jie Lou, Qi Fu, Rui Yang, Shuo Jiang, Weijian Luo, Weijie Su, Weijun Zhang, Xingyu Zhu, Yabin Li, Yiwei ma, Yu Chen, Yuqiu Ji, Zhaohui Yu, Guang Yang, Colin Zhang, Lei Zhang, Yuliang Liu, Xiang Bai

机构 * Huazhong University of Science and Technology(华中科技大学) hi lab, Xiaohongshu Inc(小红书实验室,小红书公司)

专题命中 指令微调 :pretraining(abstract)

AI总结 本文提出多模态OCR(MOCR),通过联合解析文本和图形,生成统一的文本表示。方法将图表、表格等视觉元素作为解析目标,提升文档重建的准确性,并通过端到端训练实现跨模态监督,最终在文档和结构化图形解析任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09658 2026-03-20 cs.CV 50%

Image2Garment: Simulation-ready Garment Generation from a Single Image

Image2Garment: 从单张图像生成可模拟的服装

Selim Emir Can, Jan Ackermann, Kiyohiro Nakayama, Ruofan Liu, Tong Wu, Yang Zheng, Hugo Bertiche, Menglei Chai, Thabo Beeler, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google(谷歌) Institute of Science Tokyo(东京科学研究所)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出一种框架,通过微调视觉语言模型获取材料属性,再训练轻量预测模型生成物理参数,实现从单张图像生成可模拟的服装。

Comments Project Page: https://image2garment.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 后训练与偏好优化 9 篇

2603.18606 2026-03-20 cs.SE 92%

SQL-Commenter: Aligning Large Language Models for SQL Comment Generation with Direct Preference Optimization

SQL-Commenter: 通过直接偏好优化对齐大型语言模型以生成SQL注释

Lei Yu, Peng Wang, Jingyuan Zhang, Xin Wang, Jia Xu, Li Yang, Changzhi Deng, Jiajia Ma, Fengjun Zhang

专题命中 后训练与偏好优化 :large language model(title,abstract);language model(title,abstract);preference optimization(title,abstract);LLM(abstract)

AI总结 本文提出SQL-Commenter,通过构建复杂SQL查询数据集、持续预训练和直接偏好优化,提升SQL注释生成的准确性和质量,在Spider和Bird基准测试中优于现有方法。

Comments Accepted to ICPC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18773 2026-03-20 cs.LG cs.AI 88%

Automatic Configuration of LLM Post-Training Pipelines

大语言模型后训练流程的自动配置

Channe Chwa, Xinle Wu, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

专题命中 后训练与偏好优化 :LLM(title,abstract);post-training(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoPipe框架,通过学习历史运行数据和贝叶斯优化,有效配置大语言模型后训练流程,减少计算成本并提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18411 2026-03-20 cs.CL cs.AI cs.LG 88%

TARo: Token-level Adaptive Routing for LLM Test-time Alignment

TARo: 令牌级自适应路由用于大语言模型测试时间对齐

Arushi Rai, Qiang Zhang, Hanqing Zeng, Yunkai Zhang, Dipesh Tamboli, Xiangjun Fan, Zhuokai Zhao, Lizhu Zhang

机构 * Meta University of Pittsburgh(匹兹堡大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 后训练与偏好优化 :LLM(title);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 TARo通过令牌级自适应路由在推理时引导冻结的LLM进行结构化推理,提升推理性能达22.4%,并在医疗和指令遵循任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18736 2026-03-20 cs.LG cs.AI cs.CL stat.ML 87%

CausalRM: Causal-Theoretic Reward Modeling for RLHF from Observational User Feedbacks

CausalRM:基于观察性用户反馈的因果理论奖励建模用于RLHF

Hao Wang, Licheng Pan, Zhichao Chen, Chunyuan Zheng, Zhixuan Chu, Xiaoxi Li, Yuan Lu, Xinggao Liu, Haoxuan Li, Zhouchen Lin

机构 * Peking University(北京大学) Xiaohongshu Inc.(小红书公司) Zhejiang University(浙江大学)

专题命中 后训练与偏好优化 :RLHF(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CausalRM框架,通过因果理论处理观察性用户反馈中的噪声和偏见问题,提升RLHF任务性能,实验显示在WildGuardMix和HarmBench上分别提升49.2%和32.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18258 2026-03-20 cs.LG cs.AI 86%

Sharpness-Aware Minimization in Logit Space Efficiently Enhances Direct Preference Optimization

在对数空间中进行锐度感知最小化以高效提升直接偏好优化

Haocheng Luo, Zehang Deng, Thanh-Toan Do, Mehrtash Harandi, Dinh Phung, Trung Le

机构 * Monash University(墨尔本大学) Swinburne University of Technology(斯威本科技大学)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出logits-SAM方法,通过在对数空间中建模坐标动态,缓解直接偏好优化中的挤压效应,提升模型性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18850 2026-03-20 cs.CV 78%

HORNet: Task-Guided Frame Selection for Video Question Answering with Vision-Language Models

HORNet:基于任务引导的帧选择用于视觉语言模型的视频问答

Xiangyu Bai, Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 后训练与偏好优化 :language model(title,abstract)

AI总结 HORNet通过轻量级策略优化,显著减少视频输入帧数和VLM处理时间,同时提升问答质量与时间推理任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18756 2026-03-20 cs.LG cs.AI cs.CL 75%

Are complicated loss functions necessary for teaching LLMs to reason?

复杂损失函数是否必要用于教LLM进行推理?

Gabriele Carrino, Andrea Sassella, Nicolo Brunello, Federico Toschi, Mark James Carman

机构 * DEIB, Politecnico di Milano(米兰理工学院DEIB学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过分析GRPO发现负反馈对训练至关重要,PPO风格约束非必需,提出简化版RGRA在数学基准上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18683 2026-03-20 cs.LG cs.AI cs.CL 75%

HISR: Hindsight Information Modulated Segmental Process Rewards For Multi-turn Agentic Reinforcement Learning

HISR: 基于 hindsight 信息的分段过程奖励用于多轮代理强化学习

Zhicong Lu, Zichuan Lin, Wei Jia, Changyuan Tian, Deheng Ye, Peiguang Li, Li Jin, Nayu Liu, Guangluan Xu, Wei Feng

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院航空航天信息研究所) University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯文脉) School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出HISR方法,通过hindsight信息调节分段过程奖励,提升多轮代理强化学习中的信用分配可靠性,实验验证了方法的有效性。

Comments Submitted to ACL 2026 on Jan 5, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26642 2026-03-20 cs.RO 75%

MLA: A Multisensory Language-Action Model for Multimodal Understanding and Forecasting in Robotic Manipulation

MLA:一种多感官语言-动作模型,用于机器人操作中的多模态理解和预测

Zhuoyang Liu, Jiaming Liu, Jiadong Xu, Nuowei Han, Chenyang Gu, Hao Chen, Kaichen Zhou, Renrui Zhang, Kai Chin Hsieh, Kun Wu, Zhengping Che, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机科学学院,北京大学) Beijing Innovation Center of Humanoid Robotics (X-Humanoid)(北京类人机器人创新中心(X-Humanoid)) The Chinese University of Hong Kong (CUHK)(香港中文大学(CUHK))

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出MLA模型,通过多感官融合与未来目标预测,提升机器人在复杂接触任务中的操控能力,实验显示其在2D和3D任务中性能优于现有方法。

Comments Project page: https://robotic-mla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 长上下文与记忆 15 篇

2603.18740 2026-03-20 cs.SE cs.AI cs.CR 85%

Measuring and Exploiting Confirmation Bias in LLM-Assisted Security Code Review

衡量和利用LLM辅助安全代码审查中的确认偏见

Dimitris Mitropoulos, Nikolaos Alexopoulos, Georgios Alexopoulos, Diomidis Spinellis

机构 * University of Athens(雅典大学) National Infrastructures for Research(研究与技术国家基础设施) Athens University of Economics and Business(雅典经济与商业大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究LLM在安全代码审查中是否存在确认偏见及其对漏洞检测的影响,并通过实验验证偏见在软件供应链攻击中的可利用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18489 2026-03-20 cs.CL 83%

EntropyCache: Decoded Token Entropy Guided KV Caching for Diffusion Language Models

EntropyCache: 基于解码令牌熵的KV缓存用于扩散语言模型

Minsoo Cheong, Donghyun Son, Woosang Lim, Sungjoo Yoo

机构 * Seoul National University(首尔国立大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 EntropyCache利用解码令牌熵指导KV缓存,通过最大熵信号决定是否重新计算,实现高效缓存更新,提升推理速度和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18480 2026-03-20 cs.CV cs.AI cs.HC 83%

Do Vision Language Models Understand Human Engagement in Games?

视觉语言模型是否能理解游戏中的玩家参与度?

Ziyi Wang, Qizan Guo, Rishitosh Singh, Xiyang Hu

机构 * University of Maryland, College Park(马里兰大学学院公园分校) University of Southern California(南加州大学) Arizona State University(亚利桑那州立大学)

专题命中 长上下文与记忆 :language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 研究评估了三种视觉语言模型在不同提示策略下的表现,发现零样本预测效果差,而基于理论的提示策略难以有效提升参与度预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19138 2026-03-20 cs.AI cs.CR cs.SE 79%

Implicit Patterns in LLM-Based Binary Analysis

基于LLM的二进制分析中的隐式模式

Qiang Li, XiangRui Zhang, Haining Wang

机构 * Beijing Jiaotong University(北京交通大学)

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 研究揭示了基于LLM的多轮二进制漏洞分析中隐式形成的结构化模式,包括早期剪枝、路径依赖锁定、目标回溯和知识引导优先级,为构建更可靠的分析系统提供了基础。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09022 2026-03-20 cs.AI 79%

MEMO: Memory-Augmented Model Context Optimization for Robust Multi-Turn Multi-Agent LLM Games

MEMO: 带记忆的模型上下文优化用于鲁棒的多轮多智能体大语言模型游戏

Yunfei Xie, Kevin Wang, Bobby Cheng, Jianzhu Yao, Zhizhou Sha, Alexander Duffy, Yihan Xi, Hongyuan Mei, Cheston Tan, Chen Wei, Pramod Viswanath, Zhangyang Wang

机构 * Rice University(里士满大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Princeton University(普林斯顿大学) A*STAR Good Start Labs TTIC

专题命中 长上下文与记忆 :LLM(title,abstract);分类 cs.AI

AI总结 MEMO通过优化推理时的上下文,结合记忆保留和探索,提升了多轮多智能体大语言模型游戏的鲁棒性和性能,显著提高了胜率并降低了运行间方差。

Comments Code has been released https://github.com/openverse-ai/MEMO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18330 2026-03-20 cs.AI cs.HC cs.LG cs.MA 79%

MemArchitect: A Policy Driven Memory Governance Layer

MemArchitect:一种基于策略的记忆管理层

Lingavasan Suresh Kumar, Yang Ba, Rong Pan

机构 * Arizona State University(亚利桑那州立大学)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MemArchitect通过引入规则化的记忆治理机制,解决大语言模型代理中的内存管理问题,提升自主系统可靠性和安全性。

Comments This is an on going research work and will be updated periodically

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18096 2026-03-20 cs.MA cs.AI 77%

A Trace-Based Assurance Framework for Agentic AI Orchestration: Contracts, Testing, and Governance

基于跟踪的代理AI编排保证框架:合同、测试与治理

Ciprian Paduraru, Petru-Liviu Bouruc, Alin Stefanescu

机构 * University of Bucharest Romania University of Bucharest \& Institute for Logic

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种基于跟踪的代理AI编排保证框架,通过显式步骤和跟踪合同进行执行仪器化,支持机器可验证的判定和确定性回放,同时提供压力测试和结构化故障注入以评估在现实故障和退化条件下的容错能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20651 2026-03-20 cs.AI 77%

Memory Bear AI A Breakthrough from Memory to Cognition Toward Artificial General Intelligence

记忆熊AI:从记忆到认知迈向通用人工智能的突破

Deliang Wen, Ke Sun

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Memory Bear系统,通过整合多模态感知、动态记忆维护和适应性认知服务,提升LLM的记忆机制,实现跨领域知识准确性和检索效率的提升,减少幻觉并增强推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01242 2026-03-20 cs.CL cs.AI cs.IT cs.LG math.IT 75%

Redundancy-as-Masking: Formalizing the Artificial Age Score (AAS) to Model Memory Aging in Generative AI

冗余作为遮蔽:形式化人工年龄评分(AAS)以建模生成AI中的记忆老化

Seyma Yaman Kayadibi

机构 * Victoria University(维多利亚大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出人工年龄评分(AAS)作为衡量生成AI记忆老化的新指标,通过结构不对称性分析,揭示模型在持续交互中的记忆保持与重置后的老化现象。

Comments 37 pages, 17 figures. Includes theoretical development and mathematical proofs of the Artificial Age Score (AAS), with empirical illustrations via ChatGPT-based memory recall experiments

Journal ref Frontiers in Artificial Intelligence 9 (2026), 1732691

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18631 2026-03-20 cs.AI 74%

D-Mem: A Dual-Process Memory System for LLM Agents

D-Mem:一种用于LLM代理的双过程记忆系统

Zhixing You, Jiachen Yuan, Jason Cai

机构 * Einstein Institute of Mathematics(爱因斯坦数学研究所) The Hebrew University of Jerusalem(耶路撒冷希伯来大学) AWS AI(AWS人工智能)

专题命中 长上下文与记忆 :LLM(title);分类 cs.AI

AI总结 本文提出D-Mem双过程记忆系统,通过轻量向量检索与全面深入模块结合,提升长期推理准确性,实验表明其在LoCoMo基准上F1得分达53.5,优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18743 2026-03-20 cs.AI cs.CL cs.LG 67%

Memento-Skills: Let Agents Design Agents

Memento-Skills:让代理设计代理

Huichi Zhou, Siyuan Guo, Anjie Liu, Zhongwei Yu, Ziqin Gong, Bowen Zhao, Zhixun Chen, Menglong Zhang, Yihang Chen, Jinsong Li, Runyu Yang, Qiangbin Liu, Xinlei Yu, Jianmin Zhou, Na Wang, Chunyang Sun, Jun Wang

机构 * Memento-Team(Memento团队)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Memento-Skills是一种能够持续学习的通用大语言模型代理系统,通过经验自主构建、适应和改进任务特定代理,利用状态提示的强化学习框架和可重用的技能库实现持续学习。

Comments Memento-Skills Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15411 2026-03-20 cs.DC 67%

Sparse Checkpointing for Fast and Reliable MoE Training

稀疏检查点机制用于快速可靠的MoE训练

Swapnil Gandhi, Christos Kozyrakis

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)

AI总结 本文提出MoEvement系统,通过稀疏检查点、稀疏到密集转换和激活日志记录,有效降低MoE模型训练中的检查点开销和恢复开销,提升训练效率。

Comments NSDI'26 | Camera-Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18718 2026-03-20 cs.AI 57%

MemMA: Coordinating the Memory Cycle through Multi-Agent Reasoning and In-Situ Self-Evolution

MemMA:通过多智能体推理和现场自进化协调内存循环

Minhua Lin, Zhiwei Zhang, Hanqing Lu, Hui Liu, Xianfeng Tang, Qi He, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊) Microsoft(微软)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.AI

AI总结 MemMA通过多智能体推理和现场自进化协调内存循环,解决内存循环正向路径的战略盲区和反向路径的稀疏延迟监督问题,提升长周期交互性能。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00030 2026-03-20 cs.LG 57%

Modality Equilibrium Matters: Minor-Modality-Aware Adaptive Alternating for Cross-Modal Memory Enhancement

模态均衡至关重要:面向跨模态记忆增强的次要模态感知自适应交替方法

Xiang Shi, Rui Zhang, Jiawei Liu, Yinpeng Liu, Qikai Cheng, Wei Lu

机构 * School of Information Management, Wuhan University(武汉大学信息管理学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.LG

AI总结 本文提出一种基于Shapley值的自适应交替训练框架,通过优先考虑次要模态平衡融合,引入记忆模块和跨模态映射机制,提升多模态学习性能,在四个基准数据集上取得SOTA结果。

Comments Accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19137 2026-03-20 cs.CV cs.RO 50%

GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning

GSMem: 3D高斯溅射作为持久空间记忆用于零样本具身探索与推理

Yiren Lu, Yi Du, Disheng Liu, Yunlai Zhou, Chen Wang, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) Spatial AI & Robotics (SAIR) Lab, University at Buffalo(布法罗大学空间人工智能与机器人实验室)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出GSMem框架,利用3D高斯溅射构建持久空间记忆,解决具身探索中空间知识遗忘问题,通过检索机制与混合探索策略提升视觉语言模型推理效果。

Comments Project page at https://vulab-ai.github.io/GSMem/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理与问题求解 38 篇

2503.16252 2026-03-20 cs.CL 90%

Fin-R1: A Large Language Model for Financial Reasoning through Reinforcement Learning

Fin-R1:通过强化学习构建的金融推理大语言模型

Zhaowei Liu, Xin Guo, Zhi Yang, Fangqi Lou, Lingfeng Zeng, Jinyi Niu, Mengping Li, Qi Qi, Zhiqiang Liu, Yiyang Han, Dongpo Cheng, Ronghao Chen, Huacan Wang, Xingdong Feng, Huixia Judy Wang, Chengchun Shi, Liwen Zhang

机构 * School of Statistics and Data Science, Shanghai University of Finance and Economics, China(上海金融学院统计与数据科学学院,中国) School of Mathematical Sciences, Fudan University, China(复旦大学数学科学学院,中国) School of Economics, Shanghai University of Finance and Economics, China(上海金融学院经济学院,中国) AI Finance Development and Service Center, Shanghai University of Finance and Economics, China(上海金融学院人工智能金融发展与服务中心,中国) QuantaAlpha, China(QuantaAlpha,中国) Department of Statistics, Rice University, USA(里士满大学统计学系,美国) Department of Statistics, London School of Economics and Political Science, UK(伦敦政治经济学院统计学系,英国) Qinghai Provincial Key Laboratory of Big Data in Finance and Artificial Intelligence Application Technology, Qinghai Institute of Technology, China(青海省大数据在金融与人工智能应用技术重点实验室,青海技术学院,中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 Fin-R1通过强化学习方法,解决金融领域推理问题,具备高精度和可解释性,适用于合规检查和智能投顾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18118 2026-03-20 cs.CV cs.AI cs.LG 90%

Insight-V++: Towards Advanced Long-Chain Visual Reasoning with Multimodal Large Language Models

Insight-V++: 向多模态大语言模型实现高级长链视觉推理迈进

Yuhao Dong, Zuyan Liu, Shulin Tian, Yongming Rao, Ziwei Liu

机构 * S-Lab(S实验室) Nanyang Technological University(南洋理工大学) Tencent Hunyuan(腾讯文言) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Insight-V++框架,通过多代理视觉推理系统提升多模态大语言模型的长链视觉推理能力,采用ST-GRPO和J-GRPO算法增强空间时间推理和评估鲁棒性,实验显示在图像和视频推理任务中性能显著提升。

Comments arXiv admin note: text overlap with arXiv:2411.14432

详情

展开后加载摘要…

URL PDF HTML 收藏