arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-07 至 2026-08-07 共收录 123 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 7 篇

2608.05000 2026-08-07 cs.CV cs.LG cs.MM 版本更新 83%

Towards Physics of Multimodal Pretraining: Knowledge Flow, Modality Synergy, Early Unification, and Recipes

迈向多模态预训练的物理学:知识流、模态协同、早期统一与方法指南

Junlin Han, Shengbang Tong, David Fan, Minghao Chen, Philip Torr, Filippos Kokkinos, Mike Lewis

机构 * FAIR, Meta(Meta FAIR研究院) Reality Labs, Meta(Meta Reality Labs) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 该研究探索多模态预训练的机制,得出知识流、模态协同等四个关键见解,推导高效预训练方法,为多模态预训练的理解与扩展提供基础。

Comments Project page: https://junlinhan.github.io/projects/physics_of_mm_pretrain/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03949 2026-08-07 cs.CV cs.LG 版本更新 83%

TESSERA v2: Scaling Pixel-wise Earth Foundation Models

TESSERA v2:扩展逐像素地球基础模型

Zhengpeng Feng, Sadiq Jaffer, Ira Shokar, Jovana Knezevic, James Ball, Pedro Sousa, Mark Elvers, Madeline Lisaius, Clement Atzberger, Robin Young, Aneesh Naik, Niall Robinson, David Coomes, Anil Madhavapeddy, Srinivasan Keshav

机构 * University of Cambridge(剑桥大学) NVIDIA(英伟达) dClimate Labs(dClimate实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 研究逐像素地球观测基础模型的扩展及预训练预算分配,通过大规模实验发现预训练损失难预测下游性能,给出计算分配规则,训练并蒸馏模型,其成果优于其他模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04884 2026-08-07 cs.CL 版本更新 81%

Building Open-Retrieval Conversational Question Answering Systems by Generating Synthetic Data and Decontextualizing User Questions

通过生成合成数据和去语境化用户问题构建开放检索式对话问答系统

Christos Vlachos, Nikolaos Stylianou, Alexandra Fiotaki, Spiros Methenitis, Elisavet Palogiannidi, Themos Stafylakis, Ion Androutsopoulos

机构 * Department of Informatics, Athens University of Economics and Business(雅典经济与商业大学信息学院) Omilia - Conversational Intelligence(Omilia-对话智能) Archimedes, Athena Research Center(雅典研究中心Archimedes) NCSR Demokritos(德摩斯蒂斯国家研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);分类 cs.CL

AI总结 针对开放检索式对话问答数据集获取困难的问题,提出基于组织纯文本文档生成合成带标注对话的流程,训练问题重写器去语境化用户问题,结合LLM构建OR-CONVQA系统。

Comments Accepted at SIGDIAL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15557 2026-08-07 cs.CL 版本更新 79%

SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents

SkillCorpus:整合与评估面向现实世界大语言模型智能体的开放技能生态系统

Yanze Wang, Pengfei Yao, Tianyi Sun, Chuanrui Hu, Yan Xiao, Xiaotian Luo, Yunyun Han, Yifan Chen, Jun Sun, Yafeng Deng

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型智能体技能文件碎片化等问题,提出SkillCorpus框架,通过多阶段管道过滤技能并与检索选择堆栈配对,经多基准端到端评估,整合该框架能带来一致收益,明确了其对实际智能体任务的作用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16278 2026-08-07 cs.CV cs.AI 版本更新 70%

RealityBridge: Bridging Editable 3D Gaussian Splatting Driving Simulations and Real-World Videos

RealityBridge: 连接可编辑3D高斯泼溅驾驶模拟与现实世界视频

Zhenhua Wu, Yun Pang, Mingkun Chang, Yuwei Ning, Liangzhi Wang, Yi Xiao, Guanbin Li

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Key Laboratory of Machine Intelligence and Advanced Computing, Ministry of Education(教育部机器智能与先进计算重点实验室)

专题命中 预训练与数据 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出RealityBridge框架,利用多模态控制和轻量级GateNet,结合自回归长视频训练与奖励引导后训练,缩小编辑后3DGS驾驶视频的Sim-to-Real差距,提升视觉真实感和时间一致性。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03105 2026-08-07 cs.CL 版本更新 57%

HomoEnsNER: Does Language Alignment Outperform Architectural Complexity in Gujarati Named Entity Recognition?

HomoEnsNER:古吉拉特语命名实体识别中语言对齐是否优于架构复杂度?

Chandrakant K. Bhogayata

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 该研究针对古吉拉特语NER,提出同构集成模型HomoEnsNER,经实验证实其F1值优于基线及异构模型,表明语言对齐比架构复杂度更适合低资源印度语言NER。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19880 2026-08-07 cs.RO cs.CV 版本更新 50%

EA-Nav: Learning Safe Visual Navigation Policies with Embodiment Awareness

EA-Nav:通过具身感知学习安全的视觉导航策略

Jialu Zhang, Yong Du, Xianda Guo, Shunwang Sun, Xinqi Liu, Yue Sun, Guodong Lu, Wei Sui, Jituo Li

机构 * Zhejiang University(浙江大学) Wuhan University(武汉大学) Hunan University(湖南大学) D-Robotics(D机器人公司)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 针对跨具身导航挑战,提出基于模仿学习的具身感知导航框架,通过模块化多阶段设计,预训练构建数据集并引入具身几何,微调设计多模态信息注入机制,有效提高不同具身设置下的导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 11 篇

2608.03573 2026-08-07 cs.CL cs.LG 版本更新 92%

SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

SFT冲突,RL共存:大语言模型多任务学习的理论与实证分析

Kejian Zhu, Zhuoran Jin, Shangqing Tu, Hongbang Yuan, Yushi Bai, Kang Liu, Juanzi Li, Jun Zhao

专题命中 指令微调 :SFT(title,title_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 该研究针对大语言模型多任务学习,通过理论与实证分析揭示SFT存在任务冲突而RL可稳定共存的机制,进而提出Parallel-RL范式以解耦多任务训练,提升效率与灵活性。

Comments Code: https://github.com/GaryStack/Parallel-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17852 2026-08-07 cs.LG stat.ML 版本更新 90%

Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently

带RL或SFT的Transformer可证明学习稀疏布尔函数,但方式不同

Bochen Lyu, Yiyang Jia, Xiaohao Cai, Zhanxing Zhu

机构 * School of Electronics and Computer Science, University of Southampton, United Kingdom(南安普顿大学电子与计算机科学学院,英国) Independent Researcher(独立研究员)

专题命中 指令微调 :SFT(title,title_cn);分类 cs.LG

AI总结 本文通过统一分析RL(过程奖励)和SFT微调Transformer学习可递归分解的k-稀疏布尔函数的动态,证明两者都能学习k-PARITY、k-AND、k-OR等函数,但RL同时学习整个CoT链,而SFT逐步学习。

Comments ICML 2026 final version. 50 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02687 2026-08-07 cs.CR cs.SE 版本更新 89%

PolicyGuard: Prompt-Configurable Semantic DLP for LLM Coding Agents

PolicyGuard:面向LLM编码智能体的可配置提示语义数据防泄漏方案

Kyutae Park, Jungwon Kim, Daeyeol Shim

专题命中 指令微调 :LLM(title,title_cn)

AI总结 针对LLM编码智能体的PolicyGuard框架,以自然语言策略文件引导LLM分类用户提示,在冻结测试集和隐藏保留集上表现优异,泛化与跨模型能力突出。

Comments This paper is being withdrawn because it was submitted prior to completion of a required institutional review process. The authors intend to resubmit after the review is complete

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04186 2026-08-07 cs.CL 版本更新 88%

Large Language Models for Low-Resource Languages: A Conceptual Framework for an Electronic Explanatory Dictionary of the Tajik Language

用于低资源语言的大语言模型:塔吉克语电子解释词典的概念框架

Mullosharaf K. Arabov, S. S. Pirov, B. Sultonov

机构 * Kazan Federal University(喀山联邦大学) Tajik National University(塔吉克国立大学)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文针对低资源语言塔吉克语,提出结合LLMs与经典词典方法的电子解释词典概念架构,为相关应用NLP任务提供核心资源,适用于计算语言学等领域从业者。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13227 2026-08-07 cs.CL 版本更新 88%

PolyAlign: Conditional Human-Distribution Alignment

PolyAlign: 条件性人类分布对齐

L. D. M. S. Sai Teja, Ufaq Khan, Sathira Silva, Xiao Wu, Muhammad Haris Khan

机构 * NIT Silchar(印度国立理工学院锡尔恰尔分校) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 指令微调 :SFT(summary_cn,abstract);language model(abstract);post-training(abstract);preference optimization(abstract)

AI总结 提出PolyAlign框架,通过桶感知SFT和人类分布偏好优化,实现语言模型在不同交互上下文中的条件性人类分布对齐,提升自然性和分布忠实度。

Comments 23 pages, 5 Figures, 13 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04872 2026-08-07 cs.CL cs.AI cs.LG 版本更新 83%

A-SR: Self-Evolving Agentic LLMs for Symbolic Regression via Hierarchical Coordination

A-SR:通过分层协调实现符号回归的自进化智能体大语言模型

Wenxiao Zhao, Dong Liu, Kaiyi Xu, Feng Liu, Zhen Zhao, Fei Ben, Shu Wang, Wenhao Li, Ying Nian Wu, Fenghua Ling, Haobo Li, Lei Bai

专题命中 指令微调 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 A-SR是一种自进化智能体框架,通过分层协调实现符号回归,在LLM-SRBench科学领域和真实世界任务上显著提升了符号回归的Acc@0.01和归一化均方误差指标。

Comments 18 pages, 8 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20247 2026-08-07 cs.LG cs.AI cs.CL cs.CV 版本更新 83%

CP-MoE: Consistency-Preserving Mixture-of-Experts for Continual Learning

CP-MoE:一致性保留的混合专家用于持续学习

Yang Liu, Toan Nguyen, Flora D. Salim

机构 * School of Computer Science and Engineering University of New South Wales(计算机科学与工程学院 新南威尔士大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CP-MoE,一种基于瞬时专家的持续学习框架,通过一致性保留的路由偏置和瞬时专家引导的正则化机制,减少参数干扰和遗忘,同时保留跨任务知识转移。

Comments Accepted at CoLLAs 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00023 2026-08-07 cs.CL cs.AI 版本更新 76%

Role Steering of Language Models for Social Simulations

用于社会模拟的语言模型角色引导

Isaac Song, Mohammed Rehan Parwani, Glenn Matlin, Emile Anand, Akhil Theerthala, Arjun Chatterjee, Anthony Wen-Ming Zang, Maria Kostylew, Yonadav G. Shavit, Sebastien Krier, Mark Riedl

机构 * Georgia Institute of Technology(佐治亚理工学院) ML Alignment & Theory Scholars (MATS)(ML对齐与理论学者组织(MATS)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Oxford(牛津大学) Google DeepMind(谷歌DeepMind) OpenAI(开放人工智能公司)

专题命中 指令微调 :language model(title);分类 cs.CL、cs.AI

AI总结 该研究提出针对语言模型智能体的角色引导筛选工作流,在OLMo-3-7B-Instruct上验证其角色画像对齐度更高且词汇多样性更好,发现需按角色选引导系数而非统一高强度设置。

Comments 35 pages. Published at the Social Sim'26 Workshop, COLM 2026. Code: https://github.com/eilab-gt/casting-call-vectors

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22191 2026-08-07 cs.CR cs.CL 版本更新 70%

Behavioral Canaries: Auditing Private Retrieved Context Usage in RL Fine-Tuning

行为 Canary:在 RL 微调中审计私有检索上下文的使用

Chaoran Chen, Dayu Yuan, Peter Kairouz

机构 * Google(谷歌)

专题命中 指令微调 :LLM(abstract_cn);post-training(abstract);分类 cs.CL

AI总结 本文提出 Behavioral Canaries 机制,用于审计 RL 微调过程中是否非法使用受保护的检索上下文,通过行为信号检测未经授权的文档条件训练,实现 67% 的检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13621 2026-08-07 cs.CV 版本更新 67%

Visual Intention Grounding for Egocentric Assistants

面向第一人称视角助手的视觉意图定位

Pengzhan Sun, Junbin Xiao, Tze Ho Elden Tse, Yicong Li, Arjun Akula, Angela Yao

机构 * National University of Singapore(新加坡国立大学) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :LLM(abstract_cn);instruction tuning(abstract)

AI总结 本文提出首个第一人称视觉意图定位数据集EgoIntention,及推理至定位(RoG)指令微调方法,解决多模态模型在第一人称视角下的意图定位问题,实现了统一的视觉定位能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27594 2026-08-07 cs.LG 版本更新 57%

Compliance2LoRA: Personalizable On-Demand Safety Alignment on Arbitrary Policy Subsets via Hypernetwork-Generated LoRA Adapters

Compliance2LoRA:通过超网络生成的LoRA适配器对任意策略子集进行按需安全对齐

Pankayaraj Pathmanathan, Furong Huang

机构 * University of Maryland College Park(马里兰大学帕克分校)

专题命中 指令微调 :post-training(abstract);分类 cs.LG

AI总结 Compliance2LoRA是一种自适应超网络框架,可通过生成LoRA适配器,在单个大型推理模型上实现对任意安全策略子集的按需对齐,且不牺牲任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 5 篇

2601.03895 2026-08-07 cs.LG cs.AI cs.CL 版本更新 75%

All-Quadrant Bounded Clipping GRPO: Closing the Unbounded Blind Spot for Stable and Generalizable Training

自适应边界裁剪GRPO:确保有界比率以实现稳定且可推广的训练

Chi Liu, Xin Chen

专题命中 后训练与偏好优化 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ABC-GRPO通过自适应边界裁剪提升GRPO的灵活性和泛化能力,实现更稳定和可推广的训练效果。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17658 2026-08-07 cs.LG cs.AI cs.IT math.IT 版本更新 73%

MARS: Margin and Semantic-Aware Data Augmentation for Reward Modeling

MARS:面向奖励建模的边界与语义感知数据增强

Payel Bhattacharjee, Osvaldo Simeone, Ravi Tandon

机构 * University of Arizona(亚利桑那大学) Northeastern University London(伦敦东北大学)

专题命中 后训练与偏好优化 :RLHF(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出MARS框架,通过优先增强低边界偏好对并利用语义距离细化,提升奖励模型质量和对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27771 2026-08-07 cs.LG cs.CV 版本更新 57%

NormGuard: Reward-Preserving Norm Constraints in Flow-Matching Reinforcement Learning

NormGuard: 流匹配强化学习中保持奖励的范数约束

Tianlin Pan, Lianyu Pang, Cheng Da, Huan Yang, Changqian Yu, Kun Gai, Wenhan Luo

机构 * The Hong Kong University of Science and Technology(香港科技大学) Kuaishou Technology(快手科技) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.LG

AI总结 针对流生成器强化学习后训练中感知质量下降的问题,提出NormGuard方法,通过铰链惩罚约束速度范数,在保持奖励的同时提升图像质量和真实性。

Comments v5: Fixed PDF rendering compatibility issue affecting Apple PDFKit (macOS Preview/iOS PDF viewer). No changes to technical content compared to v4

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02721 2026-08-07 cs.AI 版本更新 57%

GrandCode: Achieving Grandmaster Level in Competitive Programming via Agentic Reinforcement Learning

GrandCode: 通过代理强化学习实现竞技编程的Grandmaster级别

Ornith Team, Xiaoya Li, Guoyin Wang, Songqiao Su, Chris Shum, Jiwei Li

机构 * DeepReinforce Team(DeepReinforce 团队)

专题命中 后训练与偏好优化 :post-training(abstract);分类 cs.AI

AI总结 本文提出GrandCode,一种用于竞技编程的多代理强化学习系统,通过代理模块协同训练和代理GRPO算法,实现了在竞技编程比赛中超越人类选手的突破。

Comments Tech Report; Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20633 2026-08-07 cs.RO 版本更新 50%

Reinforcing Action Policies by Prophesying

通过预言强化行动策略

Jiahui Zhang, Ze Huang, Chun Gu, Zipei Ma, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院)

专题命中 后训练与偏好优化 :post-training(abstract)

AI总结 ProphRL通过Prophet、FA-GRPO和FlowScale提升VLA后训练的效率与稳定性,实现机器人任务的成功率提升。

Comments https://LogosRoboticsGroup.github.io/ProphRL

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 8 篇

2608.03067 2026-08-07 cs.CL 版本更新 88%

Activation-Guided Neuron Intervention to Induce Alzheimer's-Related Computational Language Phenotypes in a Large Language Model

激活引导的神经元干预以在大型语言模型中诱导阿尔茨海默病相关的计算语言表型

Rui He, Ercong Nie, Hong Jiang, Iris E. Sommer, Philipp Homan, Wolfram Hinzen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究基于Qwen3-8B构建激活引导干预框架,通过缩放权重调节AD相关神经元,发现放大该神经元会导致多认知域功能损伤,减弱则多保留性能,为AD计算表型提供了概念验证。

Comments 17 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01707 2026-08-07 cs.CL cs.DB 版本更新 87%

Memory in the LLM Era: Modular Architectures and Strategies in a Unified Framework

在大语言模型时代:在统一框架下的模块化架构与策略

Yanchen Wu, Tenghui Lin, Yingli Zhou, Fangyuan Zhang, Qintian Guo, Xun Zhou, Sibo Wang, Xilin Liu, Yuchi Ma, Yixiang Fang

机构 * Huawei Cloud(华为云)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文在统一框架下系统比较了多种记忆方法,设计出优于现有方法的新方法,并探讨了未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00641 2026-08-07 cs.AI 版本更新 81%

DASH: Decoupled Adaptive Surrogate - Acquisition Harness for Automated Bayesian Optimization

DASH:用于自动化贝叶斯优化的解耦自适应代理-采集调控器

Changquan Zhao, Yuxiang Sun, Ruihao Zhu, Cheng Hua, Yulian He

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 DASH是用于LLM增强AutoBO的解耦自适应调控器,通过分离代理与采集的适配逻辑,在四项化学优化任务中较最佳AutoBO基线实现了12.51%的轨迹级加速因子提升和5.00%的端点增强因子提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04098 2026-08-07 cs.CL cs.AI 版本更新 81%

Layer-wise Positional Bias in Short-Context Language Modeling

分层位置偏倚在短上下文语言建模中的表现

Maryam Rahimi, Mahdi Nouri, Yadollah Yaghoobzadeh

机构 * Tehran Institute for Advanced Studies, Khatam University, Iran(德黑兰高级研究院,卡坦大学,伊朗) School of Electrical and Computer Engineering, University of Tehran, Iran(德黑兰理工大学电气与计算机工程学院,伊朗)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出一种基于归因的框架,分析短上下文语言建模中各层的位置偏倚,发现深度增加时近期偏倚增强,首次偏倚减弱,且早期层更倾向内容词。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07144 2026-08-07 cs.LG 版本更新 74%

Fractal KV-Cache Archives: Lossless Symbolic Storage with In-Place Retrieval for Long-Context LLM Inference

分形KV缓存存档:用于长上下文语言模型推理的带原地检索的无损符号存储

Vladimir Gusev

机构 * Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :LLM(title);分类 cs.LG

AI总结 研究长上下文语言模型推理中KV缓存的存储问题,提出用分形KV缓存存档方法,该方法无损、线性时间运行且支持随机访问与追加,经实验验证能大幅减少存档缓存,还兼具搜索索引功能,发布代码可重现结果。

Comments 10 pages, 3 figures. Code: https://github.com/eighteight/fractal-kv

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01280 2026-08-07 cs.CV cs.AI cs.CL 版本更新 73%

Look Twice: Training-Free Evidence Highlighting for Knowledge-based Visual Question Answering

二次审视:多模态大语言模型中的免训练证据高亮

Marco Morini, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Look Twice框架,通过模型注意力模式识别相关视觉区域和文本证据,提升预训练MLLMs在多模态证据利用中的表现,实验显示在多个VQA基准上效果显著。

Comments Project Page: https://aimagelab.github.io/LoT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10921 2026-08-07 cs.CL 版本更新 70%

Trace Only What You Need: Structure-Aware On-Demand Hypergraph Memory for Long-Document Question Answering

仅追踪所需:面向长文档问答的结构感知按需超图记忆

Xiangjun Zai, Xingyu Tan, Chen Chen, Xiaoyang Wang, Wenjie Zhang

机构 * University of New South Wales(新南威尔士大学) CSIRO(澳大利亚联邦科学与工业研究组织) University of Wollongong(伍伦贡大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DocTrace,一种多智能体RAG框架,通过查询触发的知识组织、文档结构感知和经验引导推理,解决长文档问答中知识组织成本高、结构利用不足和推理经验无法复用的问题,在三个数据集上取得最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏