arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-03 至 2026-08-03 共收录 267 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 18 篇

2607.29561 2026-08-03 cs.LG cs.AI 新提交 93%

MOT-SR: Multi-Objective Tool-Augmented Scientific Equation Discovery with Large Language Models

MOT-SR:基于大语言模型的多目标工具增强型科学方程发现

Boxiao Wang, Runxiang Wang, Kai Li, Chongming Li, Zhiwei Chen, Yifan Zhang, Jian Cheng

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of the Chinese Academy of Sciences(中国科学院大学) School of Advanced Interdisciplinary Sciences(先进交叉科学学院) School of Astronomy and Space Science, University of the Chinese Academy of Sciences(中国科学院大学天文与空间科学学院)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 MOT-SR是整合外部分析工具、采用双协同LLM模块的多目标工具增强型符号回归框架,在40项标准任务及EMRI轨道建模中均展现出更优性能,可实现长程科学动力学的可靠建模。

Comments Code is available at https://github.com/wswbx/MOT-SR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28677 2026-08-03 cs.AI 新提交 92%

Reasoning in Real World Clinical Care: Why Large Language Models Are Not Yet Safe for Autonomous Clinical Decision Support

现实世界临床护理中的推理:为何大型语言模型(LLM)尚不适合自主临床决策支持

Shayndhan Sivanathan, Shravan Nageswaran, Mehdi Zadem, Ryaan Sultan, Nicolas von Mallinckrodt, Max Solovyev, Alexey Matyushkin, Sumon Sadhu, Gabriele C DeLuca, Sanjeeva Jeyaretna, James Hillis, Manoj Ramachandran, Prakash Jayakumar

机构 * Atman Labs(阿特曼实验室) Oxford University Hospitals(牛津大学医院) University of Oxford(牛津大学) NIHR Oxford Biomedical Research Centre(英国国立卫生研究院牛津生物医学研究中心) Imperial College London(伦敦帝国理工学院) Technical University of Munich(慕尼黑工业大学) Massachusetts General Hospital(麻省总医院) Mass General Brigham(麻省总医院布里格姆医疗系统) Harvard Medical School(哈佛医学院) Barts Health NHS Trust(巴特保健国民保健信托基金会) the University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(title);language model(title);分类 cs.AI

AI总结 本文指出,尽管LLM在医学考试和部分病例推理上表现出色,但因存在信息收集缺陷等问题,尚不适合用于无医生参与的自主临床分诊。

Comments 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15037 2026-08-03 cs.CL cs.AI 版本更新 92%

Knowledge Restoration-driven Prompt Optimization: Unlocking LLM Potential for Open-Domain Relational Triplet Extraction

基于知识恢复的提示优化:解锁LLM在开放领域关系三元组提取中的潜力

Xiaonan Jing, Gongqing Wu, Xingrui Zhuo, Lang Sun, Jiapu Wang

机构 * The Key Laboratory of Knowledge Engineering with Big Data (the Ministry of Education of China)(知识工程与大数据关键实验室(中华人民共和国教育部)) School of Computer Science and Information Engineering(计算机科学与信息工程学院) Anhui Zhongke Guojin Intelligent Technology Co., Ltd.(安徽中科创金智能科技有限公司) Nanjing University of Science and Technology(南京理工大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出KRPO框架,通过知识恢复和提示优化提升LLM在开放领域关系三元组提取任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01103 2026-08-03 cs.CL 版本更新 92%

Clinician-Level Agreement Without Clinical Caution: LLM Evaluator Limits in Medical AI Benchmarking

临床医生级别的一致性缺乏临床谨慎:LLM评估者在医学AI基准测试中的局限性

William Philipp, Finn Fassbender, Daniel Fister, Thorsten Langer, Martje G. Pauly, Rebecca Herzog, Markus A. Hobert, Theresa Paulus, Alexander Baumann, Chi Wang Ip, Lukas L. Goede, Johanna Reimer, Sebastian Löns, Ronald Böck, Sebastian Fudickar

机构 * University of Luebeck(吕贝克大学) University of Tübingen(图宾根大学) University Hospital Schleswig-Holstein(石勒苏益格-荷尔斯泰因大学医院) University Hospital Würzburg(维尔茨堡大学医院) Charité – Universitätsmedizin Berlin(柏林夏里特医学院) Genie Enterprise Deutschland GmbH

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对德语开放回答临床基准MedQADE,评估LLM评估者与医生的对齐程度,发现统计一致性高但缺乏临床元认知,且存在系统性的模型谱系偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28889 2026-08-03 cs.HC cs.AI 新提交 90%

Human-LLM Collaborative Inductive Coding for Conceptualizing K-12 Educator AI Use

面向K-12教育工作者AI使用的人机协同归纳编码方法

Alex Liu, Min Sun, Lief Esbenshade, Michael Xiao, Victor Tian, Zachary Zhang, Kevin He

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多阶段人机协同编码流程,将LLM作为标注工具辅助K-12教育工作者交互语料库编码,保留人类概念权威,构建含72个条目的分层编码本,为定性研究提供可审计模板。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28683 2026-08-03 cs.SE cs.AI 新提交 90%

Metaphor-Induced Algorithmic Steering: Cross-Domain Procedural Transfer in LLM Code Generation

隐喻诱导的算法引导:LLM代码生成中的跨领域过程迁移

Zhibo Hu, Chen Wang, Yanfeng Shu, Hye-young Paik, Liming Dong, Liming Zhu

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MASC框架,发现隐喻会诱导LLM代码生成模型迁移低效率过程模式,可高检测率识别此类隐喻技能与低效率实现,揭示其通过源场景过程模式迁移运作的机制。

Comments 12 pages, 11 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14917 2026-08-03 cs.CL cs.HC cs.LG 88%

Self-reflecting Large Language Models: A Hegelian Dialectical Approach

Sara Abdali, Michael Solodko, Can Goksen, Saeed Amizadeh, Julie E. Maybee, Kazuhito Koishida, Pashmina Cameron

机构 * Microsoft Applied Sciences Group (ASG)(微软应用科学组) Department of Philosophy, Lehman College, City University of New York(哲学系,莱曼学院,新 York 城市大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28692 2026-08-03 cs.AI cs.CL 新提交 87%

SciToolAgent-Evo: An Ontology-Aware Self-Evolving Agent for Open-World Scientific Tool Acquisition

SciToolAgent-Evo:一种面向开放世界科学工具获取的本体感知自进化智能体

Yuqi Tang, Chenyi Zhou, Libin Wang, Keyan Ding, Qiang Zhang, Huajun Chen

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对LLM智能体依赖静态工具空间难以适配开放世界科学工作流的问题,提出SciToolAgent-Evo本体感知自进化智能体,结合进化记忆与本体化工具图,利用LinUCB平衡探索利用,推出OpenSciToolBench基准并取得最优性能。

Comments 19 pages, 4 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29066 2026-08-03 cs.CL cs.AI 新提交 85%

Semantics of Subterfuge: Benchmarking Legal Deception Detection Against General-domain State-of-the-Art

欺骗的语义:针对通用领域最先进模型的法律欺骗检测基准测试

Theekshana Samaradiwakara, Nisansa de Silva, George C. Lobb

机构 * University of Moratuwa(莫拉图瓦大学) The Law Office of George C. Lobb(乔治·C·洛布律师事务所)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文针对法律领域的自动欺骗检测,对比了微调Transformer模型与大型语言模型在通用和法律数据集上的表现,发现领域敏感性显著,思维链提示效果逊于直接分类,强调需开发适配法律领域的可解释系统。

Comments 5 pages paper

Journal ref ICAIL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28980 2026-08-03 cs.LG 新提交 83%

Beyond Feature and Structure Alignment: Learning Transferable Propagation Knowledge for Graph Foundation Models

超越特征与结构对齐:学习图基础模型的可迁移传播知识

Yi Wang, Jitao Zhao, Di Jin, Dongxiao He

机构 * Tianjin University(天津大学)

专题命中 领域大模型 :foundation model(title,abstract);分类 cs.LG

AI总结 针对现有图基础模型忽略可迁移传播知识单元与传播模式异质性的局限,本文提出ProGFM,通过传播关系原型库学习跨域可迁移传播知识,在多跨域场景下实现更优泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28841 2026-08-03 cs.MA cs.SE 新提交 80%

CyberNeuro: A Privacy-Preserving Agentic Workbench for Cohort-Scale Neuroimage and Clinical Data Analysis

CyberNeuro:用于队列规模神经影像与临床数据分析的隐私保护智能体工作台

Ran Ren, Junhong Tong, Yunxi Kong, Yiyao Chen, Yucheng Li, Kunhao Zhou, Shaoqi Wang, Yuxiang Tao, Shuheng Cao, Zhihao Fan, Marissa DiPiero, Tingting Dan, Guorong Wu

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 CyberNeuro是配备WandaMind本地LLM的隐私保护智能体工作台,通过四个专用智能体实现神经影像与临床数据分析自动化,在NeuroBench上提升了域准确率,还降低了令牌使用量。

Comments 25 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28968 2026-08-03 cs.DL cs.AI cs.CY 新提交 79%

A robust association between LLM use and scientific productivity: Assessing stopping-time selection

Keigo Kusumegi, Xinyu Yang, Paul Ginsparg, Mathijs de Vaan, Toby Stuart, Yian Yin

专题命中 领域大模型 :LLM(title,abstract);分类 cs.AI

Comments Response to Renault, Bergeaud, and Bosquet

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28696 2026-08-03 cs.LG cs.CV 新提交 79%

Mitigating Class-Tail Undercoverage in Medical Vision-Language Models under Clinical Shift

缓解临床分布偏移下医学视觉-语言模型的类别尾部覆盖不足问题

Mushir Akhtar, M. Tanveer

机构 * Indian Institute of Technology Indore(印度理工学院印多雷分校)

专题命中 领域大模型 :language model(title,abstract);分类 cs.LG

AI总结 本文针对临床分布偏移下医学VLMs的类别尾部覆盖不足问题,提出CALCoDe方法,在多个偏移场景和骨干网络上实现了所有设置下边际和最差类别覆盖度均达0.95的最优表现。

Comments 26 pages; supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28771 2026-08-03 cs.CV 新提交 78%

Do Medical Foundation Models Generalize on the African Brain?

医学基础模型能否在非洲脑部数据上实现泛化?

Kaouther Mouheb, Gonzalo Esteban Mosquera Rojas, Juancito van Leeuwen, Stefan Klein, Esther E. Bron

机构 * Erasmus MC(伊拉斯姆斯大学医学中心)

专题命中 领域大模型 :foundation model(title,abstract)

AI总结 该研究评估医学基础模型在非洲脑部MRI数据上的泛化性,发现其无固有偏见,性能差异多源于数据集规模,核心是非洲神经影像数据集不足。

Comments Submitted to the AFRICAI workshop (Held in conjunction with MICCAI 2026, Strasbourg, France)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28990 2026-08-03 cs.AI 新提交 70%

Scaling Scientific Discovery Environments for Turn-Level Agentic RL

面向回合级智能体强化学习的科学发现环境扩展

Yucheng Xu, Keyi Zhang, Yuyang Yu, Min Zhang, Shiyuan Meng, Pei Chu, Zhongying Tu

机构 * Shanghai AI Lab(上海人工智能实验室)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出可扩展框架SciDisco,结合SciThèque与DiscoPO,训练出的SciDisco-14B在假设驱动的科学数据分析基准上实现了当前最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29530 2026-08-03 cs.LG 新提交 57%

A Neurosymbolic Approach for Explainable Early Diagnosis of Alzheimer's Disease

一种用于阿尔茨海默病可解释早期诊断的神经符号方法

Ranveer Singh, Pranuthi Tenali, Saurabh Mathur, Ameet Soni, Vaishali Phatak, Karla Lynch, Daniel Murman, Matthew Rizzo, Sriraam Natarajan

专题命中 领域大模型 :foundation model(abstract);分类 cs.LG

AI总结 该研究提出一种自动化流程,用预训练基础模型处理言语流畅性测试音频构建贝叶斯网络,以实现阿尔茨海默病的可解释早期诊断,成功恢复临床知识并识别语言标志物间新关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28684 2026-08-03 cs.AI 新提交 57%

Library Reachability in LSR-Synth: How Anti-Memorization Design Changes the Measurement of Symbolic Discovery

LSR-Synth中的库可达性:反记忆化设计如何改变符号发现的测量

Zhan'ao Yao, Liang Yin, Zhihao Gao, Boxuan Zhang, Xiaoyu Wu, Linjing Li, Rongyan Wang, Tingwei Chen, Youwei Wang, Xiaolin Zhao, Jiahui Shi, Jianjun Liu

专题命中 领域大模型 :language model(abstract);分类 cs.AI

AI总结 该研究在LSR-Synth基准下,对比语言模型先验与常规算子搜索的效果,发现固定词汇表已覆盖多数任务,语言模型候选仅在词汇表覆盖受扰时贡献显著,且严格分布外评估不改变该关系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16134 2026-08-03 cs.DB 版本更新 50%

Benchmarking Table Extraction from Heterogeneous Scientific PDF Documents

对异构科学提取文档中表格提取的基准测试

Marijan Soric, Cécile Gracianne, Ioana Manolescu, Pierre Senellart

专题命中 领域大模型 :language model(abstract)

AI总结 本文提出了一种新的基准测试,用于评估端到端表格提取方法,通过分析评估指标和设计严谨的评估流程,揭示了当前方法在异构数据下的局限性。

Comments Extended version, with appendices, of a paper published at KDD '26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 知识编辑与模型理解 14 篇

2607.28635 2026-08-03 cs.CL cs.LG 新提交 90%

Imbalanced Data Clustering via Targeted Data Augmentation Using GMM and LLM

基于高斯混合模型(GMM)与大语言模型(LLM)的定向数据增强用于不平衡数据聚类

Noor Khalal, Abdallah Alaa-Eddine Djamai, Imed Keraghel, Mohamed Nadif

机构 * Centre Borelli UMR9010(博雷利中心UMR9010) Université Paris Cité(巴黎城市大学) Kernix Software(Kernix软件公司)

专题命中 知识编辑与模型理解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 针对无监督NLP任务中不平衡数据聚类难以捕捉少数主题的问题,本文提出整合GMM与LLM的定向数据增强方法,实验表明其可保持聚类性能并提升可解释性。

Journal ref Advances in Intelligent Data Analysis: 23rd International Symposium on Intelligent Data Analysis; IDA 2025; Proceedings; pp 246-260

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06382 2026-08-03 stat.ML cs.AI cs.CL cs.GT cs.LG 90%

On the Fundamental Impossibility of Hallucination Control in Large Language Models

Michał P. Karpowicz

机构 * Samsung AI Center(三星人工智能中心)

专题命中 知识编辑与模型理解 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Mathematics debugged, added examples and illustrations, corrected claims, and re-edited, typos removed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24435 2026-08-03 cs.CL cs.AI 版本更新 86%

LEX-EC: A Lexical Evidence-Channel Audit Framework for Zero-Shot LLM Personality Classification in Black-Box Settings

LEX-EC:黑盒设置下用于零样本大语言模型人格分类的词汇证据通道审计框架

Brittany Harbison, Ashok K. Goel

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究针对大语言模型人格分类可解释性问题,提出LEX-EC框架,结合多种诊断与词汇消融,通过对不同文本体裁分析,展示特质关联与词汇证据关系,联合评估多项指标,将词汇方法应用于黑盒人格标签可解释性。

Comments Appendix and link to Code repo provided; this version also contains a refined Discussion section and a small error regarding Table 1 was corrected

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11872 2026-08-03 q-bio.GN cs.AI 版本更新 84%

ELISA: An Interpretable Hybrid Generative AI Agent for Expression-Grounded Discovery in Single-Cell Genomics

ELISA:一种可解释的混合生成式AI代理,用于单细胞组学中的表达基础发现

Omar Coser

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);foundation model(abstract);分类 cs.AI

AI总结 ELISA结合表达嵌入、语义检索和LLM解释,提供交互式单细胞发现,优于CellWhisperer,尤其在基因签名查询中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00435 2026-08-03 cs.CL cond-mat.dis-nn cs.AI nlin.CD 版本更新 84%

Escaping Mode Collapse in LLM Generation via Geometric Regulation

通过几何调控逃离大语言模型生成中的模式崩溃

Xin Du, Kumiko Tanaka-Ishii

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Department of Communications and Computer Engineering, Waseda University, Tokyo, Japan(通信与计算机工程系,早稻田大学,东京,日本) Department of Computer Science and Engineering, Waseda University, Tokyo, Japan(计算机科学与工程系,早稻田大学,东京,日本) Shanghai Research Institute for Intelligent Autonomous Systems, Tongji University, Shanghai, China(智能自主系统上海研究院,同济大学,上海,中国)

专题命中 知识编辑与模型理解 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文从动力系统视角将模式崩溃解释为几何崩溃,并提出轻量级在线状态空间干预方法RMR(通过低秩阻尼调控Transformer值缓存中的自强化方向),显著降低模式崩溃并实现极低熵率下的稳定生成。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29190 2026-08-03 cs.AI 新提交 81%

CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

CAGE:面向使用工具的智能体的带类型返回不确定性的可验证授权

Blaise Delattre, Cong Wang, Yang Cao

专题命中 知识编辑与模型理解 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 该研究针对使用工具的LLM智能体的授权问题,提出CAGE方法直接验证带绑定错误和数值漂移的联合邻域,可消除点式网关的预算内错误授权,保留部分自主决策,适配多种场景。

Comments Code: https://github.com/tdsai-lab/cage-agent-authorization

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29527 2026-08-03 cs.LG cs.AI cs.CY econ.EM stat.ML 新提交 81%

TerraNova: A Foundation Model for the Anthropocene

TerraNova:人类世的基础模型

Carlos Rodriguez-Pardo, Massimo Tavoni

机构 * Politecnico di Milano(米兰理工大学) RFF-CMCC European Institute on Economics and the Environment (EIEE)(RFF-CMCC欧洲经济与环境研究所) Euro-Mediterranean Center on Climate Change (CMCC)(欧洲地中海气候变化中心)

专题命中 知识编辑与模型理解 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 TerraNova是适配原生几何的基础模型,融合地球物理与社会数据,可重建密集场、适配未见变量,兼具地理空间编码能力与国家层面功能。

Comments 32 pages, 16 figures. Supplementary Information (full methodological specification, ablation programme, extended results, computational cost; 157 pages) available at the project page: https://carlosrodriguezpardo.es/projects/TerraNova/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29370 2026-08-03 cs.CV 新提交 78%

VFAD: Variational Semantic Prompting Meets Frequency-Adaptive Representation Learning for Zero-Shot Anomaly Detection

VFAD:变分语义提示与频率自适应表示学习结合的零样本异常检测

Peng Chen, Kaige Li, Wei Wang, Mingbo Yang, Wenqiang Wang, Li Shen, Fangjun Huang, Chao Huang

专题命中 知识编辑与模型理解 :prompting(title,abstract)

AI总结 该研究提出VFAD框架,结合变分语义提示与频率自适应表示学习,在13个工业和医学基准上,其零样本异常检测性能优于现有最先进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29200 2026-08-03 cs.CV 新提交 78%

UltraSAM3: A Concept-Driven Foundation Model for Universal Ultrasound Image Segmentation

UltraSAM3:一种用于通用超声图像分割的概念驱动基础模型

Bo Xu, Quanhao Zhu, Rui Lin, Boling Zhu, Chenyuan Wang, Hongfei Lin, Feng Xia, Chenhua Ji

机构 * Dalian University of Technology Affiliated Center Hospital(大连大学附属中心医院)

专题命中 知识编辑与模型理解 :foundation model(title,abstract)

AI总结 针对现有超声分割方法的任务局限或需专家视觉提示问题,提出概念驱动的UltraSAM3模型及指令引导智能体,在多基准测试中性能优于同类模型,提升了临床交互的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12384 2026-08-03 cs.LG cs.AI 版本更新 73%

APPO: Agentic Procedural Policy Optimization

APPO: 智能体程序策略优化

Xucong Wang, Ziyu Ma, Yong Wang, Yuxiang Ji, Shidong Yang, Guanhua Chen, Pengkun Wang, Xiangxiang Chu

机构 * University of Science and Technology of China(中国科学技术大学) AMAP, Alibaba Group(阿里巴巴集团高德地图) Southern University of Science and Technology(南方科技大学)

专题命中 知识编辑与模型理解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出APPO方法,通过细粒度分支和程序级优势缩放改进智能体强化学习的信用分配,在13个基准上平均提升近4个点。

Comments 25 pages, including 14 pages of main text and 11 pages of appendix; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29240 2026-08-03 cs.CV cs.AI 新提交 57%

When Model Priors Conflict with Visual Evidence: Mitigating Commonsense-Driven Hallucinations by Selective Prior Calibration

当模型先验与视觉证据冲突时:通过选择性先验校准缓解常识驱动的幻觉

Kesheng Chen, Yamin Hu, Wenjian Luo

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI

AI总结 针对视觉-语言模型的常识驱动幻觉,提出选择性先验校准方法,可提升反事实图像准确率并保留常识图像准确率,增益可推广至多类基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29213 2026-08-03 cs.IR cs.LG 新提交 57%

GALA: Generative Aligned Learning for Adaptive Multimodal Representation in the Taobao Shangou Recommender System

GALA:淘宝商购推荐系统中用于自适应多模态表示的生成对齐学习

Jiping Liu, Zhongmin Zhang, Zisen Sang, Zhijia Fang, Tao Ouyang, Ma Jiang, Shaopeng Liang, Zeyang Hou, Guodong Cao, Jia Jia

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.LG

AI总结 本文针对外卖推荐系统多模态融合难、语义与行为对齐不足的问题,提出三阶段流程GALA,通过生成式RL对齐阶段弥合预训练-微调差距,在淘宝商购部署后提升了订单量与AUC等指标。

Comments 13 pages, 12 figures, 5 tables. Accepted at the 2026 IEEE International Conference on Data Engineering (ICDE 2026), Industry and Applications Track

详情

展开后加载摘要…

URL PDF HTML 收藏