arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

共收录 1936
2602.01233 2026-02-03 cs.LG cs.AI

Lotus: Efficient LLM Training by Randomized Low-Rank Gradient Projection with Adaptive Subspace Switching

Lotus: 通过随机低秩梯度投影与自适应子空间切换实现高效的LLM训练

Tianhao Miao, Zhongyuan Bao, Lejun Zhang

机构 * Hong Kong Baptist University, School of Science, Hong Kong, China(香港 Baptist 大学,科学学院,香港,中国) Fudan University, School of Data Science, Shanghai, China(复旦大学,数据科学学院,上海,中国) New York University, Tandon School of Engineering, New York, USA(纽约大学,Tandon 工程学院,纽约,美国)

AI总结 Lotus通过随机低秩梯度投影与自适应子空间切换,实现LLM训练的高效优化,减少30%训练时间和40%内存消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01025 2026-02-03 cs.LG cs.AI cs.CV

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

迈向通用且可迁移的视觉-语言模型劫持攻击

Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) School of Information Technology, Deakin University, Australia(德肯大学信息科技系) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01007 2026-02-03 cs.CL

Distilling Token-Trained Models into Byte-Level Models

将令牌训练模型蒸馏为字节级模型

Zishuo Bao, Jiaqi Leng, Junxiong Wang, Bowen Peng, Yucheng Lu

机构 * Fuzhou University(福州大学) Fudan University(复旦大学) Together AI Nous Research

AI总结 本文提出了一种将令牌训练模型高效蒸馏为字节级模型的方法,通过两阶段课程实现端到端生成,验证了在有限数据下保持模型性能的可行性。

Comments 17 pages, 3 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00948 2026-02-03 physics.soc-ph cs.AI cs.GT cs.MA

FinEvo: From Isolated Backtests to Ecological Market Games for Multi-Agent Financial Strategy Evolution

FinEvo: 从孤立回测到多智能体金融策略进化的生态市场博弈

Mingxi Zou, Jiaxiang Chen, Aotian Luo, Jingyi Dai, Chi Zhang, Dongning Sun, Zenglin Xu

机构 * Fudan University(复旦大学) Tensorpacific Peng Cheng Laboratory(鹏城实验室)

AI总结 FinEvo通过生态博弈形式化方法研究多智能体金融策略的进化动态,揭示策略在动态市场中的适应与演化机制。

Comments Preprint. Submitted to a conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00810 2026-02-03 cs.CV cs.RO

VVLoc: Prior-free 3-DoF Vehicle Visual Localization

VVLoc: 无需先验信息的3自由度车辆视觉定位

Ze Huang, Zhongyang Xiao, Mingliang Song, Longan Yang, Hongyuan Yuan, Li Sun

机构 * Fudan University(复旦大学) NIO(蔚来汽车) Bosch XC(博世XC)

AI总结 VVLoc通过单一神经网络实现多摄像头下的车辆拓扑与度量定位,无需先验信息,提升定位精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00566 2026-02-03 cs.RO

UniMotion: A Unified Motion Framework for Simulation, Prediction and Planning

UniMotion: 一种用于仿真、预测和规划的统一运动框架

Nan Song, Junzhe Jiang, Jingyu Li, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Innovation Institute(上海创新研究院) University of Surrey(Surrey大学)

AI总结 UniMotion提出了一种统一的运动框架,通过共享结构和定制化训练策略,同时支持运动仿真、预测和规划,实现高效的任务整合和泛化能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19199 2026-02-03 cs.AI

MAGNET: Towards Adaptive GUI Agents with Memory-Driven Knowledge Evolution

MAGNET:迈向基于记忆驱动的知识演化的自适应GUI代理

Libo Sun, Jiwen Zhang, Siyuan Wang, Zhongyu Wei

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) University of Southern California(南加州大学)

AI总结 MAGNET通过双层记忆机制和动态演化机制,提升GUI代理在界面变化中的适应性和任务执行性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19149 2026-02-03 cs.LG q-bio.QM

GPCR-Filter: a deep learning framework for efficient and precise GPCR modulator discovery

GPCR-Filter: 一种用于高效且精确发现GPCR调节剂的深度学习框架

Jingjie Ning, Xiangzhen Shen, Li Hou, Shiyi Shen, Jiahao Yang, Junrui Li, Hong Shan, Sanan Wu, Sihan Gao, H. Eric Xu, Xinheng He

机构 * The State Key Laboratory of Drug Research, Shanghai Institute of Materia Medica, Chinese Academy of Sciences, Shanghai, China(中国科学院上海药物研究所国家药物研究重点实验室) School of Computer Science, Carnegie Mellon University, Pittsburgh, PA 15213, USA(卡内基梅隆大学计算机科学学院) College of Computer Science and Electronic Engineering, Hunan University, Changsha, Hunan(湖南大学计算机科学与电子工程学院) Lingang Laboratory, Shanghai, China(上海灵冈实验室) Research Center for Medicinal Structural Biology, National Research Center for Translational Medicine at Shanghai, State Key Laboratory of Medical Genomics, Ruijin Hospital, Shanghai Jiao Tong University School of Medicine, Shanghai, China(上海 translational 医学研究中心,国家医学基因组学重点实验室,瑞金医院,上海交通大学医学院,上海,中国) School of Pharmacy, Fudan University, Shanghai 201203, China(复旦大学药学院)

AI总结 GPCR-Filter通过深度学习框架高效精准发现GPCR调节剂,结合蛋白质语言模型和图神经网络,实现对受体-配体功能关系的学习,提升药物开发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11629 2026-02-03 cs.LG cs.AI

Global Feature Enhancing and Fusion Framework for Strain Gauge Time Series Classification

基于应变计时间序列分类的全局特征增强与融合框架

Xu Zhang, Peng Wang, Chen Wang, Zhe Xu, Xiaohua Nie, Wei Wang

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science Fudan University(上海数据科学关键实验室,计算机科学学院,复旦大学) National Engineering Research Center for Big Data Software Tsinghua University(大数据软件国家工程研究中心,清华大学) School of Software Tsinghua University(软件学院,清华大学) National Key Laboratory of Strength and Structural Integrity, Aircraft Strength Research Institute of China(强度与结构完整性国家重点实验室,中国航空强度研究室)

AI总结 本文提出基于超图的全局特征学习与融合框架,通过特征工程和高阶关系学习提升应变计时间序列分类的准确性。

Comments The paper is published in the ACM Web Conference 2025, WWW 2025 Industry Track. The code is available at the link https://github.com/Meteor-Stars/GFEF

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08622 2026-02-03 q-fin.ST cs.AI cs.LG

Multi-period Learning for Financial Time Series Forecasting

多周期学习用于金融时间序列预测

Xu Zhang, Zhengang Huang, Yunzhi Wu, Xun Lu, Erpeng Qi, Yunkai Chen, Zhongya Xue, Qitong Wang, Peng Wang, Wei Wang

机构 * School of Computer Science Fudan University(复旦大学计算机学院)

AI总结 本文提出多周期学习框架MLF,通过三个新模块整合多周期输入以提升金融时间序列预测的准确性和效率。

Comments The codes are available at https://github.com/Meteor-Stars/MLF. The paper is published in the ACM SIGKDD Conference on Knowledge Discovery and Data Mining, SIGKDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12706 2026-02-03 cs.CV cs.AI

NAP-Tuning: Neural Augmented Prompt Tuning for Adversarially Robust Vision-Language Models

NAP-Tuning: 用于对抗鲁棒视觉-语言模型的神经增强提示微调

Jiaming Zhang, Xin Wang, Xingjun Ma, Lingyu Qiu, Yu-Gang Jiang, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Shanghai Key Lab of Intell. Info. Processing, School of CS, Fudan University(复旦大学计算机学院智能信息处理重点实验室) Department of Mathematics and Applications, University of Naples Federico II(那不勒斯费德里克二世大学应用数学系) State Key Laboratory of Advanced Rail Autonomous Operation, Beijing Jiaotong University(北京交通大学先进轨道交通自主运行国家重点实验室)

AI总结 NAP-Tuning通过神经增强框架提升视觉-语言模型的对抗鲁棒性,实现多模态提示微调和特征净化,显著提升模型在对抗攻击下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00015 2026-02-03 cs.CL cs.AI

G-MemLLM: Gated Latent Memory Augmentation for Long-Context Reasoning in Large Language Models

G-MemLLM:基于门控潜在记忆增强的长上下文推理大语言模型

Xun Xu

机构 * Department of Computer Science(计算机科学系) Fudan University(复旦大学)

AI总结 G-MemLLM通过引入门控潜在记忆库,提升大语言模型在长上下文推理中的表现,显著增强多跳推理和关系精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00677 2026-02-02 cs.LG cs.AI

IRPM: Intergroup Relative Preference Modeling for Pointwise Generative Reward Models

IRPM:基于组间相对偏好的点wise生成奖励模型

Haonan Song, Qingchen Xie, Huan Zhu, Feng Xiao, Luxi Xing, Liu Kang, Fuzhen Li, Zhiyong Zheng, Feng Jiang, Ziheng Li, Kun Yan, Qingyi Si, Yanghua Xiao, Hongcheng Guo, Fan Yang

机构 * HUJING Digital Media \& Entertainment Group (XingYun Lab), Beijing, China Department of Automation, Tsinghua University, Beijing, China Fudan University, Shanghai, China Beihang University, Beijing, China Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China

AI总结 IRPM通过组间比较扩展Bradley-Terry模型,从成对偏好数据中训练点wise GRMs,实现高效可扩展的奖励建模。

Comments Comments: Updated title for clarity; improved theoretical derivations; added experiments at additional parameter scales and more ablations; added experimental details in the appendix; updated author list (added five co-authors) to reflect contributions to experiments and writing

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21881 2026-02-02 cs.CV q-bio.NC

SLIM-Brain: A Data- and Training-Efficient Foundation Model for fMRI Data Analysis

SLIM-Brain: 一种数据和训练高效的人脑fMRI数据分析基础模型

Mo Wang, Junfeng Xia, Wenhao Ye, Enyu Liu, Kaining Peng, Jianfeng Feng, Quanying Liu, Hongkai Wen

机构 * Department of Biomedical Engineering, Southern University of Science and Technology, China(南方科技大学生物医学工程系) Department of Computer Science, University of Warwick, The UK(沃里克大学计算机科学系) Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University, China(复旦大学脑启发式智能科学技术研究所)

AI总结 SLIM-Brain是一种高效的人脑fMRI数据分析基础模型,通过两阶段自适应设计提升数据和训练效率,实现高效预训练和多样化任务性能。

Comments release code

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04753 2026-02-02 cs.CL

EtCon: Edit-then-Consolidate for Reliable Knowledge Editing

EtCon:编辑后整合以实现可靠的知识编辑

Ruilin Li, Yibin Wang, Wenhong Zhu, Chenglin Li, Jinghao Zhang, Chenliang Li, Junchi Yan, Jiaqi Wang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 EtCon通过编辑后整合范式提升LLMs的知识编辑可靠性与现实应用能力,保留预训练能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22708 2026-02-02 cs.LG cs.CL

A Unified Study of LoRA Variants: Taxonomy, Review, Codebase, and Empirical Evaluation

LoRA变体的统一研究:分类、综述、代码库和实证评估

Haonan He, Jingqi Ye, Minglei Li, Zhengbo Wang, Tao Chen, Lei Bai, Peng Ye

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 本文系统研究了LoRA变体,通过分类、理论综述、代码库和实证评估,揭示了LoRA及其变体对学习率的敏感性,并展示了其在多种任务中的性能优势。

Comments Submitted to IEEE Transactions on Pattern Analysis and Machine Intelligence, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22528 2026-02-02 cs.AI

Darwinian Memory: A Training-Free Self-Regulating Memory System for GUI Agent Evolution

达尔文记忆:一种无训练的自调节记忆系统用于GUI代理进化

Hongze Mi, Yibo Feng, WenJie Lu, Song Cao, Jinyuan Li, Yanming Li, Xuelin Zhang, Haotian Luo, Songyang Peng, He Cui, Tengfei Tian, Jun Fang, Hua Chai, Naiqiang Tan

机构 * Didichuxing Co. Ltd(滴滴出行有限公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Fudan University(复旦大学)

AI总结 达尔文记忆系统通过自进化架构提升GUI代理的执行稳定性与成功率,无需额外训练或架构开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22474 2026-02-02 cs.LG

Unrewarded Exploration in Large Language Models Reveals Latent Learning from Psychology

大语言模型中的无奖励探索揭示了心理学中的潜在学习

Jian Xiong, Jingbo Zhou, Zihan Zhou, Yixiong Xiao, Le Zhang, Jingyong Ye, Rui Qian, Yang Zhou, Dejing Dou

机构 * Fudan University, China(复旦大学) Auburn University, USA(阿伯茨罕大学) Baidu Research, China(百度研究院)

AI总结 研究发现大语言模型在无奖励探索阶段表现出潜在学习动态,通过实验验证其在无奖励和有奖励训练下的性能差异,并提出理论解释。

Comments 17pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22181 2026-02-02 cs.CL

MrRoPE: Mixed-radix Rotary Position Embedding

MrRoPE: 混基 radix 旋转位置嵌入

Qingyuan Tian, Wenhong Zhu, Xiaoran Liu, Xiaofeng Wang, Rui Wang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 MrRoPE通过混合基数转换策略,统一了RoPE扩展方法,实现了无需微调的长序列泛化,提升了编码长度上限和检索准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14256 2026-02-02 cs.CV

Identity-GRPO: Optimizing Multi-Human Identity-preserving Video Generation via Reinforcement Learning

身份保持的多人类视频生成优化:通过强化学习进行优化

Xiangyu Meng, Zixian Zhang, Zhenghao Zhang, Junchao Liao, Long Qin, Weizhi Wang

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学)

AI总结 Identity-GRPO通过强化学习优化多人类身份保持的视频生成,显著提升一致性指标。

Comments Our project and code are available at https://ali-videoai.github.io/identity_page, https://github.com/alibaba/identity-grpo

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21950 2026-01-30 cs.LG

Embracing Aleatoric Uncertainty in Medical Multimodal Learning with Missing Modalities

在医疗多模态学习中拥抱概率不确定性与缺失模态

Linxiao Gong, Yang Liu, Lianlong Sun, Yulai Bi, Jing Liu, Xiaoguang Zhu

机构 * HKUST (GZ)(香港科技大学) Tongji University(同济大学) University of Rochester(罗切斯特大学) Meta Fudan University(复旦大学) The University of British Columbia(不列颠哥伦比亚大学) University of California, Davis(加州大学戴维斯分校)

AI总结 本文提出AUM框架,通过建模单模态概率不确定性来应对医疗多模态学习中的缺失模态问题,在死亡预测任务中取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19325 2026-01-30 cs.CV

PRISM: A Framework Harnessing Unsupervised Visual Representations and Textual Prompts for Explainable MACE Survival Prediction from Cardiac Cine MRI

PRISM:一种结合无监督视觉表示和文本提示的框架,用于从心脏 cine MRI 预测可解释的 MACE 生存率

Haoyang Su, Jin-Yi Xiang, Shaohao Rui, Yifan Gao, Xingyu Chen, Tingxuan Yin, Shaoting Zhang, Xiaosong Wang, Lian-Ming Wu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学)

AI总结 PRISM通过结合无监督视觉表示和文本提示,实现了从心脏 cine MRI 预测可解释的 MACE 生存率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21694 2026-01-30 cs.CV

ChartE$^{3}$: A Comprehensive Benchmark for End-to-End Chart Editing

ChartE$^{3}$: 一个全面的端到端图表编辑基准

Shuo Li, Jiajun Sun, Zhekai Wang, Xiaoran Fan, Hui Li, Dingwen Yang, Zhiheng Xi, Yijun Wang, Zifei Shan, Tao Gui, Qi Zhang, Xuanjing Huang

机构 * Fudan University(复旦大学) Tencent(腾讯)

AI总结 ChartE$^{3}$提出一个端到端图表编辑基准,通过多模态大语言模型评估,揭示了现有技术在全局编辑任务上的性能差距。

Comments Our benchmark will be publicly available at https://github.com/galactic123/ChartE3

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17868 2026-01-30 cs.CV cs.AI

VidLaDA: Bidirectional Diffusion Large Language Models for Efficient Video Understanding

VidLaDA:双向扩散大型语言模型用于高效视频理解

Zhihao He, Tieyuan Chen, Kangyu Wang, Ziran Qin, Yang Shao, Chaofan Gan, Shijie Li, Zuxuan Wu, Weiyao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) ZhongguanCun Academy(中关村学院) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 VidLaDA通过双向注意力和MARS-Cache技术,提升视频理解效率,实现比现有方法更优的性能与速度

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25731 2026-01-30 cs.CV

LaTo: Landmark-tokenized Diffusion Transformer for Fine-grained Human Face Editing

LaTo:基于地标token化的扩散变换器用于精细的人脸编辑

Zhenghao Zhang, Ziying Zhang, Junchao Liao, Xiangyu Meng, Qiang Hu, Siyu Zhu, Xiaoyun Zhang, Long Qin, Weizhi Wang

机构 * Alibaba Cloud Computing(阿里云计算) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

AI总结 LaTo通过地标token化扩散变换器实现精细的人脸编辑,提升身份保持与语义一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06625 2026-01-30 cs.CV

CycleDiff: Cycle Diffusion Models for Unpaired Image-to-image Translation

CycleDiff: 基于循环扩散模型的无配对图像到图像翻译

Shilong Zou, Yuhang Huang, Renjiao Yi, Chenyang Zhu, Kai Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(计算机科学与技术学院,国防科技大学) College of Future Information Technology, Fudan University(未来信息技术学院,复旦大学) School of Computer, National University of Defense Technology(计算机学院,国防科技大学) Xiangjiang Laboratory(湘江实验室) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究院,中国科学院)

AI总结 CycleDiff通过联合学习扩散与翻译过程,提升跨域图像翻译的全局优化与生成质量。

Comments Accepted by IEEE TIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10163 2026-01-30 cs.CL

Compound-QA: A Benchmark for Evaluating LLMs on Compound Questions

Compound-QA:一个评估大语言模型在复合问题上的基准

Yutao Hou, Yajing Luo, Zhiwen Ruan, Hongru Wang, Weifeng Ge, Yun Chen, Guanhua Chen

机构 * Shanghai University of Finance and Economics(上海财经大学) University of Edinburgh(爱丁堡大学) Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

AI总结 Compound-QA基准通过评估LLM在复合问题上的表现,揭示其在理解和推理方面的不足,并提出改进策略。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.08742 2026-01-30 cs.CV

Efficient4D: Fast Dynamic 3D Object Generation from a Single-view Video

Efficient4D: 从单视角视频快速生成动态3D对象

Zijie Pan, Zeyu Yang, Xiatian Zhu, Li Zhang

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) University of Surrey(Surrey大学)

AI总结 Efficient4D通过高效框架实现从单视角视频快速生成动态3D对象,提升速度10倍并保持高质量

Comments IJCV version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20227 2026-01-29 cs.LG cs.AI cs.NA math.NA

ProFlow: Zero-Shot Physics-Consistent Sampling via Proximal Flow Guidance

ProFlow:通过近端流引导实现零样本物理一致采样

Zichao Yu, Ming Li, Wenyi Zhang, Difan Zou, Weiguo Gao

机构 * University of Science School of Mathematical Sciences, Fudan University, Shanghai 200433, China Department of Electronic Engineering Information Science, University of Science School of Computing Data Science, The University of Hong Kong School of Mathematical Sciences, Fudan University, Shanghai 200433, China \& Shanghai Key Laboratory of Contemporary Applied Mathematics, Shanghai 200433, China

AI总结 ProFlow通过近端引导框架实现零样本物理一致采样,有效平衡物理约束与生成先验的统计结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18631 2026-01-29 cs.AI cs.CL cs.CV cs.MA

AdaReasoner: Dynamic Tool Orchestration for Iterative Visual Reasoning

AdaReasoner: 多步骤视觉推理中的动态工具协调

Mingyang Song, Haoyu Sun, Jiawei Gu, Linjie Li, Luxin Xu, Ranjay Krishna, Yu Cheng

机构 * Fudan University(复旦大学) Tongji University(同济大学) National University of Singapore(新加坡国立大学) University of Washington(华盛顿大学) University of Electronic Science and Technology of China(电子科技大学) The Chinese University of Hong Kong(香港中文大学)

AI总结 AdaReasoner通过动态工具协调提升多模态模型的视觉推理能力,实现工具自适应和泛化,超越现有系统性能。

Comments 28 pages, 10 figures and 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏