arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 304
2607.25962 2026-07-29 cs.CV 新提交

LaP-Forensics: Latent-Pixel Consistency Guided Multimodal Reasoning for Deepfake Detection

LaP-Forensics:用于深度伪造检测的潜在像素一致性引导的多模态推理

Can Wang, Yuhao Wang, Yushe Cao, Canran Xiao, Fei Shen

机构 * The Hong Kong Polytechnic University(香港理工大学) University College London(伦敦大学学院) Tsinghua University(清华大学) Sun Yat-sen University(中山大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对深度伪造检测问题,提出LaP-Forensics多模态框架,利用基于重建的取证证据及结构化模型预测,经组相对策略优化,实现跨生成器检测和伪影定位,实验验证了残差流效用,但后处理下文本忠实性和可靠性有局限。

Comments Accepted at ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25933 2026-07-29 cs.CL cs.AI 新提交

Evaluating Multi-Turn Multimodal Diagnostic Reasoning on Challenging Real-World Clinical Cases

评估具有挑战性的真实世界临床病例中的多轮多模态诊断推理

Rui Yang, Weihao Xuan, Yi Lin, Zhuhan Bao, Jonathan Chong Kai Liew, Matthew Yu Heng Wong, Nicolás Lescano, Nikita R. Paripati, Emily Ling-Lin Pai, Jiarui Liu, Heli Qi, Heng-Jui Chang, Benny Kai Guo Loo, Huitao Li, Kunyu Yu, Yufan Wang, Chuan Hong, Shijian Lu, Douglas Teodoro, Naoto Yokoya, Ross Koppel, Mona Diab, Hua Xu, David W. Bates, Nan Liu, Yifan Peng

机构 * Center for Biomedical Data Science, Duke-NUS Medical School(生物医学数据科学中心,杜克 - 新加坡国立大学医学院) Duke-NUS AI + Medical Sciences Initiative, Duke-NUS Medical School(杜克 - 新加坡国立大学人工智能与医学科学计划,杜克 - 新加坡国立大学医学院) Department of Population Health Sciences, Weill Cornell Medicine(人口健康科学系,威尔康奈尔医学院) System Engineering, College of Engineering, Cornell University(系统工程,康奈尔大学工程学院) Graduate School of Frontier Sciences, The University of Tokyo(前沿科学研究生院,东京大学) RIKEN Center for Advanced Intelligence Project(理化学研究所先进智能项目中心) Department of Biostatistics and Bioinformatics, Duke University(生物统计学与生物信息学系,杜克大学) Perelman School of Medicine, University of Pennsylvania(佩雷尔曼医学院,宾夕法尼亚大学) School of Clinical Medicine, University of Cambridge(临床医学学院,剑桥大学) Hospital of the University of Pennsylvania(宾夕法尼亚大学医院) Children’s Hospital of Philadelphia (CHOP)(费城儿童医院) Department of Anatomic Pathology and Laboratory Medicine, Hospital of the University of Pennsylvania(解剖病理学与检验医学系,宾夕法尼亚大学医院) Department of Pathology and Laboratory Medicine, University of California, San Francisco(病理学与检验医学系,加州大学旧金山分校) Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)

AI总结 研究针对现有多模态大语言模型评估难以捕捉现实临床诊断复杂性的问题,开发ClinMM-Bench基准,用两级框架评估15个模型,发现专有模型诊断准确性最高,但各模型完全正确诊断比例有限,当前模型诊断推理有局限并明确了失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25380 2026-07-29 cs.CL 新提交

Memory for Large Language Models

大语言模型的记忆

Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang

机构 * Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Bosch AI(博世人工智能)

AI总结 综述对大语言模型中记忆这一基础架构维度进行系统分类,沿表示、更新动态、持久性三个正交轴表征记忆,形式化相关机制,阐明不同内存概念界限,分析混合架构等,为以记忆为中心的LLM设计及未来创新提供基础。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25195 2026-07-29 cs.RO cs.MA 新提交

Decentralized Scalable Exploration via Emergent Adaptive Lévy Walks on Minimal-Sensing Platforms

通过在最小感知平台上的涌现自适应莱维飞行实现分散式可扩展探索

Wai Lun Leong, Teo Swee Huat Rodney

机构 * National University of Singapore(新加坡国立大学)

AI总结 针对纳米无人机自主探索难题,提出轻量级传感器驱动的莱维飞行控制器,结合离散步长采样与传感器反应策略,各机器人独立采样指数并选航向,实现可扩展多无人机探索,仿真显示覆盖率提升且碰撞减少。

Comments Accepted for publication in the Proceedings of the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 6 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24889 2026-07-29 cs.LG cs.AI cs.CE 新提交

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

GAUGE:在没有标准答案的情况下对代理构建的金融模型进行评分

Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

AI总结 研究针对金融模型无标准答案的问题,引入GAUGE基准,依据分析师实际做法评估代理构建的估值模型,通过多种方式验证,揭示高级、初级分析师及学生在模型评分上的差异,指出当前代理在模型构建与估值判断上的强弱情况,并发布相关资源。

Comments 35 pages, including appendices. Code, benchmark materials, and evaluation artifacts will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24856 2026-07-29 cs.CV cs.AI 新提交

DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization

DisasterTD:使用多模态大语言模型和跨视角地理定位的灾害地名消歧

Wenping Yin, Ziqi Liu, Naixia Mou, Weijia Li, Danfeng Hong, Hao Li

机构 * College of Geodesy and Geomatics, Shandong University of Science and Technology(山东科技大学测绘与地理信息学院) School of Environmental Science and Spatial Informatics, China University of Mining and Technology(中国矿业大学环境与测绘学院) State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing, Wuhan University(武汉大学测绘遥感信息工程国家重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Automation, Southeast University(东南大学自动化学院) Department of Geography, National University of Singapore(新加坡国立大学地理系)

AI总结 研究针对社交媒体图像地理参考模糊问题,提出DisasterTD框架,集成多模态大语言模型语义推理与跨视角地理定位,在飓风哈维数据集上评估,该方法优于基线,能有效进行细粒度灾害地理定位,提升不同距离下的定位准确率并减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24794 2026-07-29 cs.AI cs.CV 新提交

Reasoning with Memory: A Temporal Granularity-Adaptive Framework for Training-Free Long Video Understanding

利用记忆进行推理:一种用于免训练长视频理解的时间粒度自适应框架

Linghao Meng, Qiankun Li, Junyuan Mao, Pujin Liao, Zhicheng He, Enbo Zhang, Kun Wang, Yang Liu, Huazhu Fu, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(高性能计算研究所,科学、技术与研究机构(A*STAR)) Nanyang Technological University(南洋理工大学) University of Science and Technology of China(中国科学技术大学) Jilin University(吉林大学)

AI总结 研究针对多模态大语言模型长视频理解受限问题,提出ReMem框架,通过双级记忆增强自适应,在查询和视频级别分别处理,能适应不同时间粒度,经实验验证在多个基准测试中实现高效零样本性能,提升模型长视频推理能力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24112 2026-07-28 cs.AI 新提交

Scaling GUI Agents with Visual State Transitions

通过视觉状态转换扩展 GUI 智能体

Xiangyan Liu, Kaixin Li, Haonan Wang, Biao Wu, Meng Fang, Longxu Dou, Chao Du, Michael Qizhe Shieh, Tianyu Pang

机构 * NUS(新加坡国立大学) Sea AI Lab(Sea人工智能实验室) UTS(悉尼科技大学) University of Liverpool(利物浦大学)

AI总结 研究通过状态转换预训练扩展 GUI 智能体,联合优化逆动力学和正向动力学预训练统一多模态模型,在桌面和移动 GUI 场景基准测试中优于基线,联合动力学优化有稳定改进,下游性能随转换数据量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23794 2026-07-28 cs.CV cs.AI 新提交

PathScale-R1: Cross-scale Reasoning for Pathological Image Analysis

PathScale-R1:用于病理图像分析的跨尺度推理

Chi Phan, Tianyi Zhang, Yufeng Wu, Qiaochu Xue, Jiajie Zhang, Linghan Cai, Zeyu Liu, Sudong Wang, Yueming Jin, Dan Hu

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Fujian Medical University Cancer Hospital & Fujian Cancer Hospital(福建医科大学附属肿瘤医院)

AI总结 研究针对病理诊断多尺度需求及现有模型局限,引入抗捷径跨尺度病理推理框架,设计相关策略构建PathScale-VQA基准,经优化得到PathScale-R1,实验证明其在跨尺度推理任务性能及对单尺度病理VQA的有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23679 2026-07-28 cs.LG stat.ML 新提交

Breaking the Total Variance Barrier: Sharp Sample Complexity for Linear Heteroscedastic Bandits with Fixed Action Set

打破总方差障碍:具有固定动作集的线性异方差博弈的精确样本复杂度

Heyang Zhao, Tianyuan Jin, Weixin Wang, Vincent Y. F. Tan, Pan Xu, Quanquan Gu

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) National University of Singapore(新加坡国立大学) Duke University(杜克大学)

AI总结 研究具有固定动作集的线性异方差博弈问题,提出方差自适应算法\texttt{VAEE}及方差感知变体,实现了具有近乎调和均值依赖率的简单遗憾,打破了$\sqrt{\Lambda}$障碍,并建立了近乎匹配的下界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22123 2026-07-27 cs.RO 新提交

DB-VIO: Dual-Branch Visual Inertial Odometry with Enhanced Visual-Inertial Representation

DB-VIO:具有增强视觉惯性表示的双分支视觉惯性里程计

Ziyu Wan, Lin Zhao

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究针对视觉惯性里程计问题,提出DB-VIO双分支框架,通过融入深度线索、姿态先验和解耦姿态估计进行运动特定时间建模,实验表明该方法在自动驾驶和空中机器人基准测试中性能优异,提升了旋转和平移估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22115 2026-07-27 cs.DB cs.AI 新提交

Benchmarking Text-to-SQL under Role-Based Access Control

基于角色的访问控制下的文本到SQL基准测试

Yang Fei, Yangfan Jiang, Yin Yang, Xiaokui Xiao

机构 * National University of Singapore(新加坡国立大学) Hamad Bin Khalifa University(哈马德·本·卡西姆大学)

AI总结 研究基于角色的访问控制下文本到SQL的基准测试问题,提出含现实RBAC约束的综合基准测试框架,通过大语言模型辅助工作流程及人工审核等增强基准,应用该框架研究发现部分高分系统在有访问约束时性能因RBAC违规而大幅下降。

Comments Accepted at ACM SIGMOD 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21964 2026-07-27 cs.RO cs.AI 新提交

ACME: A Multi-Cultural, Multi-Embodiment Social-Navigation Dataset

ACME:一个多文化、多实体的社会导航数据集

Shashank Rao Marpally, Allan Wang, Atharva Ghotavadekar, Renato Alexandre Ribeiro, Nhat Le, Pilar Bachiller-Burgos, Pranav Goyal, Subham Agrawal, Yasuhiro Nitta, Howard Ziyu Han, Daeun Song, Masaki Kuribayashi, Kohei Uehara, Xiyue Wang, Yangzhe Kong, Duc M. Nguyen, Amirreza Payandeh, Gerardo Pérez-González, Alejandro Torrejón-Harto, Jeeho Ahn, Tisha Jain, Andrew Stratton, Elvin Yang, Jorge de Heuvel, Nico Ostermann-Myrau, Sai Anudeep Sajja, Mithilya Raj, Daisuke Sato, Gaston Rouquette, Nikolas Martelaro, Maki Sugimoto, Hironobu Takagi, Chieko Asakawa, Maren Bennewitz, Aaron Steinfeld, Xuesu Xiao, Christoforos Mavrogiannis, Harold Soh

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院)

AI总结 该研究针对现有社会导航数据集缺乏文化等多样性的问题,引入ACME数据集,通过多国多地多机器人实体大规模收集数据,提供多种数据便于学习与预测,经分析其能捕捉更具挑战场景及更广泛行人行为。

Comments 24 Pages, 19 Figures, Submitted to IJRR on June 29th 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21588 2026-07-24 cs.RO 新提交

AXIS: A Growable Community-Driven Data Engine for Scalable Robot Manipulation

AXIS:用于可扩展机器人操作的可增长社区驱动数据引擎

Mengfei Zhao, Dihong Huang, Yikai Tang, Peihao Li, Mingxuan Yan, Ruiqi Zhuang, Yanjia Huang, Jie Wang, Hai Zhai, Tony Zhou, Rui Zhang, Zhexi Luo, Yuchen Huang, Jianfei Yang, Jiachen Li

机构 * Axis Robotics(轴机器人公司) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德州农工大学) Johns Hopkins University(约翰·霍普金斯大学) University of Pennsylvania(宾夕法尼亚大学) University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 研究针对机器人操作策略学习中数据管道难扩展的问题,提出AXIS这一可增长社区驱动数据引擎,它能收集、处理数据并组织成任务快照,通过实验表明其能提升模型性能且随数据量增加有一致扩展性。

Comments Project Website: https://axisaiorg.github.io/AXIS-V1/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21067 2026-07-24 cs.CL 新提交

PrefReward: Learning User Preference Matrix for Personalized Text Generation

PrefReward:学习用于个性化文本生成的用户偏好矩阵

Yue Wu, Chengbing Wang, Yimeng Bai, Xiaoyan Zhao, Yang Zhang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对大语言模型个性化生成中存在的问题,提出PrefReward框架,通过提取用户特定偏好矩阵并将其作为奖励信号指导生成,实验证明该框架在生成质量和个性化可解释性上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20973 2026-07-24 cs.RO 新提交

Deep Reinforcement-Learning-Guided Model Predictive Control for Preventing Overtakes in Autonomous Racing

深度强化学习引导的模型预测控制在自主赛车中防止超车的应用

Yufei Xi, Yijie Liao, Tulga Ersal

机构 * University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学)

AI总结 研究自主赛车防御性阻挡问题,通过分层强化学习引导的模型预测控制框架,将防御转化为空间占用调节问题。在仿真中提升平均超车时间,减少对手前进距离,使车辆有效利用轮胎力,且求解时间短,支持实时高速对抗。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20935 2026-07-24 cs.CE cs.CL 新提交

Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad

化学思维链函数作为易产生幻觉的分子草稿本

Jiatong Li, Yuxuan Ren, Weida Wang, Xiaoyong Wei, Yatao Bian

机构 * Blue Whale Lab, National University of Singapore(新加坡国立大学蓝鲸实验室) Hong Kong Polytechnic University(香港理工大学) Fudan University(复旦大学)

AI总结 研究化学推理语言模型中思维链的作用,发现其在多个模型和任务中易产生幻觉且与答案正确性无关,存在共享草稿本功能,如Chem-R依赖SMILES草稿,干扰其草图会影响生成,表明化学CoT是易产生幻觉的分子草稿本,提醒不能仅以CoT判断推理可靠性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19876 2026-07-23 cs.RO cs.CV 新提交

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20205 2026-07-23 stat.ML cs.LG math.ST stat.TH 新提交

Statistical Inference for Rank Allocation in Low-Rank Adaptation

低秩适应中秩分配的统计推断

Yihang Gao, Vincent Y. F. Tan

机构 * Department of Mathematics, National University of Singapore(数学系,新加坡国立大学) Department of Mathematics and Department of Electrical and Computer Engineering, National University of Singapore(数学系和电气与计算机工程系,新加坡国立大学)

AI总结 研究低秩适应中在固定参数预算下分配秩资源的问题,提出StatLoRA方法,将其表述为统计假设检验问题,通过检验统计量和p值确定组件取舍,实验表明该方法在匹配秩预算下性能良好,支持了分配规则稳定性及渐近理论。

Comments 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19786 2026-07-23 math.NA cs.LG cs.NA 新提交

A Structure-Adaptive Random Feature Method for High-Dimensional Elliptic PDEs

一种用于高维椭圆型偏微分方程的结构自适应随机特征方法

Jiale Linghu, Hao Dong, Yangshuai Wang

机构 * School of Mathematics and Statistics, Xidian University(西安电子科技大学数学与统计学学院) National University of Singapore(新加坡国立大学)

AI总结 该研究针对高维椭圆型偏微分方程,提出分层方差分析随机特征方法(HA-RFM),通过选择坐标块、识别低秩特征等步骤,建立误差界并推导相关保证,在随机岭测试等方面有显著效果,扩展了半线性计算维度并描绘了坐标族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18228 2026-07-21 cs.AI cs.CL 新提交

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes

压力下的逻辑判断:用学习到的软前缀诊断三段论稳定性

Brian K Chen

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究在三段论推理基准前加软前缀,探究学习到的上下文压力对模型逻辑判断的影响,发现软前缀能改变正确答案,在多模型测试中效果优于随机对照,主要影响是答案偏好,不同模型有显著差异。

Comments 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18072 2026-07-21 cs.LG cs.AI 新提交

SGN: A Similarity-based Generative Network for Data Generation under Distribution Shift

SGN:一种用于分布偏移下数据生成的基于相似度的生成网络

Jiaqi Zhu, Xincheng Chen, Yuncheng Wu, Zhaojing Luo, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学)

AI总结 研究分布偏移下数据生成问题,提出基于相似度的生成网络SGN,在源数据训练后无需参数更新用于新目标域,通过学习潜在空间和利用目标域小代表性集,实现目标引导数据增强,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16873 2026-07-21 cs.CV 新提交

InfoDense: Density-Aware Regional Decisive Replay for Memory-Efficient Incremental Face Forgery Detection

InfoDense:用于内存高效增量式人脸伪造检测的密度感知区域决定性重放

Jikang Cheng, Hao Shen, Xueyi Zhang, Guangcheng Wang, Zhongyuan Wang, Renye Yan, Baojin Huang

机构 * Huazhong Agricultural University(华中农业大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Nantong University(南通大学) Wuhan University(武汉大学)

AI总结 针对人脸伪造技术发展带来的检测挑战及传统方法的问题,提出密度感知区域决定性重放策略InfoDense,通过定位决定性补丁、排序候选片段、自适应合并样本等步骤,有效减轻灾难性遗忘,提升跨域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16806 2026-07-21 cs.RO 新提交

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16303 2026-07-21 cs.CV cs.AI 新提交

Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation

Med-OPD:通过证据感知策略蒸馏改进医学视觉语言模型

Yunhang Qian, Jiaquan Yu, Jiawei Liu, Meng Wang, Hongwei Bran Li, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究针对医学视觉语言模型依赖语言先验而非视觉证据推理的问题,提出Med-OPD框架,引入医学证据优势信号,在令牌和轨迹级别重新分配蒸馏信号,实验证明该方法能加强模型对关键视觉证据的依赖,提升多模态医学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16295 2026-07-21 cs.CV cs.AI 新提交

Emergent Hierarchical Monosemantic Neurons from the Group-Contrastive Forward-Forward Algorithm

基于群对比前向算法的涌现分层单语义神经元

Yiming Tang, Qinglin Qi, Zhaoqian Yao, Harshvardhan Saini, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Lund University(隆德大学) Chinese University of Hong Kong(香港中文大学) Indian Institute of Technology, Dhanbad(印度理工学院(丹巴德分校))

AI总结 研究探讨神经网络表示的可解释性,针对稀疏字典学习范式的局限,提出群对比前向算法GCFF,通过架构约束实现单语义性,能捕捉非线性概念,在CLIP表示上表现良好,还能从头训练网络并在图像分类基准中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16251 2026-07-21 cs.LG 新提交

Learning Spatio-Temporal Foundation Models from Pure Synthetic Data

从纯合成数据中学习时空基础模型

Yutong Feng, Shiyuan Piao, Yutong Xia, Xu Liu, Wenqi Fan, Fugee Tsung, See-Kiong Ng, Yuxuan Liang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 研究旨在学习时空基础模型,提出NeoST,通过在程序生成的合成系统上预训练,引入可扩展语料库、潜在空间推理架构和目标,实验证明其在多样真实世界时空系统中性能优越,有长期稳定性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17469 2026-07-21 cs.CC cond-mat.stat-mech cs.LG math.CO math.PR 新提交

The Dimension of Nonterminating Resampling Computations

非终止重采样计算的维度

Yunbei Xu

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究非终止重采样计算的维度,通过主定理界定相关量,探讨源幂信息,分析不同修复规则及\(k\)-SAT 等情况,得出有限磁带源下规则的非终止维度差异、\(k\)-SAT 终止条件及公式维度界等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15808 2026-07-20 cs.CV 新提交

Examining the Associations between Visual and Non-Visual Elements and Cyclists' Route Choices for Various Trip Purposes

研究视觉与非视觉元素与不同出行目的下骑行者路线选择之间的关联

Heyang Hua, Koichi Ito, Filip Biljecki

机构 * Department of Architecture, National University of Singapore(新加坡国立大学建筑系) Department of Real Estate, National University of Singapore(新加坡国立大学房地产系)

AI总结 研究不同出行目的下骑行者路线选择,通过数据驱动案例研究,分析视觉与非视觉因素对其影响,揭示影响积极骑行的时空特征,为街道网络规划和基础设施发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15661 2026-07-20 cs.CV 新提交

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach

用于医学视觉语言模型的模型合并:一个基准和一种赢家通吃的方法

Lichao Mou, Shilan Zhang, Chunlei Li, Bingcong Yan, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lei Li, Yaxiong Chen

机构 * Wuhan University of Technology(武汉理工大学) Technical University of Munich(慕尼黑工业大学) National University of Singapore(新加坡国立大学)

AI总结 研究医学LVLMs的模型合并,提出涵盖多种成像模态和临床任务类型的MergeMedBench基准,评估现有合并方法,提出赢家通吃方法,该方法简单且无超参数,优于现有方法,为LoRA合并提供新视角和实用基线。

Comments Project Page: https://github.com/MedAI-T/MergeMedBench

详情

展开后加载摘要…

URL PDF HTML 收藏