arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-04-21 至 2026-04-21 共收录 57
2601.00296 2026-04-21 cs.CV

TimeColor: Flexible Reference Colorization via Temporal Concatenation

TimeColor:通过时间拼接实现灵活的参考着色

Bryan Constantine Sadihin, Yihao Meng, Michael Hua Wang, Matteo Jiahao Chen, Hang Su

机构 * Computer Science and Technology(计算机科学与技术) Tsinghua University(清华大学)

AI总结 TimeColor通过时间拼接技术实现灵活的参考着色,利用显式每参考区域分配支持异构、可变数量的参考,提高颜色保真度、身份一致性和时间稳定性。

Comments Our project page is available at https://bconstantine.github.io/TimeColor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11281 2026-04-21 cs.CL cs.AI cs.CY

ToxiFrench: Benchmarking and Enhancing Language Models via CoT Fine-Tuning for French Toxicity Detection

ToxiFrench:通过CoT微调提升法语毒性检测的语言模型基准测试

Axel Delaval, Shujian Yang, Haicheng Wang, Han Qiu, Jialiang Lu

机构 * École Polytechnique(巴黎高等理工学院) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 本文提出ToxiFrench数据集,通过半自动化标注流程构建,发现小语言模型在毒性检测任务中表现更优,并提出动态加权损失策略提升模型忠实度,Qwen3-4B模型在基准测试中取得最佳性能。

Comments 22 pages, 5 figures, 11 tables. This paper introduces TOXIFRENCH, a benchmark of 53,622 comments for French toxicity detection. It proposes a Chain-of-Thought fine-tuning method with a dynamic weighted loss. The fine-tuned 4B model (Qwen3-4B) achieves state-of-the-art performance, outperforming larger models like GPT-4o and DeepSeek-R1

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02204 2026-04-21 cs.RO

TacMan-Turbo: Proactive Tactile Control for Robust and Efficient Articulated Object Manipulation

TacMan-Turbo:主动触觉控制用于稳健高效的机械臂物体操控

Zihang Zhao, Zhenghao Qi, Yuyang Li, Leiyao Cui, Zhi Han, Lecheng Ruan, Yixin Zhu

机构 * Peking University(北京大学) State Key Lab of General AI at Peking University(北京大学通用人工智能国家重点实验室) PKU-BingJi Joint Laboratory for Artificial Intelligence(北京大学-百度智云人工智能联合实验室) Wuhan Major Scientific and Technological Special Program(武汉重大科技专项) Hubei Embodied Intelligence Foundation Model Research and Development Program(湖北省具身智能基础模型研发计划) National Comprehensive Experimental Base for Governance of Intelligent Society(智能社会治理国家综合实验基地) LeapZenith AI Research(LeapZenith人工智能研究) Tsinghua University(清华大学) Embodied Intelligence Lab(具身智能实验室) PKU-Wuhan Institute for Artificial Intelligence(北京大学-武汉人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出TacMan-Turbo框架,通过主动触觉控制解决机械臂物体操控中有效性与效率的平衡问题,在200种模拟和真实物体上实现100%成功率,显著提升时间效率、动作效率和轨迹平滑度。

Comments Accepted for publication in the IEEE Transactions on Automation Science and Engineering (T-ASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20879 2026-04-21 cs.CV

DriveAgent-R1: Advancing VLM-based Autonomous Driving with Active Perception and Hybrid Thinking

DriveAgent-R1: 通过主动感知和混合思维推进基于视觉语言模型的自动驾驶

Weicheng Zheng, Xiaofei Mao, Nanfei Ye, Pengxiang Li, Kun Zhan, Xianpeng Lang, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) LiAuto Tongji University(同济大学) Tsinghua University(清华大学)

AI总结 DriveAgent-R1通过主动感知和混合思维框架,提升自动驾驶中的视觉推理能力,采用三阶段训练策略,在复杂场景中实现高效决策,展现与顶级模型相当的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05760 2026-04-21 cs.CL

Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning

Writing-RL: 通过自适应课程强化学习推进长文本写作

Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu

机构 * Institute for AI Industry Research (AIR)(人工智能产业研究院) Tsinghua University(清华大学) Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) Institute of Intelligent Computing(智能计算研究院) Alibaba Group(阿里巴巴集团)

AI总结 本文提出Writing-RL框架,通过自适应课程强化学习提升长文本写作能力,克服SFT的局限,实验表明其在长文本生成任务中优于基线模型。

Comments Code is released at https://github.com/Tongyi-Zhiwen/Writing-RL

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15404 2026-04-21 cs.CL

How Should We Enhance the Safety of Large Reasoning Models: An Empirical Study

如何增强大推理模型的安全性:一项实证研究

Zhexin Zhang, Xian Qi Loye, Victor Shea-Jay Huang, Junxiao Yang, Qi Zhu, Shiyao Cui, Fei Mi, Lifeng Shang, Yingkang Wang, Hongning Wang, Minlie Huang

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学对话人工智能(CoAI)小组,DCST,清华大学) Huawei Noah’s Ark Lab(华为诺亚实验室)

AI总结 本文通过监督微调探讨如何提升大推理模型的安全性,发现直接蒸馏安全响应无效,但针对性处理危险模式可显著提升安全性,且短或模板化推理过程同样有效。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02871 2026-04-21 cs.CL cs.AI

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning

位置:多模态大语言模型可以显著推动科学推理

Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen

机构 * Squirrel AI HKUST(GZ)(香港科技大学(广州)) HKUST(香港科技大学) Tsinghua University(清华大学) University of Illinois at Chicago(伊利诺伊大学香槟分校) Cornell University(康奈尔大学)

AI总结 本文探讨多模态大语言模型在科学推理中的应用,提出四阶段研究路线,指出当前模型在跨领域推理中的潜力与挑战,为实现通用人工智能提供新视角。

Comments Accepted by The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026, Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07464 2026-04-21 eess.IV cs.LG q-bio.QM

Multi-Beholder: Biomarker Prediction for Low-Grade Glioma with Multiple Instance Learning and One-Class Classification

多视角:利用多实例学习和一类分类进行低级别胶质瘤的生物标志物预测

Zijie Fang, Yihan Liu, Yifeng Wang, Xiangyang Zhang, Yang Chen, Changjing Cai, Yiyang Lin, Ying Han, Zhi Wang, Shan Zeng, Jun Tan, Yongbing Zhang, Hong Shen

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Department of Oncology, Xiangya Hospital, Central South University(湘雅医院肿瘤科,中南大学) School of Science, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)科学学院) Department of Neurosurgery, Xiangya Hospital, Central South University(湘雅医院神经外科,中南大学) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)计算机科学与技术学院)

AI总结 本文提出Multi-Beholder方法,通过全切片图像预测低级别胶质瘤的五个生物标志物状态,利用多实例学习和一类分类提高预测性能,并在两个不同队列中验证了其有效性。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16958 2026-04-21 cs.CV

Self-Reasoning Agentic Framework for Narrative Product Grid-Collage Generation

具有自我推理代理机制的叙事产品网格-拼贴生成框架

Minyan Luo, Yuxin Zhang, Yifei Li, Xincan Wang, Fuzhang Wu, Tong-Yee Lee, Oliver Deussen, Weiming Dong

机构 * MAIS,Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所马克思主义学院) Tsinghua University(清华大学) Shanghai Theatre Academy(上海戏剧学院) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) National Cheng Kung University(国立成功大学) University of Konstanz(康斯坦茨大学)

AI总结 本文提出一种自我推理代理框架,用于生成叙事产品网格拼贴,通过构建产品叙事框架和约束-aware提示,提升视觉一致性和叙事丰富度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16943 2026-04-21 cs.CL

MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

MNAFT:多模态大语言模型的模态神经感知微调用于图像翻译

Bo Li, Ningyuan Deng, Tianyu Dong, Shaobo Wang, Shaolin Zhu, Lijie Wen

机构 * School of Computer Science and Technology, Tianjin University, Tianjin, China(天津大学计算机科学与技术学院) School of Software, Tsinghua University, Beijing, China(清华大学软件学院) School of Information Resource Management, Renmin University of China,Beijing, China(中国人民大学信息资源管理学院) School of Artificial Intelligence, Shanghai Jiao Tong University, Shanghai, China(上海交通大学人工智能学院) Baidu Inc., Beijing, China(百度公司)

AI总结 本文提出MNAFT,通过识别视觉和语言模块中语言无关和语言特定的神经元,改进多模态大语言模型在图像翻译中的表现,实验表明其优于现有方法。

Comments Accepted by SCIS (SCIENCE CHINA Information Science)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16923 2026-04-21 cs.AI

Alignment Imprint: Zero-Shot AI-Generated Text Detection via Provable Preference Discrepancy

对齐印记:通过可证明的偏好偏差实现零样本AI生成文本检测

Junxi Wu, Kailin Huang, Dongjian Hu, Bin Chen, Hao Wu, Shu-Tao Xia, Changliang Zou

机构 * Nankai University(南开大学) Tsinghua University(清华大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Peng Cheng Laboratory(鹏城实验室) Wuhan University(武汉大学)

AI总结 本文提出通过可证明的偏好偏差检测AI生成文本,利用对齐印记理论分析,引入LAPD统计量提升检测性能,实验显示在多种设置下均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16887 2026-04-21 cs.RO

Time-Division Multiplexing Actuation in Tendon-Driven Arms: Lightweight Design and Fault Tolerance

tendon驱动臂的时间分割多路复用驱动:轻量化设计与容错性

Shoujie Li, Changqing Guo, Jianle Xu, Hong Luo, Xueqian Wang, Wenbo Ding, Bin Liang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院) Department of Automation, Tsinghua University(清华大学自动化系)

AI总结 本文提出了一种时间分割多路复用驱动方法,用于腱驱动机器人,实现轻量化设计和高容错性,通过垂直堆叠的旋转选择结构和双编码系统,使MuxArm在部分伺服故障下仍能保持1%的末端精度。

Comments 11 pages

Journal ref IEEE T-MECH Under review 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16558 2026-04-21 cs.LG

Cross-Modal Generation: From Commodity WiFi to High-Fidelity mmWave and RFID Sensing

跨模态生成:从商品WiFi到高保真毫米波和RFID传感

Zhixiong Yang, Long Jing, Yao Li, Shuli Cheng, Guoxuan Chi, Chenyu Wen

机构 * Xinjiang University(新疆大学) Northwest University(西北大学) Tsinghua University(清华大学)

AI总结 本文提出RF-CMG方法,利用丰富的WiFi数据生成高保真毫米波和RFID数据,通过高频指导与低频约束解耦生成过程,提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16550 2026-04-21 cs.LG cs.AI

An Interpretable Framework Applying Protein Words to Predict Protein-Small Molecule Complementary Pairing Rules

一种应用蛋白质词预测蛋白质-小分子互补配对规则的可解释框架

Jingke Chen, Jingrui Zhong, Tazneen Hossain Tani, Zidong Su, Xiaochun Zhang, Boxue Tian

机构 * MOE Key Laboratory of Bioinformatics(教育部生物信息学重点实验室) State Key Laboratory of Molecular Oncology(分子肿瘤学国家重点实验室) Beijing Frontier Research Center for Biological Structure(北京前沿生物结构研究中心) School of Pharmaceutical Sciences, Tsinghua University(清华大学药学院)

AI总结 本文提出PWRules框架,通过蛋白质词和小分子片段的互补配对规则提升蛋白质-小分子结合预测的可解释性,PWScore在基准数据集上表现优异,适用于训练数据集外的蛋白质靶点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16472 2026-04-21 cs.GT cs.AI cs.MA econ.GN econ.TH q-fin.EC

Training Language Models for Bilateral Trade with Private Information

利用私人信息训练语言模型进行双边贸易

Dirk Bergemann, Soheil Ghili, Xinyang Hu, Chuanhao Li, Zhuoran Yang

机构 * Department of Economics, Yale University(耶鲁大学经济学系) Yale School of Management, Yale University(耶鲁大学管理学院) Department of Statistics and Data Science, Yale University(耶鲁大学统计与数据科学系) Department of Industrial Engineering, Tsinghua University(清华大学工业工程系)

AI总结 本文研究了在不完全信息下双边谈判中语言模型的能力,通过结构化谈判环境评估模型表现,发现有效策略通过连续报价实现价格歧视,训练实验表明监督微调和强化学习影响收益分配和交易完成率。

Comments 67 pages, 34 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16391 2026-04-21 cs.RO cs.CV

Disentangled Robot Learning via Separate Forward and Inverse Dynamics Pretraining

通过分离前向和逆向动力学预训练实现解耦的机器人学习

Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Eastern Institute of Technology, Ningbo(宁波东部技术研究所) Shanghai Innovation Institute(上海创新研究院) Tsinghua University(清华大学)

AI总结 本文提出DeFI框架,通过分离前向和逆向动力学预训练,利用不同数据源解决视觉-动作耦合问题,实现端到端微调,实验表明在CALVIN ABC-D和SimplerEnv上取得最佳性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16317 2026-04-21 cs.IR cs.AI

Paper2Data: Large-Scale LLM Extraction and Metadata Structuring of Global Urban Data from Scientific Literature

Paper2Data: 大规模LLM提取和全球城市数据元数据结构化从科学文献

Runwen You, Tong Xia, Jingzhi Wang, Jiankun Zhang, Tengyao Tu, Jinghua Piao, Yi Chang, Yong Li

机构 * Jilin University(吉林大学) Zhongguancun Academy(中关村学院) Tsinghua University(清华大学)

AI总结 本文提出Paper2Data方法,通过大规模LLM驱动管道自动提取科学文献中的城市数据集并结构化元数据,构建了UrbanDataMiner平台,实现了全球城市数据的发现与系统化研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17550 2026-04-21 cs.LG cs.AI

MASPO: Unifying Gradient Utilization, Probability Mass, and Signal Reliability for Robust and Sample-Efficient LLM Reasoning

MASPO:统一梯度利用、概率质量与信号可靠性以实现鲁棒且样本高效的LLM推理

Xiaoliang Fu, Jiaye Lin, Yangyi Fang, Binbin Zheng, Chaowen Hu, Zekai Shao, Cong Qin, Lu Pan, Ke Zeng, Xunliang Cai

机构 * Meituan(美团) Fudan University(复旦大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学)

AI总结 MASPO通过统一框架解决RLVR方法中梯度利用低效、概率质量不敏感和信号可靠性不对称的问题,提升LLM推理的鲁棒性和样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01801 2026-04-21 cs.CL

Detecting LLM-Generated Spam Reviews by Integrating Language Model Embeddings and Graph Neural Network

通过整合语言模型嵌入和图神经网络检测LLM生成的垃圾评论

Xin Liu, Rongwu Xu, Xinyi Jia, Jason Liao, Jiao Sun, Ling Huang, Wei Xu

机构 * Tsinghua University(清华大学) University of British Columbia(不列颠哥伦比亚大学) Google DeepMind(谷歌DeepMind)

AI总结 本文提出FraudSquad模型,结合预训练语言模型嵌入和门控图变压器,有效检测LLM生成的垃圾评论,实验表明其在精度和召回率上优于现有方法,且模型规模小,训练数据需求低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15229 2026-04-21 cs.CL cs.AI cs.LG

VocabTailor: Dynamic Vocabulary Selection for Downstream Tasks in Small Language Models

VocabTailor: 小语言模型下游任务中的动态词汇选择

Hanling Zhang, Yayu Zhou, Tongcheng Fang, Zhihang Yuan, Guohao Dai, Wanli Ouyang, Yu Wang

机构 * The Chinese University of Hong Kong(香港中文大学) Infinigence AI Tsinghua University(清华大学) SLAI Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 VocabTailor通过动态词汇选择框架减少小语言模型词汇相关组件的内存使用,结合静态与动态策略,实现高达99%的内存节省且不影响性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05405 2026-04-21 cs.CV

A VLM-based Method for Visual Anomaly Detection in Robotic Scientific Laboratories

基于VLM的方法用于机器人科学实验室中的视觉异常检测

Shiwei Lin, Chenxu Wang, Xiaozhen Ding, Yi Wang, Boyuan Du, Lei Song, Chenggang Wang, Huaping Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) School of Physics and Electronic Information, Yantai University(烟台大学物理与电子信息学院) School of Computer and Big Data, Fuzhou University(福州大学计算机与大数据学院) Department of Automation, Shanghai Jiao Tong University(上海交通大学自动化系)

AI总结 本文提出基于VLM的视觉推理方法,通过四个逐步信息提示配置实现多级监督,构建了专用视觉基准以评估其在科学流程异常检测中的有效性,实验表明提供更多上下文信息可提升检测准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00772 2026-04-21 cs.LG cs.AI cs.CL

LIFT the Veil for the Truth: Principal Weights Emerge after Rank Reduction for Reasoning-Focused Supervised Fine-Tuning

揭开真相的面纱:秩减少后主权重的浮现使以推理为导向的监督微调得以提升

Zihang Liu, Tianyu Pang, Oleg Balabanov, Chaoqun Yang, Tianjin Huang, Lu Yin, Yaoqing Yang, Shiwei Liu

机构 * University of California, Berkeley, CA, USA(加州大学伯克利分校) International Computer Science Institute, CA, USA(国际计算机科学研究所) Lawrence Berkeley National Laboratory, CA, USA(伯克利国家实验室) Dartmouth College, NH, USA(达特茅斯学院) University of Exeter, Exeter, UK(埃克塞特大学) University of Oxford, Oxford, UK(牛津大学) University of Surrey, Guildford, UK(萨里大学) Tsinghua University, China(清华大学) Eindhoven University of Technology, the Netherlands(埃因霍温理工大学)

AI总结 本文提出LIFT方法,通过秩减少后选取主权重进行微调,提升推理能力,同时保持内存效率,优于全微调和LoRA。

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21471 2026-04-21 cs.CL

Scaling External Knowledge Input Beyond Context Windows of LLMs via Multi-Agent Collaboration

通过多智能体协作扩展LLM上下文窗口之外的知识输入

Zijun Liu, Zhennan Wan, Peng Li, Ming Yan, Fei Huang, Yang Liu

机构 * Dept. of Comp. Sci. & Tech., Institute for AI, Tsinghua University, Beijing, China(计算机科学与技术系,人工智能研究院,清华大学,北京,中国) Institute for AI Industry Research (AIR), Tsinghua University, Beijing, China(人工智能产业研究院(AIR),清华大学,北京,中国) Institute of Intelligent Computing, Alibaba Group(智能计算研究院,阿里巴巴集团)

AI总结 本文提出ExtAgents框架,通过多智能体协作提升LLM在不延长上下文窗口的情况下整合外部知识的能力,实验证明其在多跳问答和长文本生成任务中优于现有方法。

Comments Accepted to ACL 2026. 31 pages, 10 figures. Code and data are available at https://github.com/THUNLP-MT/ExtAgents

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20075 2026-04-21 cs.AI

Curriculum-RLAIF: Curriculum Alignment with Reinforcement Learning from AI Feedback

Curriculum-RLAIF: 通过人工智能反馈的强化学习进行课程对齐

Jiaye Lin, Mengdi Li, Xufeng Zhao, Wenhao Lu, Peilin Zhao, Stefan Wermter, Di Wang

机构 * Tsinghua University(清华大学) Provable Responsible AI and Data Analytics Lab(可证明责任AI与数据 analytics 实验室) King Abdullah University of Science and Technology(卡布斯王国科学与技术大学) University of Hamburg(汉堡大学) Tencent Inc.(腾讯公司) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出Curriculum-RLAIF框架,通过构建不同难度的偏好对,提升奖励模型的泛化能力,从而显著提高策略模型对齐性能,且无需额外推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18232 2026-04-21 cs.LG cs.AI cs.CL

Two-Stage Regularization-Based Structured Pruning for LLMs

基于两阶段正则化的结构剪枝用于大语言模型

Mingkuan Feng, Jinyang Wu, Siyuan Liu, Shuai Zhang, Hongjian Fang, Ruihan Jin, Feihu Che, Pengpeng Shao, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Peking University(北京大学) Beijing National Research Center for Information Science and Technology(北京信息科学研究院)

AI总结 本文提出TRSP方法,通过两阶段正则化提升大语言模型结构剪枝效果,减少知识损失并无需重新训练,实验显示其优于现有方法,实现高效部署。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16549 2026-04-21 cs.CV

MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems

MathFlow: 提升多模态大语言模型在视觉数学问题中的感知流

Shuhang Chen, Hangjie Yuan, Yunqiu Xu, Pengwei Liu, Tao Feng, Jun Cen, Zeying Huang, Yi Yang

机构 * Zhejiang University(浙江大学) Intelligent Learning(智能学习) Tsinghua University(清华大学)

AI总结 本文提出MathFlow框架,通过分离感知与推理阶段,提升多模态大语言模型在视觉数学问题中的表现,实验表明其在不同推理模型中均有效。

Comments Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12950 2026-04-21 cs.AI

NumCoKE: Ordinal-Aware Numerical Reasoning over Knowledge Graphs with Mixture-of-Experts and Contrastive Learning

NumCoKE: 基于混合专家和对比学习的图知识中有序意识数值推理

Ming Yin, Zongsheng Cao, Qiqing Xia, Chenyang Tu, Neng Gao

机构 * State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Department of Information Science, Tsinghua University(清华大学信息学院)

AI总结 本文提出NumCoKE框架,通过混合专家和对比学习解决知识图谱中数值推理的语义整合不足和有序区分困难问题,实验表明其在不同属性分布下表现优越。

Comments Update

详情

展开后加载摘要…

URL PDF HTML 收藏