arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Nanyang Technological University(南洋理工大学)

共收录 2393
2604.22018 2026-04-27 q-bio.NC cs.AI cs.LG eess.SP

Foundation models for discovering robust biomarkers of neurological disorders from dynamic functional connectivity

用于从动态功能连接中发现神经疾病稳健生物标记物的基础模型

Deepank Girish, Yi Hao Chan, Sukrit Gupta, Jing Xia, Jagath C. Rajapakse

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算与数据科学学院,新加坡) Department of Biomedical Engineering and the School of Artificial Intelligence and Data Engineering, Indian Institute of Technology Ropar, India(印度理工学院罗帕尔分校生物医学工程系和人工智能与数据工程学院) College of Instrument and Computer Science, Zhejiang University, China(浙江大学仪器与计算机科学学院)

AI总结 本文提出RE-CONFIRM框架,评估深度学习模型中潜在生物标记物的稳健性,发现传统指标不足,提出Hub-LoRA技术提升模型性能并产生神经生物学忠实的生物标记物。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20979 2026-04-27 cs.LG

Toward Robust and Efficient ML-Based GPU Caching for Modern Inference

迈向鲁棒且高效的基于机器学习的GPU缓存

Peng Chen, Jiaji Zhang, Hailiang Zhao, Yirong Zhang, Shenyao Chen, Jiahong Yu, Xueyan Tang, Yixuan Wang, Hao Li, Jianping Zou, Gang Xiong, Kingsum Chow, Shuibing He, Shuiguang Deng

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Kuaishou(快手)

AI总结 本文提出学习增强型LRU算法,通过整合预测提升缓存性能,实现1-一致性与O(k)-鲁棒性,同时在GPU上构建LCR缓存,实验显示在LLM和DLRM任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21435 2026-04-27 cs.AI

Graph-to-Vision: Multi-graph Understanding and Reasoning using Vision-Language Models

图到视觉:利用视觉-语言模型进行多图理解与推理

Qihang Ai, Ruizhou Li, Menghui Wang, Haiyun Jiang

机构 * Nanyang Technological University(南洋理工大学) Shandong University(山东大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 本文提出首个评估和提升视觉语言模型多图推理能力的基准,涵盖四种常见图类型并支持复杂任务,评估了多种先进模型并验证了数据集的有效性。

Comments 26 pages, 23 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.00577 2026-04-27 cs.LG eess.SP q-bio.NC

Discovering robust biomarkers of psychiatric disorders from resting-state functional MRI via graph neural networks: A systematic review

通过图神经网络从静息态功能性磁共振成像中发现心理障碍的稳健生物标志物:系统综述

Yi Hao Chan, Deepank Girish, Sukrit Gupta, Jing Xia, Chockalingam Kasi, Yinan He, Conghao Wang, Jagath C. Rajapakse

机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science and Engineering, Indian Institute of Technology(印度理工学院计算机科学与工程系)

AI总结 本文综述了利用图神经网络和模型可解释性技术在静息态fMRI数据中发现心理障碍生物标志物的研究,指出现有方法在评估生物标志物稳健性时存在主观性,提出建立客观评估标准以提高可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21008 2026-04-24 cs.CV

Linear Image Generation by Synthesizing Exposure Brackets

通过合成曝光快门生成线性图像

Yuekun Dai, Zhoutong Zhang, Shangchen Zhou, Nanxuan Zhao

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Adobe NextCam Adobe Research(Adobe研究院)

AI总结 本文提出基于文本的线性图像生成方法,通过合成曝光快门序列生成高质量场景参考线性图像,保留完整动态范围,用于专业后期处理。

Comments accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20421 2026-04-23 cs.LG

Unlocking the Forecasting Economy: A Suite of Datasets for the Full Lifecycle of Prediction Market: [Experiments \& Analysis]

解锁预测经济:一个用于预测市场全生命周期的数据集套件:[实验与分析]

Huaiyu Jia, Luofeng Zhou, Wentao Zhang, Lin William Cong, Siguang Li, Shuo Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出首个持续维护的去中心化预测市场全生命周期数据集,通过整合市场元数据、交易记录和预言机事件,提供可复现且可扩展的数据模型,用于分析市场活动及NBA和CPI案例。

Comments Project page: https://www.polymonitor.club/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19790 2026-04-23 cs.AI cs.LG

Hidden Reliability Risks in Large Language Models: Systematic Identification of Precision-Induced Output Disagreements

大语言模型中的隐藏可靠性风险:系统性识别精度诱导的输出分歧

Yifei Wang, Tianlin Li, Xiaohan Zhang, Xiaoyu Zhang, Wei Ma, Mingfei Cheng, Li Pan

机构 * Shanghai Jiao Tong University(上海交通大学) Beihang University(北航) Nanyang Technological University(南洋理工大学) Singapore Management University(新加坡管理学院)

AI总结 本文提出PrecisionDiff框架,用于系统检测大语言模型在不同精度下的行为分歧,通过生成精度敏感测试输入并进行跨精度比较分析,揭示传统方法难以发现的细微差异,实验表明此类分歧在多个开源对齐LLM中普遍存在,PrecisionDiff在检测此类问题上表现优异。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05687 2026-04-23 cs.CV

3D Smoke Scene Reconstruction Guided by Vision Priors from Multimodal Large Language Models

由多模态大语言模型视觉先验引导的3D烟雾场景重建

Xinye Zheng, Fei Wang, Yiqi Nie, Kun Li, Junjie Chen, Jiaqi Zhao, Yanyan Wei, Zhiliang Wu

机构 * Hefei University of Technology(合肥工业大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) Anhui University(安徽大学) United Arab Emirates University(阿联酋大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出整合视觉先验与高效3D场景建模的框架,通过增强烟雾退化图像和开发Smoke-GS框架,提升烟雾场景重建与视图合成的鲁棒性与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14222 2026-04-23 cs.CR cs.AI

Membership Inference for Contrastive Pre-training Models with Text-only PII Queries

对比预训练模型的成员推断与仅文本隐私信息查询

Ruoxi Cheng, Yizhong Ding, Jian Zhao, Hongyi Zhang, Haoxuan Ma, Tianle Zhang, Yiyan Huang, Xuelong Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院(TeleAI)) Nanyang Technological University(南洋理工大学) Nanjing University(南京大学) School of Computing and Information Technology, Great Bay University(广东大湾区大学计算机与信息科技学院)

AI总结 本文提出UMID框架,通过仅文本模态推断多模态模型的记忆,有效检测隐私信息泄露,无需生物特征输入,提升隐私审计效率与效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18263 2026-04-23 cs.LG cs.CV cs.GR

From Competition to Synergy: Unlocking Reinforcement Learning for Subject-Driven Image Generation

从竞争到协同:解锁受主体驱动的图像生成中的强化学习

Ziwei Huang, Ying Shu, Hao Fang, Quanyu Long, Wenya Wang, Qiushi Guo, Tiezheng Ge, Leilei Gan

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Customized-GRPO方法,通过Synergy-Aware Reward Shaping和Time-Aware Dynamic Weighting解决强化学习中身份保持与提示遵循的平衡问题,提升图像生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00585 2026-04-23 cs.CY cs.AI

Fairness Testing of Large Language Models in Role-Playing

大型语言模型在角色扮演中的公平性测试

Xinyue Li, Zhenpeng Chen, Jie M. Zhang, Ying Xiao, Tianlin Li, Weisong Sun, Yang Liu, Yiling Lou, Xuanzhe Liu

机构 * Peking University(北京大学) Tsinghua University(清华大学) King's College London(伦敦国王学院) Nanyang Technological University(南洋理工大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文通过生成33000个角色特定问题,评估10种先进LLM在角色扮演场景中的公平性,发现107580次偏见响应,揭示角色扮演中偏见的普遍性。

Comments Accepted by ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20719 2026-04-23 cs.SD cs.AI cs.MM eess.AS

ONOTE: Benchmarking Omnimodal Notation Processing for Expert-level Music Intelligence

ONOTE:面向专家级音乐智能的多模态记谱处理基准测试

Menghe Ma, Siqing Wei, Yuecheng Xing, Yaheng Wang, Fanhong Meng, Peijun Han, Luu Anh Tuan, Haoran Luo

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出ONOTE基准测试,通过确定性流程消除记谱系统偏差,揭示多模态模型在感知准确性和音乐理论理解间的根本分歧。

Comments 12 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20652 2026-04-23 cs.AI cs.HC econ.GN q-fin.EC

Large Language Models Outperform Humans in Fraud Detection and Resistance to Motivated Investor Pressure

大语言模型在欺诈检测中优于人类且对有动机投资者压力具有抵抗力

Nattavudh Powdthavee

机构 * Nanyang Technological University(南洋理工大学)

AI总结 研究发现大语言模型在欺诈检测中表现优于人类,且在面对有动机投资者压力时未抑制欺诈预警,而人类顾问在压力下更倾向于支持欺诈投资。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19405 2026-04-22 cs.CL

Lost in Translation: Do LVLM Judges Generalize Across Languages?

迷失在翻译中:大型视觉-语言模型(LVLM)的评判者是否能跨语言泛化?

Md Tahmid Rahman Laskar, Mohammed Saidul Islam, Mir Tafseer Nayeem, Amran Bhuiyan, Mizanur Rahman, Shafiq Joty, Enamul Hoque, Jimmy Huang

机构 * York University(约克大学) University of Alberta(阿尔伯塔大学) Nanyang Technological University(南洋理工大学) Salesforce AI Research(Salesforce AI研究)

AI总结 本文提出MM-JudgeBench,首个多语言多模态评判模型评估基准,包含60000+跨25种语言的配对偏好实例,揭示了LVLM评判器在跨语言性能上的显著差异,指出模型大小和架构并非多语言鲁棒性的良好预测因素。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19083 2026-04-22 cs.CR cs.AI

ProjLens: Unveiling the Role of Projectors in Multimodal Model Safety

ProjLens: 揭示项目器在多模态模型安全中的作用

Kun Wang, Cheng Qian, Miao Yu, Lilan Peng, Liang Lin, Jiaming Zhang, Tianyu Zhang, Yu Cheng, Yang Wang

机构 * University of Science and Technology of China(中国科学技术大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Nanyang Technological University(南洋理工大学) Southwest Jiaotong University(西南交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 ProjLens通过分析多模态大语言模型中的后门攻击机制,揭示了项目器在安全漏洞中的关键作用,发现后门注入参数编码于低秩子空间,并通过实验验证了激活机制的差异。

Comments 18 pages ,15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18963 2026-04-22 cs.LG cs.AI

Distillation Traps and Guards: A Calibration Knob for LLM Distillability

知识蒸馏陷阱与守护:一种用于LLM可蒸馏性的校准调节器

Weixiao Zhan, Yongcheng Jing, Leszek Rutkowski, Dacheng Tao

机构 * Generative AI Lab, College of Computing and Data Science(生成人工智能实验室,计算与数据科学学院) Nanyang Technological University(南洋理工大学) Systems Research Institute of the Polish Academy of Sciences(波兰科学院系统研究所) AGH University of Krakow(克拉科夫AGH大学) SAN University(SAN大学)

AI总结 本文分析了知识蒸馏中的陷阱,提出了一种后处理校准方法,通过强化学习微调控制教师模型的可蒸馏性,提升蒸馏效果和模型安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18867 2026-04-22 cs.CV cs.AI cs.LG

Hierarchically Robust Zero-shot Vision-language Models

层次化鲁棒零样本视觉-语言模型

Junhao Dong, Yifei Zhang, Hao Zhu, Yew-Soon Ong, Piotr Koniusz

机构 * Nanyang Technological University(南洋理工大学) CFAR, IHPC, A*STAR(CFAR、IHPC、A*STAR) Northwest Polytechnical University(西北工业大学) Data61 CSIRO University of New South Wales(新南威尔士大学)

AI总结 本文提出基于层次嵌入的鲁棒微调框架,提升视觉-语言模型对对抗攻击的鲁棒性,通过多级对抗对齐和层次嵌入深度控制,增强模型泛化能力与语义多样性。

Comments This paper is accepted by CVPR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20897 2026-04-22 cs.CY cs.AI cs.AR

The data heat island effect: quantifying the impact of AI data centers in a warming world

数据热岛效应:量化人工智能数据中心在变暖世界中的影响

Andrea Marinoni, Erik Cambria, Weisi Lin, Mauro Dalla Mura, Jocelyn Chanussot, Edoardo Ragusa, Chi Yan Tso, Yihao Zhu, Benjamin Horton

机构 * Department of Computer Science and Technology, University of Cambridge(剑桥大学计算机科学与技术系) Glitch Analytics Ltd.(Glitch Analytics有限公司) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Asian School of Environment, Nanyang Technological University(南洋理工大学环境学院) GIPSA-lab, Grenoble-INP UGA(格拉诺勒-INP UGA实验室) INRIA(法国国家信息与自动化技术研究所) Dipartimento di Ingegneria Navale, Elettrica, Elettronica e delle Telecomunicazioni - DITEN, University of Genoa(热工学院、电气工程、电子工程和电信工程系,热那亚大学) School of Energy and Environment, City University of Hong Kong(香港城市大学能源与环境学院) Department of Management, College of Business, City University of Hong Kong(香港城市大学商学院管理学院)

AI总结 研究通过分析人工智能数据中心的热量排放,发现其导致周围地区地表温度上升2°C,影响超3亿人,揭示了人工智能发展对环境的潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15115 2026-04-21 cs.CV cs.AI cs.CL

Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement

具有对齐检测和局部细化的自纠正文本到视频生成

Daeun Lee, Jaehong Yoon, Jaemin Cho, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) NTU Singapore(新加坡国立大学) Allen Institute for AI(人工智能研究院) Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文提出VideoRepair框架,通过检测并修正视频与文本提示的对齐问题,提升生成质量。框架分为三个阶段,保留正确生成区域并针对性修正错误部分,有效提升多种对齐指标。

Comments Accepted to ACL 2026 Findings. Project page: https://video-repair.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18091 2026-04-21 cs.CL cs.CV

Culture-Aware Humorous Captioning: Multimodal Humor Generation across Cultural Contexts

具有文化意识的幽默标题生成:跨文化多模态幽默生成

Run Xu, Lu Li, Rongzhao Zhang, Jie Xu

机构 * Nanyang Technological University(南洋理工大学) Tongji University(同济大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 本文提出一种多模态幽默生成任务,通过文化意识标题生成模型在不同文化背景下生成幽默标题,改进了文化背景下的图像相关性、语境适配性和幽默质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18034 2026-04-21 cs.CL cs.CV

SignDPO: Multi-level Direct Preference Optimisation for Skeleton-based Gloss-free Sign Language Translation

SignDPO:基于骨骼的无手势符号翻译的多级直接偏好优化

Muxin Pu, Xiao-Ming Wu, Mei Kuan Lim, Chun Yong Chong, Wei Li, Chen Change Loy

机构 * Monash University(墨尔本大学) Nanyang Technological University(南洋理工大学)

AI总结 SignDPO通过多级直接偏好优化提升骨骼基签名语翻译的对齐效果,通过自引导机制和自动语言级偏好生成器解决语义漂移问题,实验表明其在多个基准测试中优于现有无手势符号方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18031 2026-04-21 cs.CL cs.LG q-bio.BM

How Creative Are Large Language Models in Generating Molecules?

大语言模型在生成分子时的创造性如何?

Wen Tao, Yiwei Wang, Peng Zhou, Bryan Hooi, Wanlong Fang, Tianle Zhang, Xiao Luo, Yuansheng Liu, Alvin Chan

机构 * Nanyang Technological University(南洋理工大学) University of California, Merced(加州大学默塞德分校) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

AI总结 研究通过系统实证评估,分析大语言模型在分子生成中的创造性行为,揭示其在不同约束下的表现,首次将分子生成能力重新定义为创造性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16021 2026-04-21 cs.SE cs.AI

Neurosymbolic Repo-level Code Localization

神经符号层面的代码定位

Xiufeng Xu, Xiufeng Wu, Zejun Zhang, Yi Li

机构 * Nanyang Technological University(南洋理工大学)

AI总结 本文提出KA-LCL问题,引入KA-LogicQuery基准测试,展示现有方法在无命名提示下的性能下降,提出LogicLoc框架结合LLM和Datalog实现精确代码定位。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08364 2026-04-21 cs.CV

MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping

MegaStyle: 通过一致的文本到图像风格映射构建多样化和可扩展的风格数据集

Junyao Gao, Sibo Liu, Jiaxing Li, Yanan Sun, Yuanpeng Tu, Fei Shen, Weidong Zhang, Cairong Zhao, Jun Zhang

机构 * Tencent(腾讯) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Fuzhou University(福州大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MegaStyle数据集,通过现有大生成模型的一致文本到图像风格映射能力,构建了包含170k风格提示和400k内容提示的多样化数据集,并提出风格监督对比学习方法和FLUX风格迁移模型。

Comments project website https://jeoyal.github.io/MegaStyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23179 2026-04-21 cs.AI

Universal Adversarial Attacks against Closed-Source MLLMs via Target-View Routed Meta Optimization

针对闭源多模态大语言模型的通用对抗攻击:通过目标视角路由元优化

Hui Lu, Yi Yu, Yiming Yang, Chenyu Yi, Xueyi Ke, Qixing Zhang, Bingquan Shen, Alex Kot, Xudong Jiang

机构 * Rapid-Rich Object Search Lab, Interdisciplinary Graduate Programme, Nanyang Technological University, Singapore(快速丰富目标搜索实验室,跨学科研究生项目,南洋理工大学,新加坡) School of Electrical and Electronic Engineering, Nanyang Technological University, Singapore(电气与电子工程学院,南洋理工大学,新加坡) College of Computing and Data Science, Nanyang Technological University, Singapore(计算与数据科学学院,南洋理工大学,新加坡) DSO National Laboratories, Singapore(新加坡国防科学实验室)

AI总结 本文提出MCRMO-Attack,通过多作物聚合与注意力引导裁剪稳定监督,通过对齐性门控令牌路由提升token级可靠性,并元学习跨目标扰动先验,从而在商业MLLM上提升未见图像攻击成功率。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10384 2026-04-21 cs.SD

RSA-Bench: Benchmarking Audio Large Models in Real-World Acoustic Scenarios

RSA-Bench: 音频大模型在真实声学场景中的基准测试

Yibo Zhang, Liang Lin, Kaiwen Luo, Shilinlu Yan, Jin Wang, Yaoqi Guo, Yitian Chen, Yalan Qin, Zhenhong Zhou, Kun Wang, Li Sun

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学) Xidian University(西安电子科技大学) Shanghai University(上海大学)

AI总结 RSA-Bench通过高保真声景模拟评估音频大模型的鲁棒性,揭示感知-认知差距、场景敏感性和去噪悖论三大问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15253 2026-04-21 cs.CL cs.CV

Scaling Beyond Context: A Survey of Multimodal Retrieval-Augmented Generation for Document Understanding

超越上下文的规模:文档理解的多模态检索增强生成综述

Sensen Gao, Shanshan Zhao, Xu Jiang, Lunhao Duan, Yong Xien Chng, Qing-Guo Chen, Weihua Luo, Kaifu Zhang, Jia-Wang Bian, Mingming Gong

机构 * MBZUAI Alibaba Group(阿里巴巴集团) Tsinghua University(清华大学) Wuhan University(武汉大学) Nanyang Technological University(南洋理工大学) University of Melbourne(墨尔本大学)

AI总结 本文综述了多模态检索增强生成在文档理解中的应用,提出基于领域、检索模态和粒度的分类体系,总结了关键数据集、基准测试和行业应用,指出了效率、细粒度表示和鲁棒性等挑战。

Comments Accepted by ACL2026 Main Conference; Project is available at https://github.com/SensenGao/Multimodal-RAG-Survey-For-Document

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07160 2026-04-21 cs.CL

GeometryZero: Advancing Geometry Solving via Group Contrastive Policy Optimization

GeometryZero:通过群体对比策略优化推进几何求解

Yikun Wang, Yibin Wang, Dianyi Wang, Zimian Peng, Qipeng Guo, Dacheng Tao, Jiaqi Wang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Zhejiang University(浙江大学) Shanghai AI Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学)

AI总结 本文提出GeometryZero,通过群体对比策略优化训练小型模型,实现高效的几何推理,实验表明其在Geometry3K和MathVista上优于RL基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21248 2026-04-21 cs.CL cs.AI cs.CE

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

ResearchBench: 通过基于灵感的任务分解对LLM在科学发现中的基准测试

Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文提出ResearchBench,首个评估LLM在科学发现子任务中的基准,包含灵感检索、假设生成和排序,通过自动化框架提取跨12学科论文的关键信息,验证其准确性,并展示LLM在非分布任务中表现优异。

Comments Accepted by ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17814 2026-04-21 cs.CR cs.AI

Understanding Secret Leakage Risks in Code LLMs: A Tokenization Perspective

理解代码大语言模型中的秘密泄露风险:从分词角度出发

Meifang Chen, Zhe Yang, Huang Nianchen, Yizhan Huang, Yichen Li, Zihan Li, Michael R. Lyu

机构 * The Chinese University of Hong Kong(香港中文大学) Nanyang Technological University(南洋理工大学) University of Southern California(南加州大学) Fudan University(复旦大学)

AI总结 研究揭示代码大语言模型中因分词方式导致的秘密泄露问题,指出BPE分词引发的'垃圾话偏差'现象,并探讨其成因及缓解策略。

Comments Accepted by ACL 26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏