arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-10 至 2026-04-10 共收录 307 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 70 篇

2506.04989 2026-04-10 cs.SE cs.CY cs.LG 85%

BacPrep: Lessons from Deploying an LLM-Based Bacalaureat Assessment Platform

BacPrep: 从部署一个基于大语言模型的本科评估平台中获得的教训

Adrian-Marius Dumitran, Radu Dita, Angela Liliana Dumitran

机构 * University of Bucharest(布加勒斯特大学) Universitatea Creștină "Dimitrie Cantemir"(迪米特里·坎特米尔基督教大学) Cu Drag si Sport SRL(Cu Drag si Sport 有限公司) Softbinator Technologies(Softbinator 技术公司)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 BacPrep利用大语言模型进行自动评估,旨在为罗马尼亚本科考试提供免费资源。通过分析学生解题,发现评估中存在不一致性和误差,提出改进架构以提高准确性。

Comments First version ACCEPTED at BBGI (ITS 2025 Workshop) Second versions ACCEPTED at ITS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15494 2026-04-10 cs.SE cs.AI cs.PF 85%

Do AI Models Dream of Faster Code? An Empirical Study on LLM-Proposed Performance Improvements in Real-World Software

AI模型是否梦想着更快的代码?对LLM在现实软件中提出性能改进的实证研究

Lirong Yi, Gregory Gay, Philipp Leitner

机构 * Chalmers University of Technology(查尔姆斯理工大学) University of Gothenburg(哥德堡大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过65个性能关键的开源Java项目任务,评估LLM生成复杂工程问题的性能,发现其解法波动大且低于人类开发者,指出当前算法任务基准评估过于乐观,需转向更复杂的代理系统以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08212 2026-04-10 cs.CV 85%

Vision-Language Foundation Models for Comprehensive Automated Pavement Condition Assessment

面向综合自动化路面状况评估的视觉-语言基础模型

Blessing Agyei Kyem, Joshua Kofi Asamoah, Anthony Dontoh, Armstrong Aboah

机构 * North Dakota State University(北达科他州立大学) University of Memphis(孟菲斯大学)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);instruction tuning(abstract)

AI总结 本文提出PaveInstruct数据集和PaveGPT模型,通过领域特定指令微调提升视觉-语言模型在路面状况评估中的性能,实现20%以上的提升,并满足ASTM D6433标准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08044 2026-04-10 cs.AR 85%

A Full-Stack Performance Evaluation Infrastructure for 3D-DRAM-based LLM Accelerators

面向基于3D-DRAM的LLM加速器的全栈性能评估基础设施

Cong Li, Chenhao Xue, Yi Ren, Xiping Dong, Yu Cheng, Yinbo Hu, Fujun Bai, Yixin Guo, Xiping Jiang, Qiang Wu, Zhi Yang, Zhe Cheng, Yuan Xie, Guangyu Sun

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出ATLAS框架,通过统一抽象支持任意LLM推理场景,验证其在真实硅片上的高精度模拟性能,为3D-DRAM内存系统和加速器微架构设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08031 2026-04-10 cs.RO cs.CV 85%

Open-Ended Instruction Realization with LLM-Enabled Multi-Planner Scheduling in Autonomous Vehicles

基于LLM的多规划器调度的开放式指令实现用于自动驾驶车辆

Jiawei Liu, Xun Gong, Fen Fang, Muli Yang, Bohao Qu, Yunfeng Hu, Hong Chen, Xulei Yang, Qing Guo

机构 * Jilin University(吉林大学) Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局) Tongji University(同济大学) NKIARI Nankai University(南开大学) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE(教育部知识驱动人机智能工程研究中心)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种基于大语言模型的指令实现框架,通过实时反馈调度多个基于模型预测控制的运动规划器,提高任务完成率并降低LLM查询成本,同时确保安全性和可追溯性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08294 2026-04-10 cs.CV cs.AI cs.CL 84%

Can Vision Language Models Judge Action Quality? An Empirical Evaluation

视觉语言模型能否评判动作质量?一项实证评估

Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins

机构 * Sword Health Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) INESC-ID(INESC-ID研究所)

专题命中 评测与基准 :language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了视觉语言模型在动作质量评估中的表现,发现现有模型在多个领域仅略高于随机水平,且存在预测偏差,提示细粒度动作质量评估存在根本性困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04791 2026-04-10 cs.AI 83%

Timer-S1: A Billion-Scale Time Series Foundation Model with Serial Scaling

Timer-S1: 一种十亿级时间序列基础模型与串行扩展

Yong Liu, Xingjian Su, Shiyu Wang, Haoran Zhang, Haixuan Liu, Yuxuan Wang, Zhou Ye, Yang Xiang, Jianmin Wang, Mingsheng Long

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :foundation model(title,abstract);post-training(abstract);分类 cs.AI

AI总结 Timer-S1通过三维串行扩展提升时间序列预测能力,采用稀疏TimeMoE块和通用TimeSTP块,实现长周期预测并减少误差积累,基于TimeBench数据集取得最佳MASE和CRPS分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.12009 2026-04-10 cs.CL 81%

FinTruthQA: A Benchmark for AI-Driven Financial Disclosure Quality Assessment in Investor -- Firm Interactions

FinTruthQA:投资者与企业互动中人工智能驱动的财务披露质量评估基准

Peilin Zhou, Ziyue Xu, Xinyu Shi, Jiageng Wu, Yikang Jiang, Dading Chong, Wang Dong, Jun Chen, Bin Ke, Jie Yang

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 FinTruthQA通过6000个真实财务问答数据,评估投资者与企业互动中的财务披露质量,发现现有模型在回答可读性和相关性上表现较弱,预训练语言模型在复杂任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05674 2026-04-10 cs.CR cs.AI 79%

Towards Effective Offensive Security LLM Agents: Hyperparameter Tuning, LLM as a Judge, and a Lightweight CTF Benchmark

迈向高效的攻击性安全LLM代理:超参数调优、LLM作为裁判以及一个轻量级CTF基准

Minghao Shao, Nanda Rani, Kimberly Milner, Haoran Xi, Meet Udeshi, Saksham Aggarwal, Venkata Sai Charan Putrevu, Sandeep Kumar Shukla, Prashanth Krishnamurthy, Farshad Khorrami, Ramesh Karri, Muhammad Shafique

机构 * New York University(纽约大学) New York University Abu Dhabi(纽约大学阿布扎比分校) Indian Institute of Technology Kanpur(印度理工学院坎普尔分校) International Institute of Information Technology Hyderabad(国际信息技术学院海得拉巴分校)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文系统研究了驱动代理成功的关键因素,提出CTFJudge框架和CTF Competency Index指标,分析超参数对性能的影响,并开放CTFTiny基准供研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07652 2026-04-10 cs.AI cs.HC 79%

Bridging Natural Language and Interactive What-If Interfaces via LLM-Generated Declarative Specification

通过LLM生成的声明性规范桥接自然语言与交互式假设分析接口

Sneha Gathani, Sirui Zeng, Diya Patel, Ryan Rossi, Dan Marshall, Cagatay Demiralp, Steven Drucker, Zhicheng Liu

机构 * University of Maryland, College Park(马里兰大学帕克分校) Adobe Research(Adobe研究院) Microsoft Research(微软研究院) AWS AI Labs(AWS人工智能实验室) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种两阶段工作流,通过Praxa规范语言将自然语言假设分析问题转化为交互式可视化界面,提升假设分析工具的交互性和准确性。

Comments 17 pages 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04418 2026-04-10 cs.HC cs.AI 79%

Justified or Just Convincing? Error Verifiability as a Dimension of LLM Quality

合理还是有说服力?错误可验证性作为LLM质量的一个维度

Xiaoyuan Zhu, Kimberly Le Truong, Riccardo Fogliato, Gokul Swamy, Weijian Zhang, Minglai Yang, Longtian Ye, Bangya Liu, Minghao Liu, Andrew Ilyas, Steven Wu

机构 * University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft Core AI(微软核心人工智能)

专题命中 评测与基准 :LLM(title);post-training(abstract);分类 cs.AI

AI总结 本文提出错误可验证性作为LLM质量的新维度,通过实验发现传统方法无法提升该维度,引入两种方法提升可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22683 2026-04-10 cs.CV cs.AI 79%

SUPERGLASSES: Benchmarking Vision Language Models as Intelligent Agents for AI Smart Glasses

SUPERGLASSES:基于智能眼镜的视觉语言模型智能体基准测试

Zhuohang Jiang, Xu Yuan, Haohao Qu, Shanru Lin, Kanglong Liu, Wenqi Fan, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 本文提出SUPERGLASSES基准,通过真实世界数据评估智能眼镜的多模态交互能力,提出SUPERLENS模型在VQA任务中超越GPT-4o,揭示了任务特定解决方案的重要性。

Journal ref 2026 IEEE/CVF Conference on Computer Vision and Pattern Recognition- FINDINGS Track (CVPRF)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18787 2026-04-10 cs.CV cs.LG 79%

Understanding Task Transfer in Vision-Language Models

理解视觉-语言模型中的任务迁移

Bhuvan Sachdeva, Karan Uppal, Abhinav Java, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软研究院印度)

专题命中 评测与基准 :language model(title,abstract);分类 cs.LG

AI总结 本文研究视觉-语言模型中任务迁移的系统性影响,提出PGF指标衡量任务迁移对性能的影响,揭示任务间的正负迁移关系,指导更高效的模型训练。

Comments CVPR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26241 2026-04-10 cs.CV cs.CL 79%

Which Way Does Time Flow? A Psychophysics-Grounded Evaluation for Vision-Language Models

时间如何流逝?基于心理物理学的评估用于视觉-语言模型

Shiho Matta, Lis Kanashiro Pereira, Peitao Han, Fei Cheng, Shigeru Kitazawa

机构 * Kyoto University(京都大学) Center for Information and Neural Networks(信息与神经网络中心) National Institute of Information and Communications Technology(国立信息通信技术研究所) The University of Osaka(大阪大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文通过心理物理学验证的基准测试评估了视觉-语言模型对时间方向的理解能力,发现大多数模型表现接近随机,且在物理不可逆过程和因果手动动作上远低于人类水平。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20718 2026-04-10 cs.CV cs.AI 79%

MM-MoralBench: A MultiModal Moral Evaluation Benchmark for Large Vision-Language Models

MM-MoralBench: 一种多模态道德评估基准用于大型视觉-语言模型

Bei Yan, Jie Zhang, Zhiyuan Chen, Shiguang Shan, Xilin Chen

机构 * University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.AI

AI总结 为评估大型视觉-语言模型的道德对齐性,提出MM-MoralBench基准,通过多模态场景测试模型在六个道德基础上的判断与分类能力,揭示模型存在显著的道德偏见问题。

Comments Accepted by Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08016 2026-04-10 cs.AI cs.LG 79%

Wiring the 'Why': A Unified Taxonomy and Survey of Abductive Reasoning in LLMs

阐明‘为何’:对大语言模型中演绎推理的统一分类和调查

Moein Salimi, Shaygan Adim, Danial Parnian, Nima Alighardashi, Mahdi Jafari Siavoshani, Mohammad Hossein Rohban

机构 * Sharif University of Technology(谢里夫理工大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文首次系统调研大语言模型中的演绎推理,提出统一的两阶段定义,分类现有工作,并通过基准测试和对比分析揭示当前方法的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07964 2026-04-10 cs.AI cs.LG 79%

Are we still able to recognize pearls? Machine-driven peer review and the risk to creativity: An explainable RAG-XAI detection framework with markers extraction

我们仍然能识别珍珠吗?机器驱动的同行评审与创造力风险:一个可解释的RAG-XAI检测框架与标记提取

Alin-Gabriel Văduva, Simona-Vasilica Oprea, Adela Bâra

机构 * Bucharest University of Economic Studies(布加勒斯特经济研究大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RAG-XAI框架,通过标记提取检测自动化评审,以保留科学的透明度和创造力,实验显示其在检测性能上显著优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07553 2026-04-10 cs.CL cs.AI 79%

TR-EduVSum: A Turkish-Focused Dataset and Consensus Framework for Educational Video Summarization

TR-EduVSum:一种面向土耳其语的教育视频摘要数据集和共识框架

Figen Eğin, Aytuğ Onan

机构 * Izmir Katip Celebi University(伊兹密尔卡蒂普切莱比大学) Izmir Institute of Technology(伊兹密尔理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出TR-EduVSum数据集和AutoMUP框架,通过多人类摘要生成高质量摘要,验证了共识权重和聚类对摘要质量的关键作用,适用于其他突厥语种。

Comments 8 pages, 2 figures, 3 tables. Accepted at the Second Workshop on Natural Language Processing for Turkic Languages (SIGTURK 2026), EACL 2026, Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04641 2026-04-10 cs.CL cs.CY cs.LG 79%

Evaluating LLMs for Demographic-Targeted Social Bias Detection: A Comprehensive Benchmark Study

评估用于定向社会偏见检测的LLM:全面的基准研究

Ayan Majumdar, Feihao Chen, Jinghui Li, Xiaozhen Wang

专题命中 评测与基准 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本文通过评估LLM在检测定向社会偏见的能力,探讨了多标签任务和多种技术的系统性评估,揭示了规模化检测的潜力与不足。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08074 2026-04-10 cs.CV 78%

DinoRADE: Full Spectral Radar-Camera Fusion with Vision Foundation Model Features for Multi-class Object Detection in Adverse Weather

DinoRADE:基于视觉基础模型特征的全谱雷达-摄像头融合用于恶劣天气下的多类目标检测

Christof Leitgeb, Thomas Puchleitner, Max Peter Ronecker, Daniel Watzenig

机构 * Infineon Technologies AG, Austria(英飞凌科技公司,奥地利) Graz University of Technology, Austria(格拉茨技术大学,奥地利) Virtual Vehicle Research GmbH, Austria(虚拟车辆研究有限公司,奥地利)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出DinoRADE,通过雷达-摄像头融合和视觉基础模型特征提升恶劣天气下的多类目标检测性能,首次在K-Radar数据集上评估并超越现有方法12.1%。

Comments Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07606 2026-04-10 cs.CV 78%

Bootstrapping Sign Language Annotations with Sign Language Models

通过手语模型 bootstrap 手语注释

Colin Lea, Vasileios Baltatzis, Connor Gillis, Raja Kushalnagar, Lorna Quandt, Leah Findlater

机构 * Apple(苹果公司) Gallaudet University(加劳德特大学)

专题命中 评测与基准 :language model(title);LLM(abstract)

AI总结 本文提出一种伪注释流程,利用手语视频和英语输入,生成手语、手指拼写词和手语分类器的注释。通过稀疏预测和K-Shot LLM方法,实现高精度的伪注释,为手语数据集提供高质量基准。

Comments Accepted to CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19559 2026-04-10 cs.CL 77%

Stay Focused: Problem Drift in Multi-Agent Debate

专注:多智能体辩论中的问题漂移

Jonas Becker, Lars Benedikt Kaesberg, Andreas Stephan, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen(哥廷根大学) LKA NRW(北莱茵-威斯特法伦州刑事调查局) University of Vienna(维也纳大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究分析多智能体辩论中问题漂移现象,发现生成任务因答案空间主观性导致漂移,提出DRIFTJudge和DRIFTPolicy方法以缓解问题漂移。

Comments accepted at EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07375 2026-04-10 cs.CY cs.HC 75%

Assessing the Feasibility of a Video-Based Conversational Chatbot Survey for Measuring Perceived Cycling Safety: A Pilot Study in New York City

评估基于视频的对话式聊天机器人调查在测量感知骑行安全性的可行性:纽约市试点研究

Feiyang Ren, Zhaoxi Zhang, Tamir Mendel, Takahiro Yabe

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出利用大语言模型结合视频调查和对话式AI聊天机器人,评估骑行安全感知的可行性,并通过纽约市九个街区的试点调查验证方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04925 2026-04-10 cs.IR 75%

Detecting RAG Advertisements Across Advertising Styles

跨广告风格检测RAG广告

Sebastian Heineking, Wilhelm Pertsch, Ines Zelch, Janek Bevendorff, Benno Stein, Matthias Hagen, Martin Potthast

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出了一种广告风格分类体系,模拟广告商通过改变风格逃避检测,并评估了多种广告检测方法在不同风格变化下的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10284 2026-04-10 cs.CL 74%

arXiv2Table: Toward Realistic Benchmarking and Evaluation for LLM-Based Literature-Review Table Generation

arXiv2Table:面向基于大语言模型的文献综述表生成的现实基准测试与评估

Weiqi Wang, Jiefu Ou, Yangqiu Song, Benjamin Van Durme, Daniel Khashabi

机构 * Center for Speech and Language Processing, Johns Hopkins University(约翰霍普金斯大学语音与语言处理中心) Department of Computer Science and Engineering, HKUST(香港科技大学计算机科学与工程系)

专题命中 评测与基准 :LLM(title);分类 cs.CL

AI总结 本文提出arXiv2Table基准,通过模拟真实用户需求和噪声,评估大语言模型生成文献综述表的能力,实验表明方法优于基线,但任务难度仍高。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08171 2026-04-10 cs.CV cs.AI 74%

OceanMAE: A Foundation Model for Ocean Remote Sensing

OceanMAE:一种用于海洋遥感的基础模型

Viola-Joanna Stamer, Panagiotis Agrafiotis, Behnood Rasti, Begüm Demir

机构 * Technische Universität Berlin(柏林工业大学) Berlin Institute for the Foundations of Learning and Data (BIFOLD)(柏林学习与数据基础研究所(BIFOLD))

专题命中 评测与基准 :foundation model(title);分类 cs.AI

AI总结 本文提出OceanMAE,一种专为海洋遥感设计的屏蔽自动编码器,通过整合多光谱Sentinel-2数据与物理意义的海洋特征,在自监督学习中扩展标准MAE预训练。实验表明,OceanMAE在海洋分割任务中表现最优,而水深估计效果竞争且任务依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08540 2026-04-10 cs.CV cs.AI cs.CL 73%

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08494 2026-04-10 cs.CV cs.CL cs.HC 70%

What They Saw, Not Just Where They Looked: Semantic Scanpath Similarity via VLMs and NLP metric

他们所见,而不仅仅是他们看的地方:通过VLMs和NLP度量的语义扫视路径相似性

Mohamed Amine Kerkouri, Marouane Tliba, Bin Wang, Aladine Chetouani, Ulas Bagci, Alessandro Bruno

机构 * Northwestern University(西北大学) Radiology, Northwestern University(西北大学放射学系)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 本文提出一种整合视觉语言模型的语义扫视路径相似性框架,通过控制视觉上下文生成文本描述,利用NLP度量计算语义相似性,揭示空间差异下的内容一致性。

Comments Accepted at ETRA 2026 GenAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08263 2026-04-10 cs.AI 70%

Neural-Symbolic Knowledge Tracing: Injecting Educational Knowledge into Deep Learning for Responsible Learner Modelling

神经符号知识追踪:将教育知识注入深度学习以实现负责任的学习者建模

Danial Hooshyar, Gustav Šír, Yeongwook Yang, Tommi Kärkkäinen, Raija Hämäläinen, Ekaterina Krivich, Mutlu Cukurova, Dragan Gašević, Roger Azevedo

机构 * Tallinn University(塔林大学) University of Jyväskylä(于韦斯屈莱大学) Czech Technical University(捷克技术大学) Kangwon National University(江原大学) University College London(伦敦大学学院) The University of Hong Kong(香港大学) Monash University(莫纳什大学) University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Responsible-DKT,通过整合教育符号知识提升学习者建模的性能与可解释性,实验表明其在预测准确率和时间可靠性方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08184 2026-04-10 cs.SD cs.AI 70%

AT-ADD: All-Type Audio Deepfake Detection Challenge Evaluation Plan

AT-ADD:所有类型音频深度伪造检测挑战评估计划

Yuankun Xie, Haonan Cheng, Jiayi Zhou, Xiaoxuan Guo, Tao Wang, Jian Liu, Weiqiang Wang, Ruibo Fu, Xiaopeng Wang, Hengyan Huang, Xiaoying Huang, Long Ye, Guangtao Zhai

机构 * Communication University of China(中国传媒大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beijing Institute of Technology(北京理工大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对现有音频深度伪造检测方法在鲁棒性和泛化能力上的不足,AT-ADD挑战旨在通过标准化数据集和评估协议提升音频伪造检测的实用性和鲁棒性。

Comments Accepted to the ACM Multimedia 2026 Grand Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏