arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-08 至 2026-04-08 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 69 篇

2604.05593 2026-04-08 cs.AI cs.CL 86%

Label Effects: Shared Heuristic Reliance in Trust Assessment by Humans and LLM-as-a-Judge

标签效应:人类和LLM-as-a-Judge在信任评估中的共享启发式依赖

Xin Sun, Di Wu, Sijing Qin, Isao Echizen, Abdallah El Ali, Saku Sugawara

机构 * National Institute of Informatics (NII)(国立信息学研究所) University of Amsterdam(阿姆斯特丹大学) University of Tokyo(东京大学) Hitotsubashi University(一桥大学) Centrum Wiskunde & Informatica (CWI)(荷兰数学与计算机科学研究中心) Utrecht University(乌得勒支大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示人类和LLM在信任评估中受标签影响的共同机制,通过对比人类和模型的反应,发现标签对信任判断有显著偏倚,提出需警惕标签敏感的LLM评估有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05483 2026-04-08 cs.AI cs.CL 86%

Can We Trust a Black-box LLM? LLM Untrustworthy Boundary Detection via Bias-Diffusion and Multi-Agent Reinforcement Learning

我们能信任一个黑盒大语言模型吗?通过偏见扩散和多智能体强化学习进行大语言模型不可信边界检测

Xiaotian Zhou, Di Tang, Xiaofeng Wang, Xiaozhong Liu

机构 * Worcester Polytechnic Institute(伍斯特理工学院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GMRL-BD算法,通过知识图谱和多智能体强化学习识别大语言模型在特定主题上的偏见边界,实验表明该算法能以少量查询高效检测不可信边界,并发布包含多个流行大语言模型的标注数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05719 2026-04-08 cs.CR cs.AI cs.SE 85%

Hackers or Hallucinators? A Comprehensive Analysis of LLM-Based Automated Penetration Testing

黑客还是幻觉?对基于LLM的自动化渗透测试的全面分析

Jiaren Peng, Zeqin Li, Chang You, Yan Wang, Hanlin Sun, Xuan Tian, Shuqiao Zhang, Junyi Liu, Jianguo Zhao, Renyang Liu, Haoran Ou, Yuqiang Sun, Jiancheng Zhang, Yutong Jiao, Kunshu Song, Chao Zhang, Fan Shi, Hongda Sun, Rui Yan, Cheng Huang

机构 * School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院) Institute for Network Sciences and Cyberspace, Tsinghua University(清华大学网络科学与网络空间研究院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) National University of Singapore(新加坡国立大学) College of Electronic Engineering, National University of Defense Technology(国防科技大学电子工程学院) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文对基于LLM的自动化渗透测试框架进行系统分析和大规模评估,揭示其架构设计和性能差异,为未来研究提供结构化分类和基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05371 2026-04-08 cs.AI 85%

LLM-as-Judge for Semantic Judging of Powerline Segmentation in UAV Inspection

基于LLM的语义判断用于无人机巡检中的电力线分割

Akram Hossain, Rabab Abdelfattah, Xiaofeng Wang, Kareem Abdelfatah

机构 * School of Computing Sciences and Computer Engineering, The University of Southern Mississippi(南密西西比大学计算科学与计算机工程学院) Electrical Engineering Department, University of South Carolina(南卡罗来纳大学电气工程系) Computer Science Department, Faculty of Computers & Artificial Intelligence, Fayoum University(法尤姆大学计算机与人工智能学院计算机科学系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究利用大语言模型作为语义判断器,评估无人机搭载模型生成的电力线分割结果可靠性,通过设计两个评估协议测试其重复性和感知敏感性,证明在约束条件下LLM能可靠监控关键任务的分割质量。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06556 2026-04-08 cs.SE cs.CL 85%

MultiFileTest: A Multi-File-Level LLM Unit Test Generation Benchmark and Impact of Error Fixing Mechanisms

MultiFileTest:一个多文件级LLM单元测试生成基准及错误修复机制的影响

Yibo Wang, Congying Xia, Wenting Zhao, Jiangshu Du, Chunyu Miao, Zhongfen Deng, Philip S. Yu, Chen Xing

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Salesforce Research(Salesforce研究院) Scale AI

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MultiFileTest基准,评估多文件级代码的单元测试生成性能,发现前沿LLM表现一般,且存在执行及级联错误,进一步评估了错误修复机制的效果。

Comments Published at ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07291 2026-04-08 cs.CR 85%

Evaluating LLM-based Personal Information Extraction and Countermeasures

评估基于大语言模型的个人信息提取及应对措施

Yupei Liu, Yuqi Jia, Jinyuan Jia, Neil Zhenqiang Gong

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究评估了基于大语言模型的个人信息提取技术及防御策略,通过系统测量研究对比了多种方法的性能,发现大语言模型在提取个人信息上表现优异,但通过提示注入可有效防御其攻击。

Comments USENIX Security Symposium 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05427 2026-04-08 cs.RO 85%

Pre-Execution Safety Gate & Task Safety Contracts for LLM-Controlled Robot Systems

预执行安全闸门与任务安全合同用于LLM控制的机器人系统

Ike Obi, Vishnunandan L. N. Venkatesh, Weizheng Wang, Ruiqi Wang, Dayoon Suh, Temitope I. Amosa, Wonse Jo, Byung-Cheol Min

机构 * SMART Laboratory, Department of Computer and Information Technology, Purdue University(普渡大学计算机与信息技术系SMART实验室) Department of Information and Telecommunication Engineering, Incheon National University(仁川国立大学信息与通信工程系)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出SafeGate和Task Safety Contracts,通过神经符号安全架构和约束检查,提升LLM控制机器人系统的安全性,减少缺陷命令的执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05135 2026-04-08 cs.CL cs.CE 83%

SenseAI: A Human-in-the-Loop Dataset for RLHF-Aligned Financial Sentiment Reasoning

SenseAI:一种用于RLHF对齐的金融情感推理的人机协同数据集

Berny Kabalisa

专题命中 评测与基准 :RLHF(title,abstract);LLM(abstract);分类 cs.CL

AI总结 SenseAI通过整合推理链、置信度评分和市场结果,为金融情感推理提供RLHF对齐的数据支持,揭示模型行为中的系统性模式及改进机会。

Comments Dataset available on request (bernykabalisa18@gmail.com) See GitHub for dataset snapshot and automated data collection script demo https://github.com/bernykabalisa18-netizen/SenseAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04953 2026-04-08 cs.CV cs.AI cs.HC cs.IR cs.MM 81%

Generative AI for Video Trailer Synthesis: From Extractive Heuristics to Autoregressive Creativity

生成AI用于视频预告片合成:从提取启发式方法到自回归创造力

Abhishek Dharmaratnakar, Srivaths Ranganathan, Debanshu Das, Anushree Sinha

机构 * Google LLC(谷歌有限责任公司)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述了自动视频预告片生成领域从启发式提取到深度生成合成的转变,探讨了自回归Transformer、LLM协同流程和文本到视频基础模型等生成技术,并讨论了高保真神经合成的伦理挑战。

Comments 7 pages, 3 figures, accepted in WSDM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05930 2026-04-08 cs.CL cs.AI 81%

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

我看出你在那儿:大型视觉-语言模型能否理解多模态双关语?

Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Palo Alto Networks Hangzhou Dianzi University(杭州电子科技大学) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁工业大学)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型视觉-语言模型理解多模态双关语的能力,提出多模态双关语生成流程和MultiPun数据集,通过评估发现模型在区分真实双关语与干扰项上表现不足,并提出提示级和模型级策略提升理解性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05955 2026-04-08 cs.SE cs.AI 79%

Does Pass Rate Tell the Whole Story? Evaluating Design Constraint Compliance in LLM-based Issue Resolution

通过率能讲述全部故事吗?评估基于LLM的问题解决的设计约束合规性

Kai Yu, Zhenhao Zhou, Junhao Zeng, Ying Wang, Xueying Du, Zhiqiang Yuan, Junwei Liu, Ziyu Zhou, Yujia Wang, Chong Wang, Xin Peng

机构 * Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出设计感知问题解决方法,引入bench基准,通过挖掘和验证真实项目中的设计约束,评估LLM在问题解决中设计约束的合规性,发现测试通过率高并不代表设计合规性好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05674 2026-04-08 cs.CR cs.AI 79%

From Incomplete Architecture to Quantified Risk: Multimodal LLM-Driven Security Assessment for Cyber-Physical Systems

从不完整架构到量化风险:面向网络物理系统的多模态LLM驱动安全评估

Shaofei Huang, Christopher M. Poskitt, Lwin Khin Shar

机构 * Singapore Management University(新加坡管理大学)

专题命中 评测与基准 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出ASTRAL方法,利用多模态LLM重构和分析网络物理系统架构,通过提示链、少样本学习和架构推理实现安全威胁识别和风险量化评估。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08528 2026-04-08 cs.CL cs.SD eess.AS 79%

On The Landscape of Spoken Language Models: A Comprehensive Survey

关于语音语言模型的景观:全面综述

Siddhant Arora, Kai-Wei Chang, Chung-Ming Chien, Yifan Peng, Haibin Wu, Yossi Adi, Emmanuel Dupoux, Hung-Yi Lee, Karen Livescu, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) National Taiwan University(国立台湾大学) Toyota Technological Institute at Chicago(丰田芝加哥技术研究所) Hebrew University of Jerusalem(耶路撒冷希伯来大学) ENS - PSL, EHESS, CNRS(巴黎高等师范学院 - 巴黎文理研究大学、社会科学高等研究院、法国国家科学研究中心)

专题命中 评测与基准 :language model(title,abstract);分类 cs.CL

AI总结 本文综述了语音语言模型的发展,分析了其架构、训练和评估方法,探讨了关键挑战与未来方向。

Comments Published in Transactions on Machine Learning Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20231 2026-04-08 cs.CY cs.AI cs.CL 79%

Moral Mazes in the Era of LLMs

大语言模型时代中的道德迷宫

Dang Nguyen, Harvey Yiyun Fu, Peter West, Ari Holtzman, Chenhao Tan

机构 * University of Chicago(芝加哥大学) University of British Columbia(不列颠哥伦比亚大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过HR模拟器研究LLM在职场社交情境中的表现,发现LLM在邮件风格上更正式且富有同理心,但人类在某些情况下表现不佳,而人类改写后的邮件可超越两者,揭示混合优势。

Comments 47 pages (including appendix), 7 figures, 2 tables in the main body. v2: updated title and abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05289 2026-04-08 cs.SE 78%

FLARE: Agentic Coverage-Guided Fuzzing for LLM-Based Multi-Agent Systems

FLARE:基于LLM的多智能体系统代理覆盖引导模糊测试

Mingxuan Hui, Xinyue Li, Lu Wang, Chengcheng Wan, Yifan Wang, Yimian Wang, Feiyue Song, Beining Shi, Yixi Li, Yaxiao Li

专题命中 评测与基准 :LLM(title,abstract)

AI总结 FLARE通过代理定义提取规范和行为空间,构建测试或acles进行覆盖引导模糊测试,发现多智能体系统中的失败案例,实现96.9%的代理间覆盖和91.1%的代理内覆盖。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06170 2026-04-08 cs.CL 77%

Paper Circle: An Open-source Multi-agent Research Discovery and Analysis Framework

Paper Circle:一个开源的多智能体研究发现与分析框架

Komal Kumar, Aman Chadha, Salman Khan, Fahad Shahbaz Khan, Hisham Cholakkal

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) AWS Generative AI Innovation Center, Amazon Web Services(亚马逊云科技生成式AI创新中心)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Paper Circle,一个开源多智能体研究发现与分析框架,通过多智能体系统降低学术文献查找、评估和理解的难度,结合发现与分析流程,生成结构化输出。

Comments 19 pages, 7 figures, 8 tables, ACL main (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05969 2026-04-08 cs.CR cs.AI 77%

A Formal Security Framework for MCP-Based AI Agents: Threat Taxonomy, Verification Models, and Defense Mechanisms

基于MCP的AI代理的正式安全框架:威胁分类、验证模型与防御机制

Nirajan Acharya, Gaurav Kumar Gupta

机构 * University of the Cumberlands(坎伯兰大学) Youngstown State University(扬斯敦州立大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出MCPSHIELD框架,通过威胁分类、验证模型和防御机制系统分析MCP代理生态系统的安全问题,实现91%的理论覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05912 2026-04-08 cs.CL 77%

FrontierFinance: A Long-Horizon Computer-Use Benchmark of Real-World Financial Tasks

FrontierFinance: 一个长期计算机使用的真实金融任务基准

Michael Krumdick, Varshini Reddy, Shivani Chaudhary, William Day, Maarij Ahmed, Hayan Haqqi, Muhammad Ahsen Fahim, Hanzallah Amjad, Ahmad Orakzai, Aqsa Gul, Chris Tanner

机构 * Kensho Technologies S&P Global(标普全球) MIT(麻省理工学院)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出FrontierFinance基准,通过25个复杂金融建模任务评估AI在金融领域的长期表现,展示人类专家在任务完成和输出质量上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05364 2026-04-08 cs.AI 77%

TFRBench: A Reasoning Benchmark for Evaluating Forecasting Systems

TFRBench:用于评估预测系统推理能力的基准测试

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Yiwen Song, Long T. Le, Qiang Cheng, Chun-Liang Li, Hamid Palangi, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 评测与基准 :LLM(abstract);foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 TFRBench通过多智能体框架评估预测系统推理能力,提升预测准确性,验证了其在时间序列预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05116 2026-04-08 cs.AI 77%

Uncertainty-Guided Latent Diagnostic Trajectory Learning for Sequential Clinical Diagnosis

不确定性的引导潜在诊断轨迹学习用于顺序临床诊断

Xuyang Shen, Haoran Liu, Dongjin Song, Martin Renqiang Min

机构 * University of Connecticut(康涅狄格大学) Texas A&M University(德克萨斯农工大学) NEC Laboratories America(NEC美国实验室)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出基于规划LLM和诊断LLM的潜在诊断轨迹学习框架,通过后验分布优先选择高诊断信息轨迹,提升顺序临床诊断的准确率并减少检测次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05731 2026-04-08 cs.CV 75%

FoleyDesigner: Immersive Stereo Foley Generation with Precise Spatio-Temporal Alignment for Film Clips

FoleyDesigner:基于精确时空对齐的沉浸式立体声 Foley 生成

Mengtian Li, Kunyan Dai, Yi Ding, Ruobing Ni, Ying Zhang, Wenwu Wang, Zhifeng Xie

机构 * Shanghai Film Academy, Shanghai University(上海大学上海电影学院) Shanghai Engineering Research Center of Motion Picture Special Effects(上海电影特效工程技术研究中心) University of Surrey, UK(英国萨里大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出 FoleyDesigner 框架,结合视频分析与可控 Foley 生成,引入 FilmStereo 数据集,实现高质量立体声生成与专业音频混合,提升电影沉浸体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05555 2026-04-08 cs.SE 75%

SCOPE: A Dataset of Stereotyped Prompts for Counterfactual Fairness Assessment of LLMs

SCOPE:一种用于评估LLMs反事实公平性的刻板印象提示数据集

Alessandra Parziale, Gianmario Voria, Valeria Pontillo, Andrea De Lucia, Gemma Catolino, Fabio Palomba

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 SCOPE数据集通过大规模反事实提示对,系统研究LLMs对不同群体的敏感行为,涵盖1438个主题和1536个人口群体,支持公平性、鲁棒性和反事实一致性评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14998 2026-04-08 cs.CV 75%

FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR

FinCriticalED:一个用于金融事实级OCR的视觉基准

Yueru He, Xueqing Peng, Yupeng Cao, Yan Wang, Lingfei Qian, Haohang Li, Yi Han, Shuyao Wang, Ruoyu Xiang, Fan Zhang, Zhuohan Xie, Mingquan Lin, Prayag Tiwari, Jimin Huang, Guojun Xiong, Sophia Ananiadou

机构 * Columbia University(哥伦比亚大学) Stevens Institute of Technology(史蒂文斯理工学院) Georgia Institute of Technology(佐治亚理工学院) New York University(纽约大学) University of Minnesota(明尼苏达大学) Halmstad University(哈尔姆斯塔德大学) Harvard University(哈佛大学) University of Manchester(曼彻斯特大学)

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出FinCriticalED基准,用于评估OCR和视觉语言模型在金融关键证据上的保真度,发现数值和货币单位是最脆弱的事实类型,揭示了词汇准确性和事实可靠性之间的差距。

Comments Xueqing Peng: Corresponding-Author

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25939 2026-04-08 cs.CR 75%

SoK: Honeypots & LLMs, More Than the Sum of Their Parts?

SoK:蜜罐与大语言模型,远不止是部分之和?

Robert A. Bridges, Thomas R. Mitchell, Mauricio Muñoz, Ted Henriksson

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨了蜜罐与大语言模型结合的新兴领域,分析了蜜罐检测向量的分类、LLM驱动的蜜罐架构及评估方法,并提出未来研究路线图。

Comments Systemization of Knowledge

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05711 2026-04-08 cs.SE cs.AI cs.CL cs.IR 73%

SemLink: A Semantic-Aware Automated Test Oracle for Hyperlink Verification using Siamese Sentence-BERT

SemLink:一种基于语义的自动测试Oracle用于超链接验证使用Siamese Sentence-BERT

Guan-Yan Yang, Wei-Ling Wen, Shu-Yuan Ku, Farn Wang, Kuo-Hui Yeh

机构 * National Taiwan University(国立台湾大学) National Yang Ming Chiao Tung University(国立阳明交通大学) National Dong Hwa University(国立东华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SemLink利用Siamese神经网络和Sentence-BERT计算超链接源上下文与目标页面内容的语义一致性,通过HWPPs数据集实现高召回率和高效验证。

Comments Accepted at the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST) 2026, Daejeon, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04328 2026-04-08 cs.AI cs.LG cs.MA 73%

Soft Tournament Equilibrium

软锦标赛均衡

Saad Alqithami

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出软锦标赛均衡(STE),通过可微框架直接从配对比较数据学习和计算多值锦标赛解,解决非传递性交互中的评估问题,提供更稳健的多值均衡评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05831 2026-04-08 cs.LG cs.AI 73%

HeartcareGPT: A Unified Multimodal ECG Suite for Dual Signal-Image Modeling and Understanding

HeartcareGPT:一种统一的多模态ECG套件,用于双信号-图像建模与理解

Yihan Xie, Sijing Li, Tianwei Lin, Zhuonan Wang, Chenglin Yang, Yu Zhong, Wenjie Yan, Wenqiao Zhang, Xiaogang Guo, Jun Xiao, Yueting Zhuang, Beng Chin Ooi

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出HeartcareGPT,通过Dual Stream Projection Alignment机制,实现ECG信号与图像的统一建模,提升多视角ECG理解能力,并建立医学多模态大语言模型向生理信号领域扩展的方法论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05775 2026-04-08 cs.CL q-bio.GN 70%

PhageBench: Can LLMs Understand Raw Bacteriophage Genomes?

PhageBench: LLMs能否理解原始噬菌体基因组?

Yusen Hou, Weicai Long, Haitao Hu, Houcheng Su, Junning Feng, Yanlin Zhang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PhageBench通过模拟生物信息学专家流程,评估LLM对噬菌体基因组的理解能力,发现通用模型在噬菌体contig识别和宿主预测上表现优异,但在复杂推理任务中存在明显局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05623 2026-04-08 cs.CV cs.CL cs.MM 70%

DetailVerifyBench: A Benchmark for Dense Hallucination Localization in Long Image Captions

DetailVerifyBench:长图像描述中密集 hallucination 定位的基准

Xinran Wang, Yuxuan Zhang, Xiao Zhang, Haolong Yan, Muxi Diao, Songyu Xu, Zhonghao Yan, Hongbing Li, Kongming Liang, Zhanyu Ma

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出 DetailVerifyBench,通过1000张高质量图像和密集的token级注释,评估长图像描述中hallucination的精确定位能力。

Comments 8 pages, 5 figures. The dataset and code are available at https://zyx-hhnkh.github.io/DetailVerifyBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05014 2026-04-08 cs.RO cs.AI cs.CV 70%

StarVLA: A Lego-like Codebase for Vision-Language-Action Model Developing

StarVLA:一种积木式代码库,用于视觉-语言-动作模型开发

StarVLA Community

机构 * Von Neumann Institute, HKUST(香港科技大学冯·诺依曼研究所)

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 StarVLA通过模块化架构、可重用训练策略和统一评估接口,解决VLA方法碎片化问题,提升可复现性和跨架构兼容性。

Comments Open-source VLA infra, Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏