arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 327 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 74 篇

2508.00161 2026-04-22 cs.LG cs.CL 73%

Watch the Weights: Unsupervised monitoring and control of fine-tuned LLMs

监视权重:无监督的细调大语言模型监控与控制

Ziqian Zhong, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过监控权重而非激活值来理解、监控和控制细调的大语言模型,能高精度检测细调引入的新行为,并在防回火攻击和模型去学习中表现出色。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09741 2026-04-22 cs.CL cs.LG 73%

FoNE: Precise Single-Token Number Embeddings via Fourier Features

FoNE: 通过傅里叶特征实现精确的单token数字嵌入

Tianyi Zhou, Deqing Fu, Mahdi Soltanolkotabi, Robin Jia, Vatsal Sharan

机构 * Department of Computer Science, University of Southern California(南加州大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 FoNE通过傅里叶特征直接将数字映射到嵌入空间,以单token和两维嵌入维度表示数字,提升训练和推理效率,同时在加减乘等数值任务中实现更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19520 2026-04-22 cs.AI 70%

SimDiff: Depth Pruning via Similarity and Difference

SimDiff:通过相似性与差异进行深度剪枝

Yuli Chen, Shuhao Zhang, Fanshen Meng, Bo Cheng, Jiale Han, Qiang Tong, Xiulei Liu

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications(网络与交换技术国家重点实验室,北京邮电大学) Hong Kong University of Science and Technology(香港科学与技术大学) Laboratory of Data Science and Information Studies, Beijing Information Science and Technology University(数据科学与信息研究实验室,北京信息科技大学) Beijing Advanced Innovation Center for Materials Genome Engineering, Beijing Information Science and Technology University(材料基因组工程北京先进创新中心,北京信息科技大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SimDiff通过结合表征相似性和变换差异两个视角,改进大语言模型的部署效率,实验表明其在多种剪枝比例下均优于现有方法,显著提升推理速度并保持模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18616 2026-04-22 cs.DC cs.AI cs.PL 70%

ARGUS: Agentic GPU Optimization Guided by Data-Flow Invariants

ARGUS:通过数据流不变量指导的代理GPU优化

Haohui Mai, Xiaoyan Guo, Xiangyun Ding, Daifeng Li, Qiuchu Yu, Chenzhun Guo, Cong Wang, Jiacheng Zhao, Christos Kozyrakis, Binhang Yuan

机构 * CausalFlow Inc.(CausalFlow公司) HKUST(香港科技大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) UCAS UC Riverside(UC河滨分校)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 ARGUS通过数据流不变量指导代理生成高效GPU内核,解决传统代理在关键计算任务中的性能不足问题,实现接近人工优化的性能和广泛的任务泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04713 2026-04-22 cs.HC cs.AI cs.CV 70%

Adaptive Prompt Elicitation for Text-to-Image Generation

自适应提示引导用于文本到图像生成

Xinyi Wen, Lena Hegemann, Xiaofu Jin, Shuai Ma, Antti Oulasvirta

机构 * Aalto University \& University of Helsinki \& ELLIS Institute Finland Helsinki Finland Aalto University Helsinki Finland Aalto University \& ELLIS Institute Finland Helsinki Finland Aalto University \& University of Helsinki \& ELLIS Institute Finland Aalto University Aalto University \& ELLIS Institute Finland

专题命中 效率与部署 :language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文提出自适应提示引导技术,通过交互式意图推断框架提升文本到图像生成与用户意图的对齐效率,实验表明其在准确性和效率上均优于现有方法。

Comments 25 pages, 14 figures, ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21526 2026-04-22 cs.CL 70%

Accelerating Prefilling via Decoding-time Contribution Sparsity

通过解码时贡献稀疏性加速预填

Zhiyuan He, Yike Zhang, Chengruidong Zhang, Huiqiang Jiang, Yuqing Yang, Lili Qiu

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出TriangleMix方法,利用解码时贡献稀疏性减少注意力计算开销,实现显著加速,同时与动态稀疏方法结合进一步提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19344 2026-04-22 cs.RO 67%

Quadruped Parkour Learning: Sparsely Gated Mixture of Experts with Visual Input

四足Parkour学习:带有视觉输入的稀疏门混合专家

Michael Ziegltrum, Jianhao Jiao, Tianhu Peng, Chengxu Zhou, Dimitrios Kanoulas

机构 * Robot Perception and Learning Lab, Intelligent Robotics, Department of Computer Science, University College London(机器人感知与学习实验室,智能机器人,计算机科学系,伦敦大学学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文研究了将稀疏门混合专家架构应用于基于视觉的四足机器人Parkour,实验表明MoE架构在克服大障碍物时表现优于传统MLP,且在性能与计算效率之间取得良好平衡。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03337 2026-04-22 cs.CV 67%

Less is More: Token-Efficient Video-QA via Adaptive Frame-Pruning and Semantic Graph Integration

少即是多:通过自适应帧剪枝和语义图集成实现高效的视频问答

Shaoguang Wang, Weiyu Guo, Ziyang Chen, Yijie Xu, Xuming Hu, Hui Xiong

机构 * The Hong Kong University of Science and Technology (Guangzhou), China(香港科技大学(广州)中国) The Hong Kong University of Science and Technology, Hong Kong SAR, China(香港科技大学,香港特别行政区,中国)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出一种结合自适应帧剪枝和轻量级语义图的框架,有效减少视频问答中输入token数量,提升效率并增强基模型性能。

Comments Accepted to CVPR 2026 Findings

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19201 2026-04-22 cs.SE 67%

Cascaded Code Editing: Large-Small Model Collaboration for Effective and Efficient Code Editing

级联代码编辑:大型-小型模型协作以实现高效且有效的代码编辑

Chaozheng Wang, Zezhou Yang, Shuzheng Gao, Cuiyun Gao, Zongjie Li, Yichen Li, Ting Peng, Hailiang Huang, Yuetang Deng, Michael R. Lyu

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 本文提出级联代码编辑框架,通过大型模型生成修改草图和小型模型应用草图,提升代码编辑的效率与准确性。

Comments This paper is accepted in FSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19055 2026-04-22 cs.SD 67%

ATRIE: Adaptive Tuning for Robust Inference and Emotion in Persona-Driven Speech Synthesis

ATRIE:面向基于人物驱动语音合成的鲁棒推理与情感自适应调优

Aoduo Li, Haoran Lv, Shengmin Li, Sihao Qin, Hongjian Xu

机构 * Guangdong University of Technology(广东工业大学) South China University of Technology(华南理工大学) Shenzhen Polytechnic University(深圳职业技术大学) University of Macau(澳门大学) Huizhou University(惠州市大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn)

AI总结 本文提出ATRIE框架,通过分离静音音色和动态语调生成,实现人物特征的稳定保留与情感表达,实验表明其在生成和跨模态检索上达到SOTA水平。

Comments 10 pages, 6 figures. Accepted to ACM ICMR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11301 2026-04-22 cs.CV 67%

SAMannot: A Memory-Efficient, Local, Open-source Framework for Interactive Video Instance Segmentation based on SAM2

SAMannot: 一种内存高效、局部、开源的基于SAM2的交互式视频实例分割框架

Gergely Dinya, András Gelencsér, Krisztina Kupán, Clemens Küpper, Kristóf Karacs, Anna Gelencsér-Horváth

机构 * Max Planck Institute for Biological Intelligence(生物智能马克斯·普朗克研究所)

专题命中 效率与部署 :foundation model(abstract);prompting(abstract)

AI总结 SAMannot通过整合SAM2模型,提供本地化、开源的交互式视频实例分割解决方案,解决了手动标注瓶颈和隐私问题,支持YOLO和PNG格式的研究数据集生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18639 2026-04-22 cs.LG cs.AI 62%

Easy Samples Are All You Need: Self-Evolving LLMs via Data-Efficient Reinforcement Learning

易于获取的样本足矣:通过数据高效的强化学习实现自演化大语言模型

Zhiyin Yu, Bo Zhang, Qibin Hou, Zhonghai Wu, Xiao Luo, Lei Bai

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nankai University(南开大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 效率与部署 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EasyRL方法,通过结合易标注数据的知识转移与逐步分治策略,实现大语言模型的数据高效自演化,实验表明仅使用10%的易标注数据即可超越现有最佳基线。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.07259 2026-04-22 cs.CV cs.AI cs.LG cs.MM 62%

COMODO: Cross-Modal Video-to-IMU Distillation for Efficient Egocentric Human Activity Recognition

COMODO:跨模态视频到IMU知识蒸馏用于高效的第一人称人类活动识别

Baiyu Chen, Wilson Wongso, Zechen Li, Yonchanok Khaokaew, Hao Xue, Flora Salim

机构 * The University of New South Wales(新南威尔士大学) King Mongkut's University of Technology North Bangkok(科技技术北巴吞蓬大学) The Hong Kong University of Science(香港科学大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出COMODO框架,通过跨模态自监督蒸馏将视频语义知识转移到IMU,提升第一人称人类活动识别的效率与泛化能力。

Comments IMWUT/UbiComp 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19324 2026-04-22 cs.CV cs.AI 57%

PLaMo 2.1-VL Technical Report

PLaMo 2.1-VL 技术报告

Tommi Kerola, Yuya Masuda, Takashi Masuko, Toshiki Nakanishi, Daisuke Nishino, Kuniyuki Takahashi, Hanqin Wang, Yoshihiro Yamada

机构 * Preferred Networks, Inc.

专题命中 效率与部署 :language model(abstract);分类 cs.AI

AI总结 PLaMo 2.1-VL 是一种轻量级视觉语言模型,适用于自主设备的本地和边缘部署,支持日语操作。该模型在视觉问答和视觉定位任务中表现优异,应用于工厂任务分析和基础设施异常检测,取得了显著的性能提升。

Comments 35 pages, 9 figreus

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18883 2026-04-22 cs.HC cs.AI cs.SE 57%

Choose Your Own Adventure: Non-Linear AI-Assisted Programming with EvoGraph

选择你的冒险:非线性AI辅助编程与EvoGraph

Vassilios Exarhakos, Jinghui Cheng, Jin L. C. Guo

机构 * McGill University(麦吉尔大学)

专题命中 效率与部署 :prompting(abstract);分类 cs.AI

AI总结 本文提出EvoGraph,一种集成AI交互和代码变更的轻量级开发图插件,帮助开发者更高效地探索、迭代和反思AI生成的代码变化,降低认知负担。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18718 2026-04-22 cs.CR cs.AI 57%

Towards Optimal Agentic Architectures for Offensive Security Tasks

迈向进攻性安全任务的最优代理架构

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 效率与部署 :LLM(abstract_cn);分类 cs.AI

AI总结 本文通过控制基准测试评估不同代理架构在进攻性安全任务中的性能,发现白盒模式和Web目标在检测效率上显著优于黑盒模式和二进制目标,且更广泛的协调能提升覆盖范围但需权衡成本与验证难度。

Comments 18 pages, 4 figures, supplementary appendix and benchmark artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18067 2026-04-22 cs.LG 57%

Towards Real-Time ECG and EMG Modeling on $μ$NPUs

面向μNPUs的实时ECG和EMG建模

Josh Millar, Ashok Samraj Thangarajan, Soumyajit Chatterjee, Hamed Haddadi

机构 * Imperial College London London United Kingdom Nokia Bell Labs London United Kingdom Brave Software \& University of Cambridge London United Kingdom Imperial College London Nokia Bell Labs Brave Software \& University of Cambridge

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出PhysioLite模型,通过轻量架构和硬件优化,在μNPUs上实现ECG/EMG信号分析,性能媲美最新Transformer模型,且体积仅为10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13763 2026-04-22 stat.ML cs.LG 57%

PriorGuide: Test-Time Prior Adaptation for Simulation-Based Inference

PriorGuide: 基于先验适应的模拟推理测试阶段方法

Yang Yang, Severi Rissanen, Paul E. Chang, Nasrulloh Loka, Daolang Huang, Arno Solin, Markus Heinonen, Luigi Acerbi

机构 * Department of Computer Science, University of Helsinki, Finland(赫尔辛基大学计算机科学系,芬兰) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系)

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 PriorGuide通过在测试阶段灵活调整训练好的扩散模型先验分布,提升模拟推理的适应性与实用性。

Comments Accepted at ICLR 2026. Camera-ready version. 38 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09477 2026-04-22 stat.ML cs.LG 57%

Efficient Autoregressive Inference for Transformer Probabilistic Models

高效变换器概率模型的自回归推断

Conor Hassan, Nasrulloh Loka, Cen-You Li, Daolang Huang, Paul E. Chang, Yang Yang, Francesco Silvestrin, Samuel Kaski, Luigi Acerbi

机构 * Department of Computer Science, Aalto University, Finland(芬兰阿尔托大学计算机科学系) ELLIS Institute Finland(芬兰ELLIS研究所) Department of Computer Science, University of Helsinki, Finland(芬兰赫尔辛基大学计算机科学系) Verda Department of Computer Science, University of Manchester, UK(英国曼彻斯特大学计算机科学系)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出一种高效自回归缓冲机制,结合集基和自回归方法,实现多预测联合分布推断,提升采样和密度评估效率,实验显示性能接近全上下文重编码,速度和内存使用更优。

Comments Accepted at ICLR 2026. Camera-ready version. 39 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19710 2026-04-22 cs.CV 50%

SpanVLA: Efficient Action Bridging and Learning from Negative-Recovery Samples for Vision-Language-Action Model

SpanVLA: 一种高效的视觉-语言-动作模型,通过负样本恢复学习实现动作桥接与学习

Zewei Zhou, Ruining Yang, Xuewei, Qi, Yiluan Guo, Sherry X. Chen, Tao Feng, Kateryna Pistunova, Yishan Shen, Lili Su, Jiaqi Ma

机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校) Motional, USA(Motional公司) Northeastern University, USA(东北大学)

专题命中 效率与部署 :post-training(abstract)

AI总结 本文提出SpanVLA,一种端到端自动驾驶框架,结合自回归推理与流匹配动作专家,通过高效桥接和负样本恢复学习提升推理效率和鲁棒性。

Comments Project page: https://spanvla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19509 2026-04-22 cs.RO cs.MA 50%

Assessing VLM-Driven Semantic-Affordance Inference for Non-Humanoid Robot Morphologies

评估基于视觉语言模型的非人形机器人语义可及性推理

Jess Jones, Raul Santos-Rodriguez, Sabine Hauert

机构 * Bristol Robotics Laboratory, University of Bristol(布里斯托尔机器人实验室,布里斯托尔大学) University of Bristol(布里斯托尔大学)

专题命中 效率与部署 :language model(abstract)

AI总结 本文研究了视觉语言模型在非人形机器人上的语义可及性推理能力,通过混合数据集分析发现模型在不同物体和机器人形态上表现不一,存在保守预测倾向,需结合其他方法以提高性能。

Comments AAMAS 2026 (main track), 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19432 2026-04-22 cs.CV 50%

DINO Eats CLIP: Adapting Beyond Knowns for Open-set 3D Object Retrieval

DINO Eats CLIP:超越已知领域进行开放集3D物体检索

Xinwei He, Yansong Zheng, Qianru Han, Zhichuan Wang, Yuxuan Cai, Yang Zhou, Jingbo Xia, Yulong Wang, Jinhai Xiang, Xiang Bai

机构 * Huazhong Agricultural University(华中农业大学) Huazhong University of Science and Technology(华中科技大学) Shenzhen University(深圳大学)

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文提出DEC框架,通过动态多视图整合和虚拟特征合成模块,提升开放集3D物体检索的性能,解决已知类别过拟合问题。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19034 2026-04-22 cs.CV 50%

Explore Like Humans: Autonomous Exploration with Online SG-Memo Construction for Embodied Agents

像人类一样探索:面向具身智能体的在线SG-Memo构建自主探索

Xu Chen, Shichao Xie, Zhining Gu, Lu Jia, Minghua Luo, Fei Liu, Zedong Chu, Yanfen Shen, Xiaolong Wu, Mu Xu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :language model(abstract)

AI总结 本文提出ABot-Explorer框架,通过在线RGB-only过程统一记忆构建与探索,利用VLMs提取语义导航 affordances,生成结构化SG-Memo以提升探索效率和环境覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18496 2026-04-22 cs.ET 50%

Homodyne Photonic Tensor Processor exceeds 1,000-TOPS

同相检波光子张量处理器超越1000TOPS

Lian Zhou, Kaiwen Xue, Yun-Jhu Lee, Chun-Ho Lee, Yuan Li, Kiwon Kwon, Weipeng Zhang, Songlin Zhao, Jason Moraes, Niranjan Bhatia, Ryan Hamerly, Mengjie Yu, Zaijun Chen

专题命中 效率与部署 :foundation model(abstract)

AI总结 该研究提出了一种同相检波集成电路,通过大规模芯片内光扇出和并行技术,实现了超过1000TOPS的通用矩阵乘法吞吐量,展示了高能效的光子计算潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 18 篇

2507.21563 2026-04-22 cs.IR cs.LG 92%

VoteGCL: Enhancing Graph-based Recommendations with Majority-Voting LLM-Rerank Augmentation

VoteGCL: 通过多数投票LLM重排序增强基于图的推荐

Minh-Anh Nguyen, Bao Nguyen, Ha Lan N. T., Tuan Anh Hoang, Duc-Trong Le, Dung D. Le

机构 * Center for AI Research, VinUniversity(越南 Vin 大学人工智能研究中心) The Chinese University of Hong Kong(香港中文大学) RMIT University(皇家墨尔本理工大学) VNU University of Engineering and Technology(越南工程与技术大学)

专题命中 领域大模型 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出利用LLM和物品文本描述增强交互数据,通过多数投票生成高置信度合成用户-物品交互,结合图对比学习框架缓解分布偏移和流行度偏差,实验显示提升准确率并减少流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18786 2026-04-22 cs.CL cs.AI 91%

Experiments or Outcomes? Probing Scientific Feasibility in Large Language Models

实验还是结果?在大型语言模型中探测科学可行性

Seyedali Mohammadi, Manas Gaur, Francis Ferraro

机构 * University of Maryland, Baltimore County(马里兰大学巴尔的摩分校)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文探讨了在大型语言模型中科学可行性的评估,发现提供结果证据比实验描述更可靠,结果能提升准确性,而实验文本可能因上下文不完整而退化。

Comments Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2110.00601 2026-04-22 cs.DL q-bio.QM 89%

Album: executable building blocks for scientific imaging routines, from sharing to LLM-assisted orchestration

Album: 科学成像流程的可执行构建模块,从共享到LLM辅助编排

Jan Philipp Albrecht, Deborah Schmidt, Lucas Rieckert, Maximilian Otto, Kyle Harrington

专题命中 领域大模型 :LLM(title,title_cn)

AI总结 Album通过两个核心机制实现科学流程的可执行打包与共享,支持可复现执行和LLM辅助编排,适用于多领域科学应用。

Comments 38 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19128 2026-04-22 cs.IR 89%

GraphRAG-IRL: Personalized Recommendation with Graph-Grounded Inverse Reinforcement Learning and LLM Re-ranking

基于图的反强化学习与大语言模型重排序的个性化推荐

Siqi Liang, Xiawei Wang, Yudi Zhang, Jiaying Zhou

专题命中 领域大模型 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 GraphRAG-IRL结合图基础特征构建、反强化学习和基于人设的大语言模型重排序,通过最大熵反强化学习模型实现校准预排序,并利用LLM对短候选列表进行重排序,提升推荐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02368 2026-04-22 cs.AI cs.CL 87%

Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation

Xpertbench:基于评分标准的专家级任务

Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng, Duo Wang, Zhoufutu Wen, Ge Zhang, Kaiyuan Zhang, Xinyu Chen, Yida Ding, Tianci He, Jiani Hou, Liang Hu, Ziyun Huang, Yongzhe Hui, Jianpeng Jiao, Chennan Ju, Yingru Kong, Yiran Li, Jiashuo Liu, Mengyun Liu, Luyao Ma, Fei Ni, Yiqing Ni, Pengbo Niu, Yueyan Qiu, Yanle Ren, Xinyu Shen, Zilin Shi, Zaiyuan Wang, Wenjie Yue, Chun Zhang, Shiyu Zhang, Xinyi Zhang, Kaiwen Zhao, Zhenwei Zhu, Shanshan Wu, Qi Zhao, Wenhao Huang

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 XpertBench通过精心设计的高保真任务评估LLM在专业领域的能力,揭示了当前AI系统在专家级任务上的性能瓶颈,展示了模型在不同领域中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12258 2026-04-22 cs.CL cs.AI 82%

Coding-Free and Privacy-Preserving Agentic Framework for Data-Driven Clinical Research

无编码且隐私保护的代理框架用于数据驱动的临床研究

Taehun Kim, Hyeryun Park, Hyeonhoon Lee, Yushin Lee, Kyungsang Kim, Hyung-Chul Lee

机构 * Infmedix, Co., Ltd.(Infmedix公司) Department of Transdisciplinary Studies, Seoul National University(首尔国立大学跨学科研究系) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院医疗人工智能研究所) Department of Medicine, Seoul National University College of Medicine(首尔国立大学医学院医学系) Department of Transdisciplinary Medicine, Seoul National University Hospital(首尔国立大学医院跨学科医学系) Department of Radiology, Massachusetts General Hospital and Harvard Medical School(麻省总医院放射科及哈佛医学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CARIS框架,通过整合大语言模型与模块化工具,实现无需编程的自然语言驱动研究,提升临床研究效率与隐私保护。

Comments 10 pages, 5 figures, 2 tables, Supplementary Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏