arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-27 至 2026-04-27 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 43 篇

2604.22237 2026-04-27 cs.CL cs.AI 92%

Tell Me Why: Designing an Explainable LLM-based Dialogue System for Student Problem Behavior Diagnosis

告诉我原因:设计一个可解释的基于LLM的对话系统用于学生问题行为诊断

Zhilin Fan, Deliang Wang, Penghe Chen, Yu Lu

机构 * School of Educational Technology, Beijing Normal University, Beijing, China(北京师范大学教育技术学院) Advanced Innovation Center for Future Education, Beijing Normal University, Beijing, China(北京师范大学未来教育创新中心) Faculty of Education, The University of Hong Kong, Hong Kong SAR, China(香港大学教育学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的可解释对话系统,通过层次归因方法生成自然语言解释,提升教育对话系统中LLM的可解释性,实验证明其在识别支持证据方面优于基线方法。

Comments This paper has been accepted in AIED2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13527 2026-04-27 cs.CL cs.AI 92%

Logic Jailbreak: Efficiently Unlocking LLM Safety Restrictions Through Formal Logical Expression

逻辑突破:通过形式逻辑表达高效解锁LLM安全限制

Jingyu Peng, Maolin Wang, Nan Wang, Jiatong Li, Yuchen Li, Yuyang Ye, Wanyu Wang, Pengyue Jia, Kai Zhang, Xiangyu Zhao

机构 * City University of Hong Kong(香港城市大学) Rutgers University(罗格斯大学) University of Science and Technology of China(中国科学技术大学) Universiteit van Amsterdam(阿姆斯特丹大学) Baidu Inc(百度公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogiBreak方法,通过将有害提示转化为形式逻辑表达,利用对齐数据与逻辑输入之间的分布差异,有效绕过LLM安全机制,验证其在多语言数据集中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14917 2026-04-27 cs.SE 92%

Evaluating Code Reasoning Abilities of Large Language Models Under Real-World Settings

在现实世界设置下评估大型语言模型的代码推理能力

Changshu Liu, Alireza Ghazanfari, Yang Chen, Reyhaneh Jabbarvand

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文通过构建包含1200个问题的 dataset,评估 LLM 在现实复杂性下的代码推理能力,采用静态和动态分析方法,分类问题难度为 LC 或 HC,揭示现有评估方法主要偏向低复杂度问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22597 2026-04-27 cs.AI 92%

Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity

重新思考数学推理评估:一种超越符号刚性的LLM-as-a-Judge框架

Erez Yosef, Oron Anschel, Shunit Haviv Hakimi, Asaf Gendler, Adam Botach, Nimrod Berman, Igor Kviatkovsky

机构 * Tel-Aviv University(特拉维夫大学) Amazon Prime Video(亚马逊Prime视频) Ben-Gurion University(巴内尔·戈里翁大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种稳健灵活的LLM-as-a-Judge框架,用于评估模型生成答案的准确性,超越传统符号数学比较的局限,提升数学推理评估的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22234 2026-04-27 cs.AR 91%

GR-Evolve: Design-Adaptive Global Routing via LLM-Driven Algorithm Evolution

GR-Evolve: 通过LLM驱动的算法进化实现设计自适应的全局路由

Taizun Jafri, Vidya A. Chhabria

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本文提出GR-Evolve框架,利用LLM自动优化EDA工具的全局路由算法,通过设计特性自适应提升路由性能,实验显示在三个工艺节点上实现8.72%的线长减少。

Comments Long version of ICCAD 2026 submitted paper under review. 11 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22417 2026-04-27 cs.CY 90%

Trust as a Situated User State in Social LLM-Based Chatbots: A Longitudinal Study of Snapchat's My AI

信任作为社交LLM聊天机器人中的情境用户状态:对Snapchat My AI的纵向研究

Annie Landerberg, Kari Flatmo, Alan Said

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究探讨了用户在社交LLM聊天机器人中信任的形成机制,发现信任受感知能力、对话行为、人类相似性、透明度、隐私担忧及主机平台信任等因素影响,强调信任是动态变化的交互过程。

Comments Accepted to 34th ACM International Conference on User Modeling, Adaptation and Personalization (UMAP'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17011 2026-04-27 q-fin.CP cs.CE cs.CL cs.LG q-fin.PM 90%

Predicting Liquidity-Aware Bond Yields using Causal GANs and Deep Reinforcement Learning with LLM Evaluation

利用因果生成对抗网络和深度强化学习预测流动性感知的债券收益率

Jaskaran Singh Walia, Aarush Sinha, Naman Saraswat, Srinitish Srinivasan, Srihari Unnikrishnan

机构 * School of Computer Science and Engineering, Vellore Institute of Technology, India(印度维杰雷理工学院计算机科学与工程学院) Indian Institute of Science, Bangalore, India(印度班加罗尔印度科学学院)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出利用因果GANs和SAC强化学习生成高保真的合成债券收益率数据,结合LLM评估提升预测性能,通过统计验证和专家评估证明其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22046 2026-04-27 cs.SE cs.AI 90%

Call-Chain-Aware LLM-Based Test Generation for Java Projects

面向调用链的基于LLM的Java项目测试生成

Guancheng Wang, Qinghua Xu, Lionel C. Briand, Zhaoqiang Guo, Kui Liu

机构 * Research Ireland Lero Centre for Software(爱尔兰Lero软件研究中心) University of Limerick(利默里克大学) University of Ottawa(渥太华大学) The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) Software Engineering Application Technology Lab, Huawei(华为软件工程应用技术实验室)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出CAT方法,通过静态分析整合调用链和依赖上下文,提升测试生成的覆盖率和有效性,实验显示其在Defects4J和真实项目中均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07298 2026-04-27 cs.LG cs.AI 90%

Pre-trained Large Language Models Learn Hidden Markov Models In-context

预训练大语言模型通过上下文学习学习隐马尔可夫模型

Yijia Dai, Zhaolin Gao, Yahya Sattar, Sarah Dean, Jennifer J. Sun

机构 * Cornell University(康奈尔大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 本文研究预训练大语言模型通过上下文学习有效建模由隐马尔可夫模型生成的数据,并揭示了其在复杂数据中挖掘隐藏结构的潜力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22513 2026-04-27 cs.NI 89%

Benchmarking LLM-Driven Network Configuration Repair

基于大语言模型的网络配置修复基准测试

Ioannis Protogeros, Rufat Asadli, Benjamin Hoffman, Laurent Vanbever

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文提出Cornetto基准测试,用于评估大语言模型在大规模网络配置修复中的功能性和扩展性,发现现有LLM在处理复杂场景时易引入回归问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22492 2026-04-27 eess.IV cs.CV 89%

MTT-Bench: Predicting Social Dominance in Mice via Multimodal Large Language Models

MTT-Bench:通过多模态大语言模型预测小鼠的社会支配

Yunquan Chen, Haoyu Chen

机构 * Department of Communication Systems, KTH Royal Institute of Technology(通信系统系,皇家理工学院) CMVS, University of Oulu(奥卢大学CMVS)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 本文提出MTT-Bench基准,利用多模态大语言模型分析小鼠行为视频,预测社会支配等级,无需显式标签进行零样本推理,展示了在乙学和社会行为分析中的应用潜力。

Comments 8 pages, 2 figures. Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.18169 2026-04-27 cs.CR cs.AI cs.LG 88%

Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey

大型语言模型有害微调攻击与防御:综述

Tiansheng Huang, Sihao Hu, Fatih Ilhan, Selim Furkan Tekin, Ling Liu

机构 * School of Computer Science, Georgia Institute of Technology(佐治亚理工学院计算机科学系)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文综述了大型语言模型中有害微调攻击的威胁模型、防御设计及评估方法,分析了现有攻击与防御机制,并提出了未来研究方向。

Comments Accepted by ACM Computing Survey (CSUR). The authors will continuously update the arXiv version. Please reach out to the authors if you find uncovered papers on relevant topics

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22306 2026-04-27 cs.LO cs.AI cs.PL 88%

BLAST: Benchmarking LLMs with ASP-based Structured Testing

BLAST:基于ASP的结构化测试的LLM基准测试

Manuel Alejandro Borroto Santana, Erica Coppolillo, Francesco Calimeri, Giuseppe Manco, Simona Perri, Francesco Ricca

机构 * University of Calabria(卡利亚里大学) ICAR-CNR Artificial Intelligence LAB, DeMaCS, University of Calabria(人工智能实验室,DeMaCS,卡利亚里大学) DLVSystem(DLV系统)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出BLAST,首个针对LLM生成ASP代码准确性的基准方法和数据集,通过两个新提出的语义指标评估十种经典图问题和八种先进LLM的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22154 2026-04-27 cs.LG cs.AI 88%

Reliable Self-Harm Risk Screening via Adaptive Multi-Agent LLM Systems

通过自适应多智能体LLM系统实现可靠的自伤风险筛查

Meghana Karnam, Ananya Joshi

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文提出一种基于有向无环图的统计框架,通过自适应采样策略提升自伤风险评估的可靠性,实验表明其在精度和召回率上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17299 2026-04-27 cs.CR cs.AI cs.LG 88%

Toward Principled LLM Safety Testing: Solving the Jailbreak Oracle Problem

迈向原则化的LLM安全测试:解决 Jailbreak 或acle 问题

Shuyi Lin, Anshuman Suri, Alina Oprea, Cheng Tan

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构、匿名城市、匿名地区、匿名国家)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出解决Jailbreak oracle问题的Boa系统,通过分阶段搜索策略评估大语言模型的安全性,实现系统化的防御评估和模型认证。

Comments Accepted to MLSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06148 2026-04-27 cs.CV 88%

V-MAGE: A Game Evaluation Framework for Assessing Vision-Centric Capabilities in Multimodal Large Language Models

V-MAGE:一种用于评估多模态大语言模型视觉能力的游戏评估框架

Xiangxi Zheng, Linjie Li, Zhengyuan Yang, Ping Yu, Alex Jinpeng Wang, Rui Yan, Yuan Yao, Lijuan Wang

机构 * Nanjing University(南京大学) Microsoft Research(微软研究院) Central South University(中南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract)

AI总结 V-MAGE通过游戏化评估框架系统评估多模态大语言模型在动态交互环境中的视觉推理能力,揭示其在复杂场景中的性能局限,为提升模型视觉与推理能力提供改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22273 2026-04-27 cs.AI 87%

When Does LLM Self-Correction Help? A Control-Theoretic Markov Diagnostic and Verify-First Intervention

当大语言模型自我纠正有助于什么?一种控制论马尔可夫诊断和先验证干预

Aofan Liu, Jingxiang Meng

机构 * Peking University(北京大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文通过控制论马尔可夫模型分析自我纠正的条件,发现近零误差阈值决定其有效性,并通过实验验证先验证提示能有效减少误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14306 2026-04-27 cs.CL cs.AI 86%

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估

Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22153 2026-04-27 cs.CL cs.AI cs.CY 85%

When AI Speaks, Whose Values Does It Express? A Cross-Cultural Audit of Individualism-Collectivism Bias in Large Language Models

当AI说话时,它表达的是谁的价值观?对个体主义-集体主义偏见的跨文化审计

Pruthvinath Jeripity Venkata

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究探讨了大型语言模型在不同文化背景下对个体主义与集体主义偏见的跨文化表现,发现AI系统倾向于提供西方个体主义建议,即使面对强调家庭和社区的文化,且日本例外,揭示AI编码了过时的刻板印象。

Comments 13 pages, 7 figures, 9 tables. Data and code: https://github.com/pruthvinathJV/ai-values-misalignment-study

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22077 2026-04-27 eess.SY cs.SY 82%

Empirical Assessment of Time-Series Foundation Models For Power System Forecasting Applications

时间序列基础模型在电力系统预测应用中的实证评估

Muhy Eddin Za'ter, Bri-Mathias Hodge

专题命中 评测与基准 :foundation model(title,abstract);pretraining(abstract)

AI总结 本文实证评估了时间序列基础模型在太阳能、风能和负荷预测中的性能,分析了八种核心能力,为电力系统运营提供决策依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22541 2026-04-27 hep-ex 80%

Dr.Sai: An agentic AI for real-world physics analysis at BESIII

Dr.Sai:BESIII实世界物理分析的代理AI

Mingfeng He, Fayu Jiang, Junkun Jiao, Mingrun Li, Ke Li, Yipu Liao, Beijiang Liu, Tong Liu, Fazhi Qi, Zijie Shang, Weimin Song, Yue Sun, Xiongfei Wang, Hong Wang, Dongbo Xiong, Changzheng Yuan, Bolun Zhang, Zhengde Zhang, Xuliang Zhu

专题命中 评测与基准 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 Dr.Sai利用大语言模型实现自动物理分析,通过自然语言转化为严谨的物理工作流,在BESIII实验中成功重新测量了十个J/psi衰变分支比,无需手动编程,展示了自主发现的潜力。

Comments 39 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22260 2026-04-27 cs.CV cs.AI 79%

Towards Safe Mobility: A Unified Transportation Foundation Model enabled by Open-Ended Vision-Language Dataset

迈向安全的移动性:由开放-ended视觉-语言数据集驱动的统一运输基础模型

Wenhui Huang, Songyan Zhang, Collister Chua, Yang Liang, Zhiqi Mao, Heng Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Harvard University(哈佛大学)

专题命中 评测与基准 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出Land Transportation Dataset数据集和UniVLT模型,通过开放-ended视觉问答和多任务学习,提升城市交通环境下的安全推理能力,实现微观自动驾驶与宏观交通分析的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10695 2026-04-27 cs.CL cs.AI cs.IR 79%

Learning from Natural Language Feedback for Personalized Question Answering

通过自然语言反馈学习实现个性化问答

Alireza Salemi, Hamed Zamani

机构 * Center for Intelligent Information Retrieval(智能信息检索中心) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VAC框架,利用自然语言反馈替代标量奖励,提升个性化问答效果,实验表明其在LaMP-QA基准上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22708 2026-04-27 cs.MA 78%

Seeing the Whole Elephant: A Benchmark for Failure Attribution in LLM-based Multi-Agent Systems

看见整个象:面向基于大语言模型的多智能体系统故障归因的基准测试

Mengzhuo Chen, Junjie Wang, Fangwen Mu, Yawen Wang, Zhe Liu, Huanxiang Feng, Qing Wang

专题命中 评测与基准 :LLM(title,abstract)

AI总结 本文提出TraceElephant基准测试,通过完整执行轨迹和可复现环境提升故障归因准确性,验证完整轨迹对故障原因识别的重要性。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11594 2026-04-27 eess.AS cs.SD 78%

HumDial-EIBench: A Human-Recorded Multi-Turn Emotional Intelligence Benchmark for Audio Language Models

HumDial-EIBench: 一个用于音频语言模型的情感智能基准测试

Shuiyuan Wang, Zhixian Zhao, Hongfei Xue, Chengyou Wang, Shuai Wang, Hui Bu, Xin Xu, Lei Xie

机构 * Nanjing University, China(南京大学,中国) AISHELL, China(AISHELL,中国)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出HumDial-EIBench,通过真实人类对话评估音频语言模型的情感智能,采用多选题和对抗性干扰项减少主观评分偏差,发现大多数模型在多轮情感跟踪和隐含因果推理上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21750 2026-04-27 cs.LG 77%

From Words to Amino Acids: Does the Curse of Depth Persist?

从词到氨基酸:深度诅咒是否依然存在?

Aleena Siji, Amir Mohammad Karimi Mamaghan, Ferdinand Kapl, Tobias Höppe, Emmanouil Angelis, Andrea Dittadi, Maurice Brenner, Michael Heinzinger, Karl Henrik Johansson, Kaitlin Maile, Johannes von Oswald, Stefan Bauer

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz AI, Munich(慕尼黑海德堡研究所人工智能部门) KTH Royal Institute of Technology(皇家理工学院) Institute of Computational Biology, Helmholtz Munich(海德堡慕尼黑计算生物学研究所) Google, Paradigms of Intelligence Team(谷歌,智能范式团队)

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究蛋白质语言模型中深度效率问题,通过分析七种主流PLM家族,发现任务相关计算集中在部分层,其余层主要提供预测细化,这一趋势在序列和多模态模型中均存在。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14990 2026-04-27 cs.CL 77%

Language Specific Knowledge: Do Models Know Better in X than in English?

语言特定知识:模型在X语言中是否比在英语中表现更好?

Ishika Agarwal, Nimet Beyza Bozdag, Nisval Patel, Dilek Hakkani-Tür

机构 * Department of Computer Science University of Illinois, Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 本文研究语言选择对语言模型问答能力的影响,提出语言特定知识概念,并通过实验展示不同语言下模型性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22367 2026-04-27 cs.CL cs.AI 73%

CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

CNSL-bench:用于评估多模态大语言模型在中文国家手语理解能力的基准

Rui Zhao, Xuewen Zhong, Xiaoyun Zheng, Jinsong Su, Yidong Chen

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省-台湾非物质文化遗产数字化保护与智能处理重点实验室(XMU),文化和旅游部,中国) National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CNSL-bench,首个评估多模态大语言模型在中文国家手语理解能力的基准,通过权威 grounding、多模态覆盖和手部动作多样性,评估21个模型,发现当前模型在手语理解上仍显著劣于人类表现。

Comments Accepted as the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22076 2026-04-27 cs.LG cs.CL 73%

PrivUn: Unveiling Latent Ripple Effects and Shallow Forgetting in Privacy Unlearning

PrivUn: 揭示隐私去学习中的潜在涟漪效应和浅层遗忘

Xiaoyi Chen, Haoyuan Wang, Siyuan Tang, Sijia Liu, Liya Su, XiaoFeng Wang, Haixu Tang

机构 * Xiaoyi Chen(陈晓艺) Haoyuan Wang(王浩元) Siyuan Tang(唐思远) Sijia Liu(刘思佳) Liya Su(苏丽雅) XiaoFeng Wang(王小峰)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出PrivUn框架,通过三级攻击场景和定量分析揭示隐私去学习方法的不足,发现梯度驱动的涟漪效应和浅层遗忘问题,并提出关联感知核心集选择和多层深度干预策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21950 2026-04-27 cs.SE cs.AI cs.LG 73%

Feedback Over Form: Why Execution Feedback Matters More Than Pipeline Topology in 1-3B Code Generation

反馈优先于流程:执行反馈比流程拓扑在1-3B代码生成中更重要

Charles Junichi McAndrews

专题命中 评测与基准 :language model(abstract);small language model(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨了在1-3B模型中,执行反馈对代码生成能力的影响,发现执行反馈比流程拓扑更有效,且通过进化搜索验证了简单循环优于复杂结构。

Comments 17 pages main text, 2 page references, 3 figures. Code: https://github.com/L3G/feedback-over-form

详情

展开后加载摘要…

URL PDF HTML 收藏