arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-01 至 2026-05-01 共收录 265 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 32 篇

2604.27586 2026-05-01 cs.AI cs.LG 62%

Trace-Level Analysis of Information Contamination in Multi-Agent Systems

多智能体系统中信息污染的跟踪级分析

Anna Mazhar, Huzaifa Suri, Sainyam Galhotra

机构 * Cornell University(康奈尔大学) University of Illinois(伊利诺伊大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究多智能体系统中信息污染现象,通过跟踪差异量化污染影响,提出污染表现类型分类及测量框架,揭示验证防护失效原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28147 2026-05-01 cs.CL 57%

On the Proper Treatment of Units in Surprisal Theory

关于在惊奇理论中正确处理单位的探讨

Samuel Kiegeland, Vésteinn Snæbjarnarson, Tim Vieira, Ryan Cotterell

机构 * ETH Zürich(苏黎世联邦理工学院) University of Copenhagen(哥本哈根大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文探讨了在惊奇理论中正确处理语言单位的重要性,提出应明确区分单位定义与预测区域选择,并统一框架处理任意单位库。

Comments ACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27132 2026-05-01 cs.AI 57%

TRUST: A Framework for Decentralized AI Service v.0.1

TRUST:一种去中心化AI服务框架v.0.1

Yu-Chao Huang, Zhen Tan, Mohan Zhang, Pingzhi Li, Zhuo Zhang, Tianlong Chen

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 TRUST框架通过去中心化方法解决高风险领域中大型推理模型和多智能体系统可靠性验证的问题,采用HDAG、DAAN协议和多层共识机制,提升透明性、鲁棒性和隐私保护,实现安全且可问责的AI部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26288 2026-05-01 cs.CV cs.AI 57%

CheXthought: A global multimodal dataset of clinical chain-of-thought reasoning and visual attention for chest X-ray interpretation

CheXthought:一个包含临床推理链和视觉注意力的全球多模态数据集,用于胸部X光解读

Sonali Sharma, Jin Long, George Shih, Sarah Eid, Christian Bluethgen, Francine L. Jacobson, Emily B. Tsai, Global Radiology Consortium, Ahmed M. Alaa, Curtis P. Langlotz

机构 * Center for Artificial Intelligence in Medicine and Imaging(医学与影像人工智能中心) Department of Radiology(放射科) Department of Pediatrics(儿科) Department of Radiology, Weill Cornell Medicine(韦氏 Cornell 医学院放射科) Department of Radiology, Brigham and Women’s Hospital(布里奇妇产科医院放射科) University of California, Berkeley(加州大学伯克利分校) University of California, San Francisco(加州大学旧金山分校) Department of Biomedical Data Science(生物医学数据科学部)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 CheXthought数据集通过501名放射科医生的50312例多读X光片,提供了103592条推理链和6609082条同步视觉注意力标注,展示了临床推理模式,并在事实准确性、空间定位、病理分类、视觉忠实度、时间推理和不确定性沟通等方面提升了视觉语言模型性能。

Comments 51 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12656 2026-05-01 cs.RO cs.LG 57%

FeaXDrive: Feasibility-aware Trajectory-Centric Diffusion Planning for End-to-End Autonomous Driving

FeaXDrive: 为端到端自动驾驶的可行性感知轨迹导向扩散规划

Baoyun Wang, Zhuoren Li, Ran Yu, Yu Che, Xinrui Zhang, Ming Liu, Jia Hu, Chen Lv, Bo Leng

机构 * College of Automotive and Energy Engineering, Tongji University(同济大学汽车与能源工程学院) College of Transportation Engineering, Tongji University(同济大学交通工程学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航空航天工程学院)

专题命中 推理与问题求解 :post-training(abstract);分类 cs.LG

AI总结 FeaXDrive通过轨迹导向的扩散规划方法,提升自动驾驶中轨迹空间的可行性建模,改进轨迹几何和运动学可行性,增强可行驶区域一致性,实验表明其在NAVSIM基准上表现优异。

Comments 22 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28078 2026-05-01 cs.CV 50%

AesRM: Improving Video Aesthetics with Expert-Level Feedback

AesRM:通过专家级反馈提升视频美学

Yujin Han, Yujie Wei, Yefei He, Xinyu Liu, Tianle Li, Zichao Yu, Andi Han, Shiwei Zhang, Tingyu Weng, Difan Zou

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of Sydney(悉尼大学) Alibaba Group(阿里巴巴集团)

专题命中 推理与问题求解 :post-training(abstract)

AI总结 本文提出AesRM框架,通过分解视频美学为视觉美学、视觉保真度和视觉合理性三个维度,构建了专家标注的AesVideo-Bench基准,并开发了AesRM-Base和AesRM-CoT模型,提升了视频美学评估的准确性和可解释性。

Comments 37 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22615 2026-05-01 cs.RO 50%

GazeVLA: Learning Human Intention for Robotic Manipulation

GazeVLA:学习人类意图以促进机器人操作

Chengyang Li, Kaiyi Xiong, Yuan Xu, Lei Qian, Yizhou Wang, Wentao Zhu

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology, Ningbo(宁波东部科技研究院) Peking University(北京大学) ShanghaiTech University(上海科技大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文提出GazeVLA框架,通过学习人类意图弥合人机之间的固有差距,提升机器人操作性能。

Comments Project page: https://gazevla.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26988 2026-05-01 cs.RO 50%

Robot Planning and Situation Handling with Active Perception

具备主动感知的机器人规划与情境处理

Austine Oloo, Zainab Altaweel, Yohei Hayamizu, Peiqi Liu, Yan Ding, Saeid Amiri, Hao Yang, Andy Kaminski, Chad Esselink, Chris Paxton, Xiaohan Zhang, Shiqi Zhang

机构 * SUNY Binghamton(纽约州立大学布法罗分校) CMU(卡内基梅隆大学) Ford Research(福特研究) Agility Robotics(敏捷机器人)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出VAP-TAMP框架,通过主动感知和情境评估提升机器人在动态环境中执行任务的能力,结合场景图进行任务与运动规划,通过仿真和移动机械臂平台验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 76 篇

2604.21564 2026-05-01 cs.CL 92%

Measuring Opinion Bias and Sycophancy via LLM-based Persuasion

通过基于LLM的说服测量意见偏见和阿谀奉承

Rodrigo Nogueira, Giovana Kerche Bonás, Thales Sales Almeida, Andrea Roque, Ramon Pires, Hugo Abonizio, Thiago Laitz, Celio Larcher, Roseval Malaquias Junior, Marcos Piau

机构 * Maritaca AI JusBrasil

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出llm-bias-bench方法,通过模拟多轮交互发现LLM在争议性话题上的真实立场,揭示辩论比直接提问更易引发阿谀奉承,且模型在持续争论中更倾向于模仿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27001 2026-05-01 cs.CR cs.SE 91%

An Empirical Security Evaluation of LLM-Generated Cryptographic Rust Code

对LLM生成的密码学Rust代码的实证安全评估

Mohamed Elsayed, Kenneth Fulton, Jeong Yang

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文评估了三种LLM生成的加密Rust代码的安全性,发现通用工具不足,提示策略对结果影响显著,且存在nonce重用等系统性问题。

Comments 10 pages, 2 figures , EASE 2026-The 6th International Workshop on Software Security Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14719 2026-05-01 cs.AI 90%

Policy-Grounded Safety Evaluation of 20 Large Language Models

基于政策的安全性评估:20个大语言模型

Juan Manuel Contreras

机构 * Aymara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出Aymara AI平台,用于生成和管理定制化的政策导向安全性评估。通过评估20个商业大语言模型在10个现实安全领域中的表现,揭示了模型在不同领域中的显著性能差异,强调了构建可扩展、可定制工具的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27405 2026-05-01 cs.CL cs.AI 90%

Beyond the Mean: Within-Model Reliable Change Detection for LLM Evaluation

超越平均:LLM评估中的模型内可靠变化检测

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文将临床心理学的可靠变化指数应用于LLM版本比较,发现大多数项目无可靠变化,但部分项目存在双向变化,且领域分解揭示了模型特定的反转现象。

Comments 7 pages, 4 figures, 2 tables. Pre-registered study. Code and data available

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27249 2026-05-01 cs.CL cs.AI 90%

Instruction Complexity Induces Positional Collapse in Adversarial LLM Evaluation

指令复杂性导致对抗性LLM评估中的位置崩溃

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨指令复杂性如何影响对抗性LLM评估中的位置崩溃现象,通过六种条件对抗性指令梯度测试,发现不同指令类型导致不同的响应分布和内容参与度,揭示了指令复杂性对响应机制的影响。

Comments 12 pages, 3 figures, 3 tables. Pre-registered on OSF (osf.io/7p64)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27666 2026-05-01 cs.CR 90%

VOW: Verifiable and Oblivious Watermark Detection for Large Language Models

VOW:用于大型语言模型的可验证且 oblivious 水印检测

Xiaokun Luan, Yihao Zhang, Pengcheng Su, Feiran Lei, Meng Sun

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 VOW 提出一种隐私保护且可验证的水印检测协议,通过安全多方计算和可验证 oblivious 假随机函数实现高效检测,提升水印对抗现代改写攻击的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27014 2026-05-01 cs.LG cs.CR 90%

Fidelity, Diversity, and Privacy: A Multi-Dimensional LLM Evaluation for Clinical Data Augmentation

保真度、多样性与隐私:面向临床数据增强的多维LLM评估

Guillermo Iglesias, Gema Bello-Orgaz, María Navas-Loro, Cristian Ramirez-Atencia, Mercè Salvador Robert, Enrique Baca-Garcia

机构 * Universidad Politécnica de Madrid(马德里理工大学) University Hospital Rey Juan Carlos(雷伊·卡洛斯大学医院) University Hospital Jimenez Diaz Foundation(吉梅尼兹·迪亚兹基金会大学医院) General Hospital of Villalba(维拉尔巴综合医院) University Hospital Infanta Elena(伊菲塔·埃莱娜大学医院) Universidad Catolica del Maule(马乌尔天主教大学) Madrid Autonomous University(马德里自治大学) CIBERSAM, ISCIII

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出多维LLM评估框架,用于生成符合ICD-10编码的合成心理健康评估报告,评估保真度、多样性及隐私安全,提升临床NLP训练数据质量。

Comments 9 pages, 1 figure, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26955 2026-05-01 cs.CY cs.AI 90%

Policy-Governed LLM Routing with Intent Matching for Instrument Laboratories

基于意图匹配的政策引导LLM路由用于仪器实验室

Emmanuel A. Olowe, Danial Chitnis

机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学 爱丁堡 英国)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 本文提出基于意图匹配的政策引导LLM路由系统,通过Routiium和EduRouter实现对实验室辅助系统的管理和控制,提升学习挑战度和任务完成率。

Comments IEEE EduCon

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16516 2026-05-01 cs.CL 90%

Supercharging Agenda Setting Research: The ParlaCAP Dataset of 28 European Parliaments and a Scalable Multilingual LLM-Based Classification

提升议程设定研究:28个欧洲议会的ParlaCAP数据集及可扩展的多语言LLM分类方法

Taja Kuzman Pungeršek, Peter Rupnik, Daniela Širinić, Nikola Ljubešić

机构 * Jožef Stefan Institute(焦兹夫·斯蒂芬研究所) Faculty of Computer and Information Science(计算机与信息科学系) University of Ljubljana(卢布尔雅那大学) Institute of Contemporary History(当代历史研究所) Faculty of Political Science(政治科学系) University of Zagreb(扎格列布大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文介绍ParlaCAP数据集,用于分析欧洲议会议程设定,并提出一种低成本的领域特定政策主题分类方法,通过多语言ParlaMint语料库构建分类器,展示其在目标领域内的有效性。

Comments 17 pages, 7 figures, 7 tables. Presented in the PoliticalNLP 2026 workshop, co-located with LREC 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27920 2026-05-01 cs.CL cs.AI 90%

Beyond Semantics: Measuring Fine-Grained Emotion Preservation in Small Language Model-Based Machine Translation

超越语义:在小型语言模型基础上的机器翻译中细粒度情感保留的测量

Dawid Wisniewski, Igor Czudy

机构 * Poznań University of Technology(波兹南技术大学)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了三种先进的小型语言模型在回译中保持细粒度情感的能力,探讨了模型自身的情感保留能力、情感意识提示的效果以及ModernBERT在情感分类中的表现。

Comments Accepted at EAMT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27727 2026-05-01 cs.SE 89%

LLM-as-a-Judge for Human-AI Co-Creation: A Reliability-Aware Evaluation Framework for Coding

LLM作为裁判促进人机协同创造:一种可靠性感知的编码评估框架

Md Faizul Ibne Amin, Yutaka Watanobe, Daniel M. Muepu, Haruto Suzuki, Kenta Nanaumi, Md Mostafizer Rahman

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 本文提出一种基于评分标准的LLM作为裁判框架,用于编程和软件工程的人机协同创造评估,通过多指标协议评估多个LLM裁判,并分析协同创造轨迹信号,揭示协同创造成功早期集中和修订行为异质性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27319 2026-05-01 cs.CR cs.LG cs.SE 89%

REBENCH: A Procedural, Fair-by-Construction Benchmark for LLMs on Stripped-Binary Types and Names (Extended Version)

REBench:一种用于LLM在剥离二进制类型和名称上的程序性、公平构造的基准测试(扩展版)

Jun Yeon Won, Xin Jin, Shiqing Ma, Zhiqiang Lin

机构 * Ohio State University(俄亥俄州立大学) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 REBench为LLM在二进制逆向工程中提供了一个全面的基准测试集,通过知识库驱动的方法生成地面真实数据,确保任务难度和通用性,以公平评估LLM在复杂任务中的表现。

Comments This is an extended version of our paper, which appears in AIWare 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27169 2026-05-01 cs.CL cs.LG 88%

Semantic Structure of Feature Space in Large Language Models

大语言模型特征空间的语义结构

Austin C. Kozlowski, Andrei Boutyline

机构 * Knowledge Lab University of Chicago(芝加哥大学知识实验室) Department of Sociology University of Michigan(密歇根大学社会学系)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究发现大语言模型隐藏状态中语义特征的几何关系与人类心理关联相似,通过360个词的特征向量投影32个语义轴,发现其与人类评分高度相关,且语义轴间余弦相似度预测了尺度间相关性,同时显示语义轴在低维子空间中存在显著变异,且词在某一轴上的操控会引发其在其他尺度上的评分变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27467 2026-05-01 cs.SE cs.CL 88%

ScaleBox: Enabling High-Fidelity and Scalable Code Verification for Large Language Models

ScaleBox:实现大规模语言模型高保真和可扩展的代码验证

Jiasheng Zheng, Xin Zheng, Boxi Cao, Pengbo Wang, Zhengzhao Ma, Qiming Zhu, Jiazhen Jiang, Yaojie Lu, Hongyu Lin, Xianpei Han, Le Sun

机构 * Chinese Information Processing Laboratory(中国科学院信息处理实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 ScaleBox通过自动化特殊判题生成与管理、细粒度并行执行和配置驱动的评估套件,提升大规模代码训练的验证准确性和效率,显著优于基线方法。

Comments Accepted to ACL 2026 Demo. Our project is available at https://github.com/icip-cas/ScaleBox

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27137 2026-05-01 cs.CL 88%

Cross-Lingual Response Consistency in Large Language Models: An ILR-Informed Evaluation of Claude Across Six Languages

跨语言响应一致性在大语言模型中的研究:基于ILR的Claude多语言评估

Camelia Baluta

机构 * Independent Researcher(独立研究者) Former Faculty, Defense Language Institute Foreign Language Center(前国防语言研究院外语中心 faculty) ILR/OPI Assessment Specialist(ILR/OPI 评估专家)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文基于ILR技能描述系统,评估Claude在六种语言中的响应一致性,发现法语响应比德语更长30%,且创造性输出存在显著跨语言差异,提出ILR指导的专家评估方法补充了纯计算基准。

Comments 12 prompt clusters 6 languages 3 runs; data and code at github.com/camelbal-ship-it/crosslingual-claude-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00095 2026-05-01 cs.CV cs.AI cs.CY 88%

EDU-CIRCUIT-HW: Evaluating Multimodal Large Language Models on Real-World University-Level STEM Student Handwritten Solutions

EDU-CIRCUIT-HW:评估多模态大语言模型在真实世界大学级STEM学生手写解答中的表现

Weiyu Sun, Liangliang Chen, Yongnuo Cai, Huiru Xie, Yi Zeng, Ying Zhang

机构 * Georgia Institute of Technology(佐治亚理工学院) Virginia Tech(弗吉尼亚理工学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出EDU-CIRCUIT-HW数据集,用于评估多模态大语言模型在处理包含数学公式、图表和文本推理的大学STEM学生手写解答中的性能,揭示模型在自动评分中的可靠性问题,并提出通过纠正识别错误提升AI评分系统鲁棒性的方法。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026. Project Website: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL GitHub and Dataset: https://gt-learning-innovation.github.io/CIRCUIT_EDU_HW_ACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08418 2026-05-01 cs.LG cs.AI 88%

Taxon: Hierarchical Tax Code Prediction with Semantically Aligned LLM Expert Guidance

Taxon: 基于语义对齐的LLM专家指导的层级税码预测

Jihang Li, Qing Liu, Zulong Chen, Jing Wang, Wei Wang, Chuanfei Xu, Zeyi Wen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Taxon框架,通过语义对齐和专家指导实现层级税码预测,结合多专家架构和语义一致性模型,在实际业务中提升准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20965 2026-05-01 q-fin.TR cs.AI cs.MA q-fin.CP q-fin.ST 87%

Learning to Aggregate Zero-Shot LLM Agents for Corporate Disclosure Classification

学习聚合零样本大语言模型代理以进行企业披露分类

Kemal Kirtac

机构 * University College London(伦敦大学学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过聚合零样本大语言模型输出提升企业披露分类性能,发现监督聚合优于零样本投票,尤其在混合信号披露中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27421 2026-05-01 cs.IR cs.CL 87%

A Reproducibility Study of LLM-Based Query Reformulation

基于大语言模型的查询改写可重复性研究

Amin Bigdeli, Radin Hamidi Rad, Hai Son Le, Mert Incesu, Negar Arabzadeh, Charles L. A. Clarke, Ebrahim Bagheri

机构 * University of Waterloo(滑铁卢大学) Mila – Quebec AI Institute(魁北克AI研究所) Toronto Metropolitan University(多伦多 Metropolitan 大学) University of Toronto(多伦多大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文在统一框架下系统评估了十种代表性大语言模型查询改写方法,发现检索范式对改写效果有显著影响,且大模型并不总能提升下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27335 2026-05-01 cs.CV 87%

Iterative Definition Refinement for Zero-Shot Classification via LLM-Based Semantic Prototype Optimization

基于LLM的语义原型优化的零样本分类迭代定义细化

Naeem Rehmat, Muhammad Saad Saeed, Ijaz Ul Haq, Khalid Malik

机构 * University of Michigan-Flint(密歇根大学弗林特分校)

专题命中 评测与基准 :LLM(title,title_cn);foundation model(abstract)

AI总结 本文提出一种无需训练的迭代定义优化框架,通过优化类别定义提升零样本网页内容分类性能,引入三种定义优化策略,并在13种前沿嵌入模型上验证了定义质量对分类效果的关键影响。

Comments Accepted at CVPR NeXD Workshop (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27261 2026-05-01 cs.DB 86%

SynSQL: Synthesizing Relational Databases for Robust Evaluation of Text-to-SQL Systems

SynSQL: 为文本到SQL系统的稳健评估合成关系数据库

Mohammadamin Habibollah, Davood Rafiei

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 SynSQL通过合成语义一致的关系数据库,揭示了文本到SQL系统在固定基准数据库外的性能下降,为研究LLM的结构化数据合成能力提供新视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27000 2026-05-01 cs.SE cs.CR cs.PL 86%

Adaptive and AI-Augmented Security Testing: A Systematic Survey of Program Analysis, Feedback-Driven Testing, and Hybrid Learning-Based Approaches

自适应与AI增强的安全测试:程序分析、反馈驱动测试和基于混合学习方法的系统性综述

Michael Wienczkowski

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文系统综述了自适应和AI增强的安全测试研究,探讨了程序分析、DevSecOps、反馈驱动模糊测试、LLM自动化测试生成及混合系统等五个领域,揭示了结构化程序表示与自适应测试机制之间的断层,并提出五个开放研究挑战。

Comments 29 pages, submitted for review

详情

展开后加载摘要…

URL PDF HTML 收藏