arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-22 至 2026-04-22 共收录 327 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 52 篇

2604.16529 2026-04-22 cs.SE cs.AI cs.CL cs.LG 75%

Scaling Test-Time Compute for Agentic Coding

为代理编程扩展测试时计算

Joongwon Kim, Wannan Yang, Kelvin Niu, Hongming Zhang, Yun Zhu, Eryk Helenowski, Ruan Silva, Zhengxing Chen, Srinivasan Iyer, Manzil Zaheer, Daniel Fried, Hannaneh Hajishirzi, Sanjeev Arora, Gabriel Synnaeve, Ruslan Salakhutdinov, Anirudh Goyal

机构 * Meta Superintelligence Labs(Meta超级智能实验室) University of Washington(华盛顿大学) New York University(纽约大学) Google DeepMind(谷歌DeepMind) Carnegie Mellon University(卡内基梅隆大学) Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于轨迹紧凑表示的代理编程测试时扩展框架,通过递归竞赛投票和并行-蒸馏-细化方法提升长周期代理性能,实验证明在SWE-Bench和Terminal-Bench上显著提升效果。

Comments 70 pages, 26 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19081 2026-04-22 cs.SE 75%

Proactive Detection of GUI Defects in Multi-Window Scenarios via Multimodal Reasoning

通过多模态推理主动检测多窗口场景中的GUI缺陷

Xinyao Zhang, Rui Wang, Jinhao Cui, Haotian Huang, Wei Xue, Wenhua Hu, Jianwen Xiang, Rui Hao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出一种端到端框架,通过主动触发多窗口状态,利用多模态大语言模型检测定位GUI缺陷,实验表明多窗口设置显著增加布局缺陷暴露,方法在应用和细粒度层面均优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03066 2026-04-22 cs.CL cs.AI cs.LG 75%

Do LLMs Encode Functional Importance of Reasoning Tokens?

大型语言模型是否编码了推理标记的功能重要性?

Janvijay Singh, Dilek Hakkani-Tür

机构 * Grainger College of Engineering(格雷格纳工程学院) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型是否内部编码了推理标记的功能重要性,提出贪心剪枝方法,在保持模型似然的前提下剪除对答案生成影响最小的推理标记,验证了模型在压缩推理链时的功能重要性结构。

Comments Updated after ACL Main 2026 acceptance; 25 pages, 8 figures, 4 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19548 2026-04-22 cs.CL cs.AI cs.CY 73%

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

通过辩证对齐平息代理中的行动者-观察者不对称性

Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(国立新加坡大学) Sichuan University(四川大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) University of Oxford(牛津大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReTAS模型,通过辩证对齐方法减少代理中的行动者-观察者不对称性,提升故障解决能力。

Comments ACL 2026 Main Conference. Project page: https://unikcc.github.io/ReTAS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18658 2026-04-22 cs.CR cs.AI cs.CL 73%

Owner-Harm: A Missing Threat Model for AI Agent Safety

所有权危害:AI代理安全的缺失威胁模型

Dongcheng Zhang, Yiqing Jiang

机构 * BlueFocus Communication Group(蓝ocus通信集团) Tongji University(同济大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出Owner-Harm威胁模型,旨在解决AI代理对部署者造成伤害的问题,通过实验验证了现有防御体系的不足,并引入SSDG框架提升检测效果。

Comments 15 pages. Companion manuscript on per-decision proof-obligation synthesis (LSVJ-S) in preparation

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18509 2026-04-22 cs.CL 70%

MASS-RAG: Multi-Agent Synthesis Retrieval-Augmented Generation

MASS-RAG:多代理合成检索增强生成

Xingchen Xiao, Heyan Huang, Runheng Liu, Jincheng Xie

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 MASS-RAG通过多代理结构处理证据,提升检索增强生成在噪声、不完整或异质证据下的表现,实验显示其在相关证据分散于检索结果时性能更优。

Comments ACL 2026 Findings, 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17821 2026-04-22 cs.AI 70%

WebUncertainty: Dual-Level Uncertainty Driven Planning and Reasoning For Autonomous Web Agent

WebUncertainty: 双层不确定性驱动的规划与推理用于自主网络代理

Lingfeng Zhang, Yongan Sun, Jinpeng Hu, Hui Ma, Yang Ying, Kuien Liu, Zenglin Shi, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Academy of Cyber, CETC Group(中国电子科技集团 Cyber 学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出WebUncertainty框架,通过双层不确定性驱动的自适应规划和蒙特卡洛树搜索机制,提升自主网络代理在动态交互和长周期任务中的规划与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18740 2026-04-22 cs.CV 67%

Autonomous Skeletal Landmark Localization towards Agentic C-Arm Control

自主骨骼标志点定位以实现智能C臂控制

Jay Jung, Ahmad Arrabi, Jax Luo, Scott Raymond, Safwan Wshah

机构 * University of Vermont(佛蒙特大学) Cleveland Clinic(克利夫兰诊所)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文研究了利用多模态大语言模型实现C臂控制中骨骼标志点的自主定位,通过实验验证了其在准确性和推理能力上的优势,为智能C臂控制提供了新方法。

Comments Accepted at IJCARS: IPCAI 2026. Int J CARS (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08014 2026-04-22 cs.CV 67%

Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding

弥合时空:解耦的时空对齐用于视频定位

Xuezhen Tu, Jingyu Wu, Fangyu Kang, Qingpeng Nong, Kaijin Zhang, Chaoyue Niu, Fan Wu

机构 * Shanghai Jiao Tong University(上海交通大学) ZTE Corporation(中兴通讯)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出Bridge-STG框架,通过解耦时空定位并保持语义连贯性,解决视频定位中时空对齐和视觉token冗余问题,实验表明其在多个基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04237 2026-04-22 cs.AI cs.CL cs.LG 67%

SAGE-32B: Agentic Reasoning via Iterative Distillation

SAGE-32B:通过迭代蒸馏实现代理推理

Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(韦达学院) Madan Bhandari Memorial College(马丹·班达里纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SAGE-32B是一种专注于代理推理和长期规划的320亿参数语言模型,通过迭代蒸馏提升推理能力,在代理推理基准测试中表现出色。

Comments 23 Pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19302 2026-04-22 cs.CV 67%

Bridging Semantics and Geometry: A Decoupled LVLM-SAM Framework for Reasoning Segmentation in Optical Remote Sensing

弥合语义与几何:一种解耦的LVLM-SAM框架用于光学遥感中的推理分割

Xu Zhang, Junyao Ge, Yang Zheng, Kaitai Guo, Jimin Liang

机构 * School of Electronic Engineering, Xidian University, Xi'an, Shaanxi 710071, China(西安电子科技大学电子工程学院)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 本文提出解耦的LVLM-SAM框架,通过结构化几何提示优化,提升光学遥感中推理分割的性能,实现语义与几何的结合。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00642 2026-04-22 cs.AR 67%

ChatHLS: Towards Systematic Design Automation and Optimization for High-Level Synthesis

ChatHLS: 面向高阶综合的系统化设计自动化与优化

Runkai Li, Jia Xiong, Xiuyuan He, Jieru Zhao, Jiaqi Lv, Haowen Fang, Lei Qi, Xi Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ChatHLS通过多智能体框架实现高阶综合的自动化调试与指令优化,提升硬件开发效率。

Comments Accepted by ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19459 2026-04-22 cs.AI cs.CL cs.LO 62%

Do LLMs Game Formalization? Evaluating Faithfulness in Logical Reasoning

大语言模型是否在形式化中作弊?评估逻辑推理中的忠实性

Kyuhee Kim, Auguste Poiroux, Antoine Bosselut

机构 * EPFL(苏黎世联邦理工学院)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了大语言模型在逻辑推理中的忠实性,发现统一生成方法在形式化过程中未表现出系统性作弊行为,但两种阶段流程揭示了两种不同的不忠实性模式。

Comments 25 pages, 4 figures, 22 tables. Published at the VerifAI-2 Workshop, ICLR 2026 (non-archival). Code and data: https://github.com/koreankiwi99/formalization-gaming

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18715 2026-04-22 cs.CL cs.AI 62%

Characterizing AlphaEarth Embedding Geometry for Agentic Environmental Reasoning

表征AlphaEarth嵌入几何用于代理环境推理

Mashrekur Rahman, Samuel J. Barrett, Christina Last

机构 * Dartmouth Libraries(达特茅斯图书馆) Dartmouth College(达特茅斯学院)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究AlphaEarth嵌入几何结构,开发代理系统用于环境推理,发现其非欧几里得特性及检索优于线性方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19444 2026-04-22 cs.LG 57%

Unsupervised Confidence Calibration for Reasoning LLMs from a Single Generation

无监督的置信度校准用于推理语言模型:从单次生成出发

Thomas Zollo, Jimmy Wang, Richard Zemel

机构 * Columbia University(哥伦比亚大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文提出一种无监督置信度校准方法,通过单次生成数据提升推理语言模型的置信度估计,经多任务评估显著优于基线方法,提升下游任务表现。

Comments 41 pages, 14 tables, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19395 2026-04-22 cs.CL 57%

Does Self-Consistency Improve the Recall of Encyclopedic Knowledge?

自洽性是否能提升百科知识的回忆能力?

Sho Hoshino, Ukyo Honda, Peinan Zhang

机构 * CyberAgent

专题命中 推理与问题求解 :prompting(abstract);分类 cs.CL

AI总结 本文通过建立MMLU基准的百科知识回忆分割,验证了自洽性在符号推理和百科知识回忆中的提升效果,使用GPT-4o达到MMLU 89%的准确率。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11037 2026-04-22 cs.AI 57%

BAPO: Boundary-Aware Policy Optimization for Reliable Agentic Search

BAPO:面向可靠代理搜索的边界感知策略优化

Shiyu Liu, Yongjing Yin, Jianhao Yan, Yunbo Tang, Qinggang Zhang, Bei Li, Xin Chen, Jingang Wang, Xunliang Cai, Jinsong Su

机构 * Institute of Artificial Intelligence, Xiamen University(厦门大学人工智能研究院) Meituan Inc.(美团公司) School of Informatics, Xiamen University(厦门大学信息学院) Westlake University(西湖大学) Jilin University(吉林大学) Key Laboratory of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian and Taiwan (Xiamen University), Ministry of Culture and Tourism, China(福建省和台湾非物质文化遗产数字化保护与智能处理重点实验室(厦门大学),中华人民共和国文旅部,中国)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 BAPO通过引入边界感知奖励和自适应奖励调节器,提升代理搜索的可靠性,避免过度依赖IDK响应,实验表明其显著增强可靠性。

Comments ACL 2026 Conference. Code is available at https://github.com/Liushiyu-0709/BAPO-Reliable-Search

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18946 2026-04-22 cs.AI 57%

Reasoning Structure Matters for Safety Alignment of Reasoning Models

推理结构对推理模型的安全对齐至关重要

Yeonjun In, Wonjoong Kim, Sangwu Park, Chanyoung Park

机构 * KAIST(韩国科学技术院)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.AI

AI总结 本文研究了推理模型安全风险的根源,提出通过修改推理结构实现有效安全对齐,提出AltTrain方法,通过轻量级监督微调实现安全对齐,实验验证其在多种任务和语言设置中的鲁棒性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16343 2026-04-22 cs.CV cs.AI cs.MA 57%

Visual Reasoning Agent: Robust Vision Systems in Remote Sensing via Inference-Time Scaling

视觉推理代理:通过推理时缩放实现遥感中的稳健视觉系统

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian

机构 * University of West Florida(西弗吉尼亚大学) United States Military Academy(美国军事学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出视觉推理代理(VRA),通过迭代的Think-Critique-Act循环,结合预训练的大规模视觉-语言模型和推理模型,提升遥感任务中的视觉推理能力,实现在挑战性问题上的40.67%提升。

Comments Accepted to MORS 2026 Artificial Intelligence Workshop Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19587 2026-04-22 cs.CV 50%

SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing

SmartPhotoCrafter: 统一推理、生成与优化用于自动摄影图像编辑

Ying Zeng, Miaosen Luo, Guangyuan Li, Yang Yang, Ruiyang Fan, Linxiao Shi, Qirui Yang, Jian Zhang, Chengcheng Liu, Siming Zheng, Jinwei Chen, Bo Li, Peng-Tao Jiang

机构 * vivo BlueImage Lab, vivo Mobile Communication Co., Ltd.(vivo蓝影实验室,vivo移动通信有限公司)

专题命中 推理与问题求解 :pretraining(abstract)

AI总结 本文提出SmartPhotoCrafter,通过统一推理生成过程实现自动摄影图像编辑,提升图像质量与美观,无需人工指令。

Comments tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17937 2026-04-22 cs.HC 50%

"Label from Somewhere": Reflexive Annotating for Situated AI Alignment

从某处获取标签:反思性标注用于情境化AI对齐

Anne Arzberger, Celine Offerman, Ujwal Gadiraju, Alessandro Bozzon, Jie Yang

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文通过反思性标注方法探讨 annotator 的社会位置如何影响标注判断,发现其能捕捉超越静态人口统计数据的元数据,并揭示标注者的位置谦逊与观点转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19105 2026-04-22 cs.CV 50%

EgoMotion: Hierarchical Reasoning and Diffusion for Egocentric Vision-Language Motion Generation

视角运动:层次推理与扩散用于中心视觉-语言运动生成

Ruibing Hou, Mingyue Zhou, Yuwei Gui, Mingshuang Luo, Bingpeng Ma, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing, Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(智能信息处理重点实验室,计算技术研究所(ICT),中国科学院(CAS)) Jilin University (JLU)(吉林大学(JLU)) Beijing University of Posts and Telecommunications (BUPT)(北京邮电大学(BUPT)) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出EgoMotion框架,通过层次推理和扩散模型生成基于第一视角视觉和语言指令的3D人类运动,解决语义推理与运动建模的协同优化问题,提升多模态接地和运动质量。

Comments 12 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 78 篇

2510.08145 2026-04-22 cs.CL 92%

Mitigating Judgment Preference Bias in Large Language Models through Group-Based Polling

通过基于群体的轮询缓解大语言模型中的判断偏好偏差

Shuliang Liu, Zhipeng Xu, Zhenghao Liu, Yukun Yan, Minghe Yu, Yu Gu, Chong Chen, Huiyuan Xie, Ge Yu

机构 * School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院,中国沈阳) Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系,中国北京) Software College, Northeastern University, Shenyang, China(东北大学软件学院,中国沈阳) Huawei, China(华为,中国)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出Genii框架,通过多智能体协作优化缓解LLM判断偏好偏差,无需人工标注数据,提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19260 2026-04-22 econ.GN q-fin.EC 92%

Understanding the Mechanism of Altruism in Large Language Models

理解大型语言模型中的利他主义机制

Shuhuai Zhang, Shu Wang, Zijun Yao, Chuanhao Li, Xiaozhi Wang, Songfa Zhong, Tracy Xiao Liu

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 研究通过稀疏自编码器揭示LLM利他行为的内部机制,识别出与行为变化相关的神经网络特征,并验证其对分配决策的影响,为对齐LLM行为与人类价值观提供框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19354 2026-04-22 cs.AI cs.CR cs.SE 92%

Do Agents Dream of Root Shells? Partial-Credit Evaluation of LLM Agents in Capture The Flag Challenges

智能体是否梦想着根壳?在夺旗挑战中的LLM智能体部分分数评估

Ali Al-Kaswan, Maksim Plotnikov, Maxim Hájek, Roland Vízner, Arie van Deursen, Maliheh Izadi

机构 * Delft University of Technology(代尔夫特理工大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DeepRed基准,用于评估LLM智能体在真实夺旗挑战中的能力,通过部分分数评分和自动化标注流程,发现当前智能体在非标准发现和长周期适应任务中表现有限。

Comments Accepted to AIWare'26 Benchmark and Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19124 2026-04-22 cs.CL 92%

Detoxification for LLM: From Dataset Itself

LLM去毒化:从数据集本身开始

Wei Shao, Yihang Wang, Gaoyu Zhu, Ziqiang Cheng, Lei Yu, Jiafeng Guo, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出HSPD方法,通过在原始语料上进行语义保留的改写,有效降低模型毒性,提升数据效用,减少后续调整成本。

Comments Accepted to Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19071 2026-04-22 cs.CL 92%

HoWToBench: Holistic Evaluation for LLM's Capability in Human-level Writing using Tree of Writing

HoWToBench: LLM在人类水平写作能力的综合评估方法:写作树

Andrew Zhuoer Feng, Cunxiang Wang, Yu Luo, Lin Fan, Yilin Zhou, Zikang Wang, Xiaotao Gu, Jie Tang, Hongning Wang, Minlie Huang

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出Tree-of-Writing方法,通过树状流程结构评估LLM写作能力,构建包含12类文体和1302条指令的中文写作基准,实现与人类判断的高相关性。

Comments 49 pages, 6 figures, 19 tables, ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18660 2026-04-22 cs.CR cs.AI 92%

Evaluating Answer Leakage Robustness of LLM Tutors against Adversarial Student Attacks

评估LLM导师对对抗性学生攻击的答案泄露鲁棒性

Jin Zhao, Marta Knežević, Tanja Käser

机构 * EPFL(瑞士联邦理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了学生对抗性攻击下LLM导师的答案泄露鲁棒性,评估了多种模型在对抗攻击下的表现,并提出标准化基准和防御策略。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18333 2026-04-22 cs.CR cs.CL 92%

Position: LLM Watermarking Should Align Stakeholders' Incentives for Practical Adoption

位置:LLM水印应使所有相关方的利益一致以实现实际应用

Yepeng Liu, Xuandong Zhao, Dawn Song, Gregory W. Wornell, Yuheng Bu

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) UC Berkeley(加州大学伯克利分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文探讨了LLM水印技术中利益相关方激励不一致的问题,提出通过设计激励一致的水印方法,如上下文水印,来解决实际应用中的障碍,强调在特定领域内实现可靠工具的重要性。

Comments ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03108 2026-04-22 cs.CL 91%

ChemPro: A Progressive Chemistry Benchmark for Large Language Models

ChemPro:一种渐进式的化学基准测试用于大语言模型

Aaditya Baranwal, Shruti Vyas

机构 * Aaditya Baranwal Shruti Vyas

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 ChemPro通过4100个化学问题-答案对评估大语言模型在化学领域的表现,涵盖多个难度层级,揭示了LLM在科学推理中的局限性。

Comments Accepted at Artificial Intelligence Chemistry Journal

Journal ref Artif. Intell. Chem. 4(1), 100118 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏