arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-18 至 2026-08-18 共收录 661 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 166 篇

2608.16081 2026-08-18 cs.CV 新提交 78%

SafeGesture: Evaluating Fine-Grained Hand Gesture Understanding in Vision-Language Models through Scenario-Conditioned Safety Interpretation

SafeGesture:通过场景条件安全解释评估视觉语言模型的细粒度手势理解能力

Taegang Kim, Saleh Afroogh, Junfeng Jiao

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Urban Information Lab, The University of Texas at Austin(德克萨斯大学奥斯汀分校城市信息实验室)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出SafeGesture基准,评估5款视觉语言模型的细粒度手势安全理解能力,发现模型存在感知与推理脱节,瓶颈为场景条件安全推理而非手势识别。

Comments 14 pages, 22 tables, 2 figures. Code and benchmark resources available at https://github.com/The-Responsible-AI-Initiative/SafeGesture

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交 78%

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 评测与基准 :language model(title,abstract)

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15456 2026-08-18 cs.CV 新提交 78%

AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models

AlignJEPA:面向遥感基础模型的预测性视觉-语言对齐

Md Aminur Hossain, Omkumar Vaghasiya, Rajeev Ranjan Dwivedi, Vinod Kurmi, Biplab Banerjee

机构 * Space Applications Centre, ISRO(印度空间研究组织空间应用中心) Indian Institute of Science Education and Research (IISER) Bhopal(印度科学教育与研究学院(博帕尔)) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 该研究针对遥感基础模型与自然语言对齐不足的问题,提出受JEPA启发的AlignJEPA框架,采用轻量级预测对齐网络,结合语义预测与双向对比检索,实现了参数高效的视觉-语言对齐。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16871 2026-08-18 cs.RO 版本更新 78%

SADP: Subgoal-Aware Diffusion Policy for Long-Horizon Manipulation Learned from Foundation Model Generated Demonstrations

SADP:基于基础模型生成示范的子目标感知扩散策略用于可解释机器人

Site Hu, Takato Horii

机构 * Department of Systems Innovation, Graduate School of Engineering Science, Osaka University(系统创新系,工学研究科,大阪大学)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 本文提出SADP,一种基于基础模型生成示范的子目标感知扩散策略,用于可解释机器人,通过自主生成子目标标注的示范数据,训练扩散策略,使机器人能够通过子目标结构和执行进度向用户解释决策过程,从而在长周期操作中实现更高的任务成功率和故障诊断能力。

Comments Revised manuscript with an updated title, evaluation protocol, and simulation results

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20271 2026-08-18 cs.CV 版本更新 78%

A Versatile Foundation Model for AI-enabled Mammogram Interpretation

一种用于AI辅助乳腺X线摄影解读的通用基础模型

Fuxiang Huang, Jiayi Zhu, Yunfang Yu, Yu Xie, Yuan Guo, Qingcong Kong, Mingxiang Wu, Xinrui Jiang, Shu Yang, Jiabo Ma, Ziyi Liu, Zhe Xu, Zhixuan Chen, Yujie Tan, Zifan He, Luhui Mao, Xi Wang, Junlin Hou, Lei Zhang, Qiong Luo, Zhenhui Li, Herui Yao, Hao Chen

机构 * Guangdong Provincial Key Laboratory of Malignant Tumor Epigenetics and Gene Regulation, Guangdong-Hong Kong Joint Laboratory for RNA Medicine, Department of Medical Oncology, Breast Tumor Centre, Phase I Clinical Trial Centre(广东省恶性肿瘤表观遗传与基因调控重点实验室,粤港澳RNA医学联合实验室,医学肿瘤科,乳腺肿瘤中心,I期临床试验中心) Guangdong Provincial Key Laboratory of Cancer Pathogenesis and Precision Diagnosis and Treatment, AI Big Data Laboratory, Department of Medical Oncology(广东省肿瘤发生与精准诊断与治疗重点实验室,人工智能大数据实验室,医学肿瘤科) Chongqing Key Laboratory of Bio-perception(重庆生物感知重点实验室)

专题命中 评测与基准 :foundation model(title,abstract)

AI总结 研究针对乳腺X线分析基础模型的临床转化缺陷,推出VersaMammo模型,构建含70余万张图像的多机构数据集,经两阶段预训练后在92项临床任务基准中表现顶尖,推动乳腺癌筛查诊断进展。

Comments 69 pages, 12 figures, 52 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16318 2026-08-18 cs.SE cs.AI cs.PF 新提交 77%

Revisiting the Performance of Generative Artificial Intelligence on Introductory Object-Oriented Programming Assessments: Insights from 2026

重新审视生成式人工智能在面向对象编程入门评估中的表现:来自2026年的见解

Marina Lepp, Joosep Kaimre

专题命中 评测与基准 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究评估ChatGPT-5.2等5种GenAI系统在OOP入门课程评估中的表现,发现其得分高于平均学生,在部分任务有优势但仍存在编译、高级OOP概念等问题,且较前一年有明显改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15932 2026-08-18 cs.AI 新提交 77%

Augmenting Text to Increase Translation Difficulty

通过增强文本提升翻译难度

William Kalikman, Šimon Sukup, Michal Tešnar, Vilém Zouhar

专题命中 评测与基准 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.AI

AI总结 针对机器翻译模型评估的饱和问题,提出对抗翻译优化(ATO)方法增强基准文本以提升翻译难度,生成了两个各含350篇英文文本的数据集,验证了其可有效降低翻译质量且无需额外成本。

Comments 18 pages, 8 figures, 10 tables. William Kalikman and Šimon Sukup contributed equally. Published in EAMT 2026. Code: https://github.com/BreakingMT/ATO. Data: https://huggingface.co/datasets/wskal/ATO-datasets

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14683 2026-08-18 cs.LG 新提交 77%

One Score, Two Decisions: Selective Prediction on the Rare-Disease Tail

一个分数,两个决策:针对罕见疾病尾部的选择性预测

Zhaoyang Jiang, Zhizhong Fu, Yunsoo Kim, Zicheng Li, Xuanqi Peng, Fei Teng, Jiacong Mi, Honghan Wu

机构 * School of Health & Wellbeing, University of Glasgow(格拉斯哥大学健康与福祉学院) Shanghai Sixth People’s Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院) School of Life Science and Technology, University of Electronic Science and Technology of China(电子科技大学生命科学与技术学院)

专题命中 评测与基准 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 针对罕见疾病尾部的选择性预测,研究发现现有小型开放权重LLM在超罕见疾病上表现受限,前两位边际可提升部分病例选择性准确率,且仅未标记分数无法确定边际切换是否有益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09860 2026-08-18 cs.RO cs.AI 版本更新 77%

RoboLab: A High-Fidelity Simulation Benchmark for Analysis of Task Generalist Policies

RoboLab:一种高保真模拟基准,用于分析任务通用策略

Jenai Xuning Yang, Rishit Dagli, Alex Zook, Hugo Hadfield, Ankit Goyal, Stan Birchfield, Fabio Ramos, Jonathan Tremblay

机构 * NVIDIA University of Toronto(多伦多大学) The University of Sydney(悉尼大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI

AI总结 RoboLab通过高保真模拟环境评估任务通用策略的真实泛化能力,提供120个任务的视觉、程序和关系能力测试,揭示当前最佳模型的性能差距。

Journal ref Robotics: Science and Systems XXII, Sydney, Australia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01018 2026-08-18 cs.AI 77%

AI for pRedicting Exacerbations in KIDs with aSthma (AIRE-KIDS)

Hui-Lee Ooi, Nicholas Mitsakakis, Margerie Huet Dastarac, Roger Zemek, Amy C. Plint, Jeff Gilchrist, Khaled El Emam, Dhenuka Radhakrishnan

专题命中 评测与基准 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

Journal ref Ooi, HL., Mitsakakis, N., Dastarac, M.H. et al. AI for predicting exacerbations in KIDs with asthma (AIRE-KIDS). npj Digit. Med. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16643 2026-08-18 cs.CL cs.AI cs.LG 新提交 75%

Toward Better Assessment of LLMs' Performance in Clinical Error Detection

面向更好评估大型语言模型(LLMs)在临床错误检测中的性能

Yifan Zhang, Rahmatollah Beheshti

机构 * University of Delaware(特拉华大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对LLMs临床错误检测评估的不足,通过多语言多模型实验发现多数LLMs配对判别能力差,提出用配对评估补充聚合指标的改进方案。

Comments Accepted at Machine Learning for Healthcare (MLHC) 2026; to appear in Proceedings of Machine Learning Research (PMLR), Vol. 340

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15073 2026-08-18 cs.CE 新提交 75%

BOCoDe: Engineering-Centered Benchmarking for Bayesian Optimization

BOCoDe:面向工程设计的贝叶斯优化基准测试

Rosen Ting-Ying Yu, Christophe Hatterer, Advaith Narayanan, Cyril Picard, Faez Ahmed

专题命中 评测与基准 :LLM(abstract,abstract_cn);foundation model(abstract)

AI总结 该研究针对贝叶斯优化的基准测试与工程设计场景不匹配的问题,推出开源BOCoDe基准集,含307个黑盒优化问题,评估31种算法,发现标准基准排名无法迁移至工程任务,为BO方法开发提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14808 2026-08-18 cs.AI cs.CL cs.LG 新提交 75%

Do LLMs Know What to Ask and When? Evaluating Multi-Turn Information Seeking

大型语言模型(LLMs)知道该问什么以及何时提问吗?评估多轮信息获取能力

Yepeng Huang, Jiawen Zhang, Michelle Dai, Xiaorui Su, Shanghua Gao, Zi Wang, Marinka Zitnik

机构 * Harvard University(哈佛大学) Google DeepMind(谷歌DeepMind)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究构建MT-InfoSeek评估套件,从提问内容、时机及信息影响三方面评估LLMs的多轮信息获取能力,发现其存在低估信息需求等缺陷,且该能力未被现有评估覆盖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16681 2026-08-18 eess.AS cs.SD eess.SP 版本更新 75%

A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models

音频超分辨率和带宽扩展从判别模型到生成模型的综述

Ningyuan Yang, Yize Li, Diego A. Cuji, Ryan M. Corey, Pu Zhao, Xue Lin, Andrew C. Singer

机构 * Discovery Partners Institute(发现伙伴研究所)

专题命中 评测与基准 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本文综述了音频超分辨率和带宽扩展领域,从判别模型向生成模型的转变,总结了早期判别模型的局限性以及生成模型在表示域、架构、条件机制等方面的改进,探讨了大语言模型和多模态基础模型等新兴方向,并指出了感知评估、相位建模和实际应用泛化等开放挑战。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16246 2026-08-18 cs.CR cs.AI 新提交 74%

CompoSkill: Compositional Skill Chain Attacks from Individually Scanner-Passing LLM Agent Skills

CompoSkill:通过可单独通过扫描器的大语言模型智能体技能实现的组合技能链攻击

Mingxiao Liu, Zhoumian Jiang, Jianan Ma, Jian Zhang, Jialuo Chen, Xinhao Deng, Zhen Wang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 CompoSkill框架揭示现有单技能认证的自主AI智能体存在系统性缺口,其通过双攻击者系统构造组合技能链攻击,在白、黑盒设置下分别实现83.3%、80.6%的风险链形成率,现有扫描器拦截效果有限。

Comments 9 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15092 2026-08-18 cs.CR cs.AI cs.SE 新提交 74%

WeSCE: A Benchmark for Measuring Security Drift in LLM-Driven Code Editing

WeSCE:用于测量大语言模型驱动的代码编辑中安全漂移的基准

Zhiyu Zhang, Tingyue Wen, Senke Sun, Dengxiang Liang, Enhao Huang

专题命中 评测与基准 :LLM(title);分类 cs.AI

AI总结 该研究推出WeSCE基准,针对仅指定功能目标的弱安全约束下的代码编辑,提出连续风险表示与漂移度量,以量化代码编辑中的安全漂移,为安全评估提供多尺度视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15046 2026-08-18 cs.LG 新提交 74%

Certifying Compressed Language Models: An Audit and a Statistical Toolkit

压缩语言模型的验证:审计与统计工具包

Amogh Singh

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 评测与基准 :language model(title);分类 cs.LG

AI总结 本文针对压缩语言模型等价声明的证据不足问题,开展17项等价声明的预注册审计,提出配对等价测试的报告标准,发布相关输出与代码。

Comments 109 pages, 3 figures, 20 tables. Artifacts and per-item outputs: doi.org/10.5281/zenodo.21939143

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14855 2026-08-18 cs.CL 新提交 74%

What to Forget in Unlearning? Forget Set Curation for Language Models

模型遗忘中该遗忘什么?面向语言模型的遗忘集筛选

Animesh Jha, Arpandeep Khatua, Youssef Allouah, Sanmi Koyejo

机构 * Stanford University(斯坦福大学)

专题命中 评测与基准 :language model(title);分类 cs.CL

AI总结 针对语言模型遗忘中遗忘集筛选缺失的问题,提出CleanSlate基准,发现不同遗忘集筛选器存在抑制效果弱或附带损伤的缺陷,表明遗忘集选择会影响遗忘效果与附带损伤。

Comments Presented at MemFM @ ICML 2026 and FoGen @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14763 2026-08-18 eess.IV cs.AI cs.CV cs.LG 新提交 73%

Cross-Modal Ultrasound-MRI Learning for Fetal Brain Ventricular Volumetry and Abnormality Screening

用于胎儿脑室体积测量与异常筛查的跨模态超声-MRI学习

Yuhao Huang, Yuanji Zhang, Yuhuan Lu, Dong Ni, P. Ellen Grant, Davood Karimi

专题命中 评测与基准 :language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出跨模态学习框架VIFBA,基于超声视频实现胎儿脑室体积预测、VM严重程度分类及非VM异常筛查,性能优于基线与现有模型,为产前脑筛查提供实用方案。

Comments 17 pages, 11 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16645 2026-08-18 cs.AI cs.CL cs.MA 新提交 73%

Reconstruction: A Blind Benchmark for Recovering Research Ideas from Pre-Publication Bibliographies

重构:从预发表参考文献中恢复研究思路的盲基准

Shaolong Chen, Yanlin Fei, Nazhou Liu, Xinmiao Yu, Lei Li, Rahul Thapa, Madalina Ciobanu, Qingqing Mao, Ritankar Das

机构 * Stanford University(斯坦福大学) Titan Holdings(泰坦控股公司) Prentis AI(普伦蒂斯人工智能公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出Reconstruction盲基准,测试语言模型从预发表参考文献恢复论文思路的能力,发现多智能体流水线可将匹配率提升约2.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15286 2026-08-18 cs.LG cs.AI 新提交 73%

No Task Fails Every Time: Why One-Shot Audits Are Structurally Blind to Agent Damage

没有任务每次都失败:为什么单次审计在智能体损伤问题上存在结构性盲区

Shiven Khurdi

机构 * Northeastern University(东北大学)

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 该研究提出AgentRelBench工具,发现单次智能体审计易遗漏损伤对,模型能力提升会减少损伤任务,部分模型存在宣称弃权却执行不可逆操作的情况,且所有发现均按预注册标准执行。

Comments 25 pages, 4 figures, 16 tables, 6 appendices. Code, task suite, released per-run verdicts, and a one-command reproduction of every reported number: https://github.com/shivenkk/agentrelbench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14999 2026-08-18 cs.CL cs.AI 新提交 73%

RamseyGadgets: A Graph Construction Dataset for LLMs

RamseyGadgets:面向大语言模型(LLMs)的图构造数据集

Zohair Raza Hassan, Deepak Pandita

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本研究提出新型图构造数据集RamseyGadgets,评估5个开源LLMs在其70个拉姆齐良图问题上的表现,发现LLMs在困难问题上准确率仅37.70%,Gemma-4-31B性能最优,还可用于确定提升LLMs表现的提示类型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26329 2026-08-18 eess.AS cs.CL cs.LG cs.SD 73%

TAU: A Benchmark for Cultural Sound Understanding Beyond Semantics

Yi-Cheng Lin, Yu-Hua Chen, Jia-Kai Dong, Yueh-Hsuan Huang, Szu-Chi Chen, Yu-Chen Chen, Chih-Yao Chen, Yu-Jung Lin, Yu-Ling Chen, Zih-Yu Chen, I-Ning Tsai, Hsiu-Hsuan Wang, Ho-Lam Chung, Ke-Han Lu, Hung-yi Lee

机构 * National Taiwan University(国立台湾大学) University of Toronto(多伦多大学)

专题命中 评测与基准 :LLM(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 5 pages; submitted to ICASSP 2026

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026, pp. 15542-15546

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16039 2026-08-18 eess.IV cs.AI cs.CV 新提交 70%

Decoupling Parcellation from Classification: Systematic Benchmark of Fast Brain Segmentation Methods for Alzheimer's Disease Detection

将脑部分区与分类解耦:阿尔茨海默病检测的快速脑分割方法的系统基准测试

Jiadao Zou, Hongyu Guo, Wei Xi

专题命中 评测与基准 :foundation model(abstract);prompting(abstract);分类 cs.AI

AI总结 该研究将脑部分区与分类解耦,在OASIS-1数据集上对SynthSeg+等快速深度学习分区方法开展系统基准测试,评估多种体积策略与分类范式,以量化其对AD检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16577 2026-08-18 cs.CL 新提交 70%

BabelSteering: Multilingual Safety Alignment via English Steering Vectors

BabelSteering:通过英文引导向量实现多语言安全对齐

Emma V. Stein, Dominik Meier, Terry Ruas, Jan Philip Wahle, Bela Gipp

机构 * University of Göttingen(哥廷根大学) German State Police NRW(北莱茵-威斯特伐利亚州德国警察)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出BabelSteering激活引导方法,利用英语安全监督的拒绝方向实现多语言安全对齐,可提升多语言有害请求拒绝率且任务效用损失极小,还引入多语言翻译评估流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16513 2026-08-18 cs.CV cs.AI 新提交 70%

MLLM-Guided Semantic Correction for Text-to-Video Generation

基于多模态大语言模型(MLLM)的文本到视频生成语义修正

Junhao Chen, Zheqi Lv, Keting Yin, Shengyu Zhang, Zhou Zhao, Feiyang Chen, Xinyu Duan, Baoxing Huai, Fei Wu

机构 * Zhejiang University(浙江大学) Huawei Cloud Computing Technology Co., Ltd.(华为云计算技术有限公司)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出一种无需训练的MLLM引导文本到视频生成语义修正框架,通过两个关键模块在生成中修正语义偏差,提升了生成内容的语义对齐度等性能,经多基准实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16402 2026-08-18 cs.AI 新提交 70%

A Policy Algebra for Trust-Preserving Agentic AI Execution

用于信任保留的智能体AI执行的策略代数

Bhaskar Tripathi, Anurag Kumar, Ramendra Kumar, Bhavesh Gadhe

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种策略代数,用于定义智能体AI执行的可靠范围,可干预94.8%的策略违规事件,保留86.9%的任务完成率,为构建可靠智能体提供支持。

Comments 7 figures, 10 tables, and 5 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16394 2026-08-18 cs.AI cs.IR 新提交 70%

Think Inside the Chunk: RegulaRAG for Regulation-Compliant Scenario Generation using LLMs: A Case Study of UN Regulation No. 152

在块内思考:使用大语言模型生成符合法规的场景的RegulaRAG——以联合国第152号法规为例

Vahid Zolfaghari, Nenad Petrovic, AndrÉ Schamschurko, Alois Knoll

机构 * Technical University of Munich(慕尼黑工业大学)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLMs难以结合冗长分层标准的问题,提出RegulaRAG流水线,经实验其在UN R152数据集上元分数最高且鲁棒性强,优于基线系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 70%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 评测与基准 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16249 2026-08-18 cs.LG 新提交 70%

SAUL: Sharpness-Aware Augmented-Lagrangian Unlearning

SAUL:感知锐度的增广拉格朗日模型遗忘算法

Jaewan Choi, Junyoung Yang, Sangdon Park

机构 * POSTECH(浦项科技大学) Computer Science and Engineering, POSTECH(浦项科技大学计算机科学与工程学院) Graduate School of Artificial Intelligence, POSTECH(浦项科技大学人工智能研究生院)

专题命中 评测与基准 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出SAUL算法,将模型遗忘建模为显式约束的受约束最小化问题,通过增广拉格朗日控制器等实现更优遗忘-效用权衡,即插即用修改器可提升基线模型遗忘后效用。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏