arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-24 至 2026-06-24 共收录 297 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 72 篇

2606.24525 2026-06-24 cs.CV 新提交 50%

VisCritic: Visual State Comparison as Process Reward for GUI Agents

VisCritic: 视觉状态比较作为GUI智能体的过程奖励

Jiachen Qian

机构 * City University of Hong Kong(香港城市大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出VisCritic框架,通过比较操作前后截图在视觉特征空间中的变化来验证GUI智能体动作,结合孪生视觉Transformer和动作感知评判头,无需额外人工标注即可提升多基准测试性能。

Comments 17 pages, 4 figures; ECCV 2026 submission; supplementary material uploaded as ancillary file

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24422 2026-06-24 cs.CV 新提交 50%

EgoSAT: A Comprehensive Benchmark of Egocentric Streaming Interaction Understanding

EgoSAT: 一个全面的自我中心流式交互理解基准

Yijia Lei, Jinzhao Li, Yichi Zhang, Jiacheng Hua, Yin Li, Miao Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 评测与基准 :language model(abstract)

AI总结 提出EgoSAT基准,统一自我中心视频的回顾、在线和前瞻推理任务,评估视觉语言模型在流式设置中的表现,发现现有模型存在前瞻/回顾困难及置信度校准问题。

Comments Accepted to ECCV 2026. Project page: https://leiyj23.github.io/EgoSAT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24361 2026-06-24 cs.CV 新提交 50%

SignNet-1M: Large-Scale Multilingual Sign Language Video Dataset with Downstream Benchmarks

SignNet-1M:大规模多语言手语视频数据集及下游基准

Zhewen He, Junyi Hu, Haomian Huang, Zhenhua Li, Yu-Shen Liu, Yi Fang

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) ChatSign Technology(ChatSign 技术公司) Tsinghua University(清华大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出SignNet-1M,通过3D高斯泼溅、扩散模型和后期渲染增强合成多样化手语视频,提升模型在跨视角、背景和身份等分布偏移下的泛化能力。

Comments 25 pages. Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24161 2026-06-24 cs.CV 新提交 50%

Dual-Branch Cross-Projection Debiasing through Diffusion-based Disentanglement

基于扩散解耦的双分支交叉投影去偏

Xiangqian Zhao, Xinyang Jiang, Zhipeng Xu, Lingfeng He, Zilong Wang, Dongsheng Li, De Cheng, Nannan Wang

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院)

专题命中 评测与基准 :foundation model(abstract)

AI总结 针对有偏数据下基础模型的泛化问题,提出置信引导的偏差概念挖掘(CBCM)和双分支交叉投影去偏(DCD)框架,通过扩散解耦和交叉零空间投影分离目标与虚假特征,在无组标签条件下实现最差组准确率最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24138 2026-06-24 cs.CV 新提交 50%

Sat2City v2: Native 3D City Asset Generation from a Single Satellite Image

Sat2City v2: 从单张卫星图像生成原生3D城市资产

Tongyan Hua, Dongli Wu, Jinjing Zhu, Yinrui Ren, Zhongcheng Hong, Ying-Cong Chen, Hui Xiong, Wufan Zhao

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The Chinese University of Hong Kong(香港中文大学) Auckland University of Technology(奥克兰理工大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 评测与基准 :foundation model(abstract)

AI总结 提出Sat2City v2,利用预训练的原生结构化潜空间3D基础模型,从单张卫星图像生成具有可控外观和几何形状的纹理网格,在真实数据集上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23892 2026-06-24 cs.CV 新提交 50%

REALM: A Unified Red-Teaming Benchmark for Physical-World VLMs

REALM: 面向物理世界视觉语言模型的统一红队基准

Yifei Zhao, Qian Lou, Mengxin Zheng

机构 * University of Central Florida(中佛罗里达大学)

专题命中 评测与基准 :language model(abstract)

AI总结 提出REALM,首个统一红队基准,集成12种攻击方法、3种防御和13个视觉语言模型,通过代理目标生成管道实现公平比较,发现文本注入攻击最有效。

Comments 20 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23875 2026-06-24 cs.DB 新提交 50%

On the Semantics of Generative SPARQL

生成式SPARQL的语义

Ratan Bahadur Thapa, Steffen Staab

专题命中 评测与基准 :language model(abstract)

AI总结 本文扩展SPARQL以支持生成式查询,通过GenOp调用语言模型并生成类型化解映射,在保持固定数据集假设下定义语义,并分析生成式查询模式的语义后果,包括映射级递归,最终证明其复杂性与标准SPARQL一致。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 44 篇

2606.17165 2026-06-24 stat.ME cs.AI econ.EM math.ST stat.TH 新提交 92%

Statistical Foundations of LLM-based A/B Testing: A Surrogacy Framework for Human Causal Inference

基于LLM的A/B测试的统计基础:用于人类因果推断的替代指标框架

Joel Persson, Mårten Schultzberg, Sebastian Ankargren

机构 * Spotify USA, Inc.(Spotify美国公司)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出替代指标理论框架,证明在弱于分布等价条件下,校准LLM输出可识别平均处理效应,并分析随机性带来的偏差与方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23701 2026-06-24 cs.CL cs.AI cs.HC cs.LG 新提交 92%

Evaluating LLM Usage for Efficient and Explainable Numerical and Classified Implicit Sentiment Analysis of Product Desirability

评估LLM在高效可解释的产品期望数值与分类隐式情感分析中的应用

Sherri Weitl-Harms, John Hastings

机构 * Creighton University(克雷顿大学) The Beacom College of Computer & Cyber Sciences, Dakota State University(达科他州立大学比肯计算机与网络科学学院)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出基于LLM的可扩展框架,从定性反馈中量化产品期望,零样本数值评分和分类情感分析分别达到0.97皮尔逊相关和94%准确率,GPT-4o-mini以94%更低成本实现可比性能,并集成置信度与可解释性。

Comments 20 pages, 6 figures, 11 tables. arXiv admin note: text overlap with arXiv:2408.01527

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04827 2026-06-24 cs.DC cs.AI cs.LG 版本更新 92%

VoltanaLLM: Energy-Efficient and SLO-Aware Disaggregated LLM Serving via Adaptive Frequency Control and State-Space Routing

VoltanaLLM: 通过自适应频率控制和状态空间路由实现节能且SLO感知的解耦LLM服务

Jiahuan Yu, Aryan Taneja, Junfeng Lin, Minjia Zhang

机构 * Siebel School of Computing(计算与数据科学学院) Department of Precision Instrument, Tsinghua University(清华大学精密仪器系)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出VoltanaLLM系统,利用控制理论,通过每实例迭代级频率选择和状态空间路由,在满足延迟SLO下降低LLM推理能耗,实验显示最高节能36.3%。

Comments Accepted by ISC High Performance 2026: https://ieeexplore.ieee.org/abstract/document/11520495/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01752 2026-06-24 cs.LG cs.AI cs.CL cs.CR 版本更新 92%

Tuning without Peeking: Provable Generalization Bounds and Robust LLM Post-Training

无窥调优:可证明的泛化边界与鲁棒的大语言模型后训练

Ismail Labiad, Mathurin Videau, Matthieu Kowalski, Marc Schoenauer, Alessandro Leite, Julia Kempe, Olivier Teytaud

机构 * Meta FAIR LISN, Inria, CNRS(LISN,Inria,CNRS) NYU Courant Institute(NYU Courant学院)

专题命中 效率与部署 :LLM(title,summary_cn);post-training(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BBoxER黑盒进化方法用于LLM后训练,通过隐式压缩数据诱导信息瓶颈,提供非平凡泛化边界和对数据投毒、提取攻击的鲁棒性理论保证,实验证明其有效性和隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24747 2026-06-24 cs.AI cs.CE 新提交 92%

Scaling Laws for Task-Specific LLM Distillation

任务特定LLM蒸馏的缩放定律

Lavinia Ghita, Dhruv Desai, Ioana Boier

机构 * NVIDIA(英伟达)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文推导了领域特定LLM压缩的经验缩放定律,通过定量金融领域的实验,比较了基于logit和LoRA的蒸馏方法,并引入混合思维链监督损失,揭示了监督格式对领域知识与通用知识权衡的关键作用。

Comments 24 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24467 2026-06-24 cs.AI 新提交 90%

CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference

CompressKV: 面向资源高效长上下文LLM推理的语义检索引导KV缓存压缩

Xiaolin Lin, Jingcun Wang, Olga Kondrateva, Yiyu Shi, Bing Li, Grace Li Zhang

机构 * Technical University of Darmstadt(达姆施塔特工业大学) University of Notre Dame(圣母大学) Technical University of Ilmenau(伊尔梅瑙工业大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出CompressKV框架,通过识别语义检索头(SRH)选择关键token并分层分配缓存预算,在仅用3% KV缓存时保留97%以上性能。

Comments arXiv admin note: substantial text overlap with arXiv:2508.02401

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21835 2026-06-24 cs.DC 版本更新 89%

Collaborative Lossless LLM Inference Serving with Offloading-based Pipeline Parallelism on Edge Devices

基于卸载的流水线并行实现边缘设备上的协作无损LLM推理服务

Mingyu Sun, Xiao Zhang, Shen Qu, Yan Li, Mengbai Xiao, Yanwei Zheng, Yuan Yuan, Dongxiao Yu

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 提出LOIP系统,通过卸载感知的交叉流水线并行、细粒度分配调度和在线内存自适应策略,在异构边缘设备上实现LLM无损推理,相比基线加速8.8-20.3倍。

Comments 12 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24077 2026-06-24 cs.CL 新提交 89%

Sentence-Level Contextual Entrainment in Large Language Models

大型语言模型中的句子级上下文嵌入

Yang Liu, Chenhui Chu

机构 * Kyoto University(京都大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL

AI总结 研究大型语言模型中句子级上下文嵌入现象,发现提示中的句子(包括反事实陈述)会显著增加其推理概率,且该现象随模型增大而减弱,通过关闭2%-4%的注意力头可缓解而不影响性能。

Comments 16 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14117 2026-06-24 cs.NI cs.AI 版本更新 89%

Toward Autonomous O-RAN: A Multi-Scale Agentic AI Framework for Real-Time Network Control and Management

迈向自主O-RAN:一种用于实时网络控制与管理的多尺度智能体AI框架

Hojjat Navidan, Mohammad Cheraghinia, Jaron Fontaine, Mohamed Seif, Eli De Poorter, H. Vincent Poor, Ingrid Moerman, Adnan Shahid

机构 * IDLab, Department of Information Technology at Ghent University - imec(IDLab,格鲁特大学信息科技系 - imec) Department of Electrical and Computer Engineering, Princeton University(电气与计算机工程系,普林斯顿大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出一种多尺度智能体AI框架,通过非实时、近实时和实时控制环的协调层次结构,实现O-RAN的自主网络控制与管理,并在非平稳条件下和意图驱动的切片资源控制场景中验证了其有效性。

Comments Accepted for publication in the IEEE Network magazine

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24165 2026-06-24 cs.CV 新提交 88%

Spectral Evolution-Guided Token Pruning in Multimodal Large Language Models

多模态大语言模型中基于谱演化引导的令牌剪枝

Bin Chen, Yuxiang Cai, Yadan Luo, Yi Zhang, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) The University of Queensland(昆士兰大学) Singapore Management University(新加坡管理大学) The University of Southern Queensland(南昆士兰大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 提出跨层谱演化(CLSE)框架,通过频域分析令牌表示在Transformer层间的演化来评估重要性,实现无训练剪枝,在保持性能的同时减少计算开销。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24156 2026-06-24 cs.CV 新提交 88%

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

利用先验校正的令牌缩减加速多模态大语言模型

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 提出PriorTR方法,通过分离任务条件注意力与模型先验注意力,在单次前向传播中估计先验并校正令牌重要性,实现无训练令牌缩减,提升多模态大语言模型效率与准确性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24083 2026-06-24 cs.CL cs.AI cs.LG 新提交 86%

CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression

CAVEWOMAN: 大型语言模型在语言输入和输出压缩下的行为

Morayo Danielle Adeyemi, Ryan A. Rossi, Franck Dernoncourt

机构 * Independent(独立研究者) Adobe Research(Adobe研究院)

专题命中 效率与部署 :large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出双通道评估协议CAVEWOMAN,发现输出压缩降低API模型成本(1.4-2.4倍),输入压缩反而增加成本(~1.15倍)并导致准确率下降和文本偏离。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17358 2026-06-24 cs.CR 新提交 86%

OTRO: Oblivious Tokenization Path with Square-Root ORAM

OTRO: 具有平方根ORAM的遗忘标记化路径

Jonghyun Lee, Yongqin Wang, Rachit Rajat, Daniel Wong, Mengyuan Li, Murali Annavaram

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对LLM机密计算中标记器访问模式泄露问题,提出OTRO,利用平方根ORAM实现高效遗忘查找,通过实例池、轮换填充和分块KV缓存感知标记化降低开销,在TDX环境中将TTFT开销限制在4.5%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24143 2026-06-24 cs.LG 新提交 84%

AsyncOPD: How Stale Can On-Policy Distillation Be?

AsyncOPD:同策略蒸馏可以有多陈旧?

Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjun Kang, Sanghyun Park, Donghoon Kim, Minjae Lee, Minseo Kim, Rishabh Tiwari, Yuchen Zeng, Hyung Il Koo, Kangwook Lee

机构 * FuriosaAI Ajou University(亚洲大学) UC Berkeley(加州大学伯克利分校) Microsoft Research(微软研究院) KRAFTON Ludo Robotics

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 研究异步同策略蒸馏中陈旧数据的影响,发现前向KL对陈旧更鲁棒,反向KL脆弱但可通过重算信号缓解,并提出AsyncOPD框架实现1.6-3.8倍加速。

Comments Code: https://github.com/furiosa-ai/async-opd

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10607 2026-06-24 cs.LG cs.AI 82%

MONAQ: Multi-Objective Neural Architecture Querying for Time-Series Analysis on Resource-Constrained Devices

MONAQ:面向资源受限设备的时间序列分析多目标神经架构查询

Patara Trirat, Jae-Gil Lee

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MONAQ通过多目标神经架构查询框架,结合大语言模型能力,实现对时间序列数据的高效处理与部署,实验表明其模型性能优于传统方法。

Comments EMNLP 2025 (Findings), Project Page: https://kaist-dmlab.github.io/MONAQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24286 2026-06-24 cs.CL cs.CV 新提交 81%

AVOC: Enhancing Hour-Level Audio-Video Understanding in Omni-Modal LLMs via Retrieval-Inspired Token Compression

AVOC:通过检索启发的令牌压缩增强全模态大语言模型中的小时级音视频理解

Yijing Chen, Wenhui Tan, Xiaoyi Yu, Yuyue Wang, Xin Cheng, Kaisi Guan, Hao Jiang, Xiangyang Li, Guojie Zhu, Ruihua Song

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Huawei Inc.(华为技术有限公司)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出AVOC框架,通过检索启发的令牌压缩模块,将多模态令牌压缩视为top-K检索问题,结合相关性、重要性和多样性三个标准,实现长时音视频理解,在小时级基准上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24295 2026-06-24 cs.CL 版本更新 81%

MERGE: Minimal Expression-Replacement GEneralization Test for Natural Language Inference

MERGE: 自然语言推理的最小表达式替换泛化测试

Mădălina Zgreabăn, Tejaswini Deoskar, Lasha Abzianidze

机构 * Utrecht Institute of Linguistics OTS(乌得勒支语言研究所OTS)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出MERGE测试,通过最小表达式替换(MERE)生成高质量变体,评估NLI模型在非对抗性变体上的泛化能力,发现LLM和微调模型泛化较差。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24549 2026-06-24 cs.CR 新提交 80%

FirmCure:Towards Autonomous and Adaptive Rehosting of Linux-Based Firmware

FirmCure:面向基于Linux固件的自主自适应重托管

Chuan Hong, Zheng Zhang, Lei Zhou, Laisong Li, Chenyifan Liu, Ze Huang, Xu Zhou, Peihong Lin

专题命中 效率与部署 :LLM(summary_cn,abstract)

AI总结 提出首个LLM驱动的全系统重托管框架FirmCure,通过自适应感知推理、反射合成和自主运行时干预,在10个厂商21个固件上实现100%端口开放率和90.5%服务交互性,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23897 2026-06-24 cs.CV cs.AI 新提交 79%

The Professor: Multi-Teacher Unsupervised Prompt Distillation for Vision-Language Models

The Professor: 面向视觉语言模型的多教师无监督提示蒸馏

Ahmad Algadhi, Ahmed Alzuhair, Omar Alkhulaif, Muzammil Behzad

机构 * King Fahd University of Petroleum and Minerals(法赫德国王石油矿产大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 提出多教师提示蒸馏方法TheProfessor,融合领域微调教师和零样本教师,在四个数据集上平均HM提升1.77点,尤其对域偏移数据集效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24579 2026-06-24 cs.CL 新提交 77%

Cross-Lingual Exploration for Parametric Knowledge

跨语言探索参数化知识

Elisha Diskind, Itamar Trainin, Uri Shaham, Leshem Choshen, Idan Szpektor, Omri Abend

机构 * The Hebrew University of Jerusalem(海法大学) Google Research(谷歌研究) MIT, IBM-MIT Watson AI Lab(麻省理工学院与IBM-麻省理工 Watson人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文研究通过跨语言提示策略探索大型语言模型中的隐藏事实知识,发现跨语言探索能显著提升知识迁移和事实召回,比单语言扩展更高效,并改善跨语言一致性。

Comments 29 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04767 2026-06-24 cs.LG 版本更新 77%

ParallelBench: Understanding the Trade-offs of Parallel Decoding in Diffusion LLMs

ParallelBench: 理解扩散大语言模型中并行解码的权衡

Wonjun Kang, Kevin Galim, Seunghyuk Oh, Minjae Lee, Yuchen Zeng, Shuibai Zhang, Coleman Hooper, Yuezhou Hu, Hyung Il Koo, Nam Ik Cho, Kangwook Lee

机构 * FuriosaAI UW-Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院) UC Berkeley(加州大学伯克利分校) Seoul National University(首尔国立大学) KRAFTON Ludo Robotics Project(Ludo机器人项目)

专题命中 效率与部署 :LLM(summary_cn,abstract_cn);分类 cs.LG

AI总结 针对扩散LLM并行解码导致生成质量下降的问题,通过信息论分析和合成实验揭示其根本限制,并提出首个专门基准ParallelBench,系统评估发现并行解码在现实任务中质量损失严重,且现有策略无法根据任务难度调整并行度。

Comments Accepted at ICLR 2026. Project Page: https://parallelbench.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.22309 2026-06-24 cs.HC cs.CY 75%

GPT-4o reads the mind in the eyes

GPT-4o解读他人眼神

James W. A. Strachan, Oriana Pansardi, Eugenio Scaliti, Marco Celotto, Krati Saxena, Chunzhi Yi, Fabio Manzi, Alessandro Rufo, Guido Manzi, Michael S. A. Graziano, Stefano Panzeri, Cristina Becchio

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究探讨GPT-4o在解读面部情绪与心理状态的能力,发现其在直立面孔上表现优于人类,但在倒置面孔上表现欠佳,且对白人面孔的解读更准确。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24623 2026-06-24 cs.CL cs.AI 新提交 73%

Privacy-Preserving RAG via Multi-Agent Semantic Rewriting: Achieving Confidentiality Without Compromising Contextual Fidelity

基于多智能体语义重写的隐私保护检索增强生成:在不损害上下文保真度的情况下实现机密性

Yuanhe Zhao, Tianyu Zhang, Huafei Xing, Derek F. Wong, Jianbin Li, Tao Fang

机构 * School of Control and Computer Engineering, North China Electric Power University(华北电力大学控制与计算机工程学院) Department of Computer & Information Science & Engineering, University of Florida(佛罗里达大学计算机与信息科学与工程系) NLP2CT Lab, Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系NLP2CT实验室) Institute of International Language Services Studies, Macau Millennium College(澳门千禧学院国际语言服务研究所)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体框架,通过语义重写净化检索内容,在去除敏感标识的同时保留语义核心,显著降低隐私泄露并保持上下文保真度。

Comments This full manuscript contains 23 pages and has been formally accepted for publication in Information Processing & Management (Elsevier IPM). Tao Fang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏