arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1394 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 310 篇

2601.06896 2026-07-14 eess.AS cs.CL 版本更新 57%

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding

TagSpeech:基于细粒度时间定位的端到端多说话人自动语音识别与说话人分离

Mingyue Huo, Yiwen Shao, Yuheng Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Johns Hopkins University(约翰霍普金斯大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究提出TagSpeech框架,利用时间锚点定位技术联合多说话人ASR与说话人分离。通过关键设计解决细粒度对齐挑战,端到端建模“谁在何时说了什么”。实验显示其在DER上优于基线,采用参数高效训练范式,低计算成本获强性能。

Comments Accepted to ACL2026 Main Oral; v2: added overlap analysis in Section 5.2

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10229 2026-07-13 cs.CL 版本更新 57%

Latent Thoughts Tuning: Bridging Context and Reasoning with Fused Information in Latent Tokens

潜在思维调整:通过潜在令牌中的融合信息连接上下文与推理

Weihao Liu, Dehai Min, Lu Cheng

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究提出潜在思维调整(LT-Tuning)框架,通过重新定义潜在思维构建与部署方式,引入上下文预测融合机制,结合三阶段课程学习,实现潜在与显式思维模式动态切换,优于现有潜在推理基线,有效缓解特征崩溃并提升推理精度。

Comments In Proceedings of the Forty-third International Conference on Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19437 2026-07-13 quant-ph cs.LG 版本更新 57%

Is data-efficient learning feasible with quantum models?

量子模型能否实现数据高效学习?

Alona Sakhnenko, Christian B. Mendl, Jeanette M. Lorenz

机构 * Fraunhofer Institute for Cognitive Systems IKS(弗劳恩霍夫认知系统研究所) Technical University of Munich(慕尼黑技术大学) Ludwig-Maximilian University(路德维希-马克西米利安大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究量子模型能否数据高效学习,引入数据生成工具构建半人工经典数据集,发现QKMs在经典数据集上达可比误差所需训练示例更少,还将谱偏差泛化度量引入QML领域,弥合理论与实践差距,为探索数据集复杂性及理解QKM模型泛化优势铺路。

Comments Added additional experiments, clearer paper scope and implications

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06379 2026-07-10 cs.CV cs.AI 版本更新 57%

EasyLens: A Training-Free Plug-and-Play Subtle-Lesion Representation Amplifier for Medical Vision-Language Models

EasyLens: 一种无需训练的即插即用型微病变表示放大器,用于医学视觉语言模型

Qiwei Zeng, Hao Wang, Jinghao Lin, Shuchang Ye, Yuezhe Yang, Yige Peng, Haoyuan Che, Jinman Kim, Lei Bi

机构 * Jilin University(吉林大学) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ByteDance(字节跳动) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出EasyLens,一种无需训练的即插即用模块,通过构建病理-解剖原型空间、反事实推理选择病变相关补丁以及形态引导残差增强,放大医学视觉语言模型对微病变的表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15245 2026-07-09 cs.CL cs.HC 版本更新 57%

Practicing with Language Models Cultivates Human Empathic Communication

与语言模型练习培养人类共情沟通

Aakriti Kumar, Nalin Poungpeth, Diyi Yang, Bruce Lambert, Matthew Groh

机构 * Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Northwestern Institute for Complex Systems, Northwestern University(西北大学复杂系统研究所) Ryan Institute on Complexity, Northwestern University(西北大学复杂性研究院) Department of Computer Science, Stanford University(斯坦福大学计算机科学系) Department of Communication Studies, Northwestern University(西北大学传播学系) Department of Computer Science, Northwestern University(西北大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 研究通过实验平台探讨共情沟通技能的提升,发现简短的LLM指导干预能有效提升参与者与规范共情沟通模式的匹配度,并发现沉默共情效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01109 2026-07-09 cs.AI 版本更新 57%

Platonic Representations for Poverty Mapping: Unified Vision-Language Codes or Agent-Induced Novelty?

贫困地图绘制的柏拉图式表示:统一的视觉语言代码还是智能体诱导的新颖性?

Satiyabooshan Murugaboopathy, Connor T. Jerzak, Adel Daoud

机构 * AI and Global Development Lab(人工智能与全球发展实验室) Institute for Analytical Sociology(分析社会学研究所) Institute of Computer Science(计算机科学研究所) Department of Government(政府系)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究社会经济指标在卫星图像和网络文本中的信息印记,开发多模态框架经五条管道预测家庭财富,贡献包括融合视觉与文本提升预测、发现部分表示对齐证据、发布大规模多模态数据集。

Comments ICSC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新 57%

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04177 2026-07-08 cs.AI cs.MA 版本更新 57%

When Assisting One Disempowers Another

当帮助一方时却削弱了另一方

Claire Yang, Claire Jie Zhang, Maya Cakmak, Max Kleiman-Weiner

机构 * University of Washington(华盛顿大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究共享环境中人工智能助手行为,指出其可能无意削弱旁观者自主性,即旁观者赋权削弱。从理论上刻画赋权削弱产生条件,通过Disempower-Grid实证表明该现象存在,且受助手目标和能力影响大。

Comments v2: Updated title, added a co-author, extended theoretical analysis of bystander disempowerment, and added new experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13212 2026-07-08 cs.LG 版本更新 57%

MAME: Multidimensional Adaptive Metamer Exploration with Human Perceptual Feedback

MAME:基于人类感知反馈的多维自适应同态体探索

Mina Kamao, Hayato Ono, Ayumu Yamashita, Kaoru Amano, Masataka Sawayama

机构 * Graduate School of Information Science and Technology(信息科学与技术研究生学校) The University of Tokyo(东京大学) Graduate School of System Informatics(系统信息科学研究生学校) Kobe University(大阪大学) Hokkaido University(北海道大学) Prometech CG Research(Prometech CG研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 该研究针对人脑网络与人工模型对齐问题,提出MAME框架,通过人类感知反馈引导在线图像生成,在单个心理物理实验中成功测量多维人类同态体空间,发现人类与CNN模型在低级处理同态体空间对齐较差,强调早期视觉计算重要性,为研究人类视觉功能提供工具。

Comments 26 pages, 12 figures. Accepted at Journal of Vision

Journal ref Journal of Vision, 26(8):1, 1-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01790 2026-07-07 cs.SD cs.AI 版本更新 57%

Shao: Scaling Acoustic Token Language Models Toward High-Fidelity Music Generation

Shao:将声学令牌语言模型扩展至高保真音乐生成

Jiafeng Liu, Yuanliang Dong, Hongjia Liu, Yuqing Cheng, Zhancheng Guo, Huijing Liang, Wenbo Zhan, Yuming Sun, Xiaobing Li, Feng Yu, Maosong Sun

机构 * Central Conservatory of Music(中央音乐学院) Tsinghua University(清华大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 该研究提出单一声学令牌层级内渐进建模音乐结构与保真度的框架,通过双阶段生成与混合注意力训练,无需异构空间即可实现高质量音乐生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08467 2026-07-07 cs.CV cs.LG eess.IV 版本更新 57%

Zero-Shot Distracted Driver Detection via Vision Language Models with Double Decoupling

基于双解耦视觉语言模型的零样本分心驾驶员检测

Takamichi Miyata, Sumiko Miyata, Andrew Morris

机构 * Chiba Institute of Technology(千叶工业大学) Institute of Science Tokyo(东京科学大学) Loughborough University(拉夫堡大学)

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 提出一种主体解耦框架,通过提取驾驶员外观嵌入并从图像嵌入中移除其影响,再结合度量投影正交化文本嵌入,实现零样本分心驾驶检测,显著提升实际场景性能。

Comments Accepted to IEEE 15th International Symposium on Communication Systems, Networks and Digital Signal Processing (CSNDSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02546 2026-07-03 cs.CV cs.LG 版本更新 57%

RGB-Pointmap Pretraining for Unified 3D Scene Understanding

对比语言-彩色点图预训练用于统一3D场景理解

Ye Mao, Weixun Luo, Ranran Huang, Junpeng Jing, Krystian Mikolajczyk

机构 * Imperial College London(帝国理工学院伦敦分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出UniScene3D,一种基于Transformer的编码器,通过多视图彩色点图联合建模外观和几何,并引入跨视图几何对齐和接地视图对齐,在少样本和任务特定微调中达到SOTA。

Comments 19 Pages, ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24747 2026-07-03 cs.AI cs.MA 版本更新 57%

Formal Semantics for Agentic Tool Protocols: A Process Calculus Approach

智能体工具协议的形式语义:一种进程演算方法

Andreas Schlapbach

机构 * Swiss Federal Railways (SBB)(瑞士联邦铁路公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文通过进程演算形式化两种智能体工具协议(SGD和MCP),证明它们在映射Phi下结构互模拟,但反向映射有损,进而提出MCP+扩展实现完全等价。

Comments Logical flaw in Theorem 21

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16085 2026-07-02 cs.CV cs.AI 版本更新 57%

Interact3D: Compositional 3D Generation of Interactive Objects

Interact3D: 交互式物体的组合3D生成

Hui Shan, Keyang Luo, Ming Li, Sizhe Zheng, Yanwei Fu, Zhen Chen, Xiangru Huang

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Adobe Fudan University(复旦大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出Interact3D框架,通过统一3D引导场景、两阶段组合流水线(全局到局部几何对齐和基于SDF的优化)以及闭环智能体修正策略,从单张图像生成物理合理的交互式3D组合物体,解决遮挡和空间关系保持问题。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23605 2026-07-02 cs.AI 版本更新 57%

SleepLM: Natural-Language Intelligence for Human Sleep

SleepLM:人类睡眠的自然语言智能

Zongzhe Xu, Zitao Shuai, Eideen Mozaffari, Ravi S. Aysola, Rajesh Kumar, Yuzhe Yang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出SleepLM系列睡眠语言基础模型,通过多模态对齐实现自然语言驱动的睡眠解释与交互,在零样本/少样本学习、跨模态检索等任务上超越现有方法。

Comments spotlight presentation

Journal ref Proceedings of the 43st International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21397 2026-07-02 cs.CV cs.LG 版本更新 57%

MMLoP: Multi-Modal Low-Rank Prompting for Efficient Vision-Language Adaptation

MMLoP: 多模态低秩提示用于高效视觉-语言适配

Sajjad Ghiasvand, Haniyeh Ehsani Oskouie, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出MMLoP框架,通过低秩分解参数化视觉和文本提示,仅用11.5K可训练参数实现深度多模态提示,并引入自调节一致性损失、均匀漂移校正和共享上投影三个组件,在11个数据集上达到79.70%的基类到新类泛化调和平均。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29793 2026-07-01 cs.CL q-fin.GN 版本更新 57%

Fund2Persona: A Framework for Building and Refining Financial Advisor Personas from Fund Disclosure Data

Fund2Persona:基于基金披露数据构建与精炼金融顾问角色的框架

Suhwan Park, Hoyoung Lee, Zhangyang Wang, Alejandro Lopez-Lira, Young Cha, Chanyeol Choi, Jaewon Choi, Yongjae Lee

机构 * UNIST(蔚山科学技术院) LinqAlpha University of Texas at Austin(德克萨斯大学奥斯汀分校) University of Florida(佛罗里达大学) Blackstone(黑石集团) Hanwha Life(韩华生命)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出Fund2Persona框架,利用基金披露、持仓变动、市场背景和管理人评论构建金融顾问角色,并通过智能体循环精炼,在持仓重建和管理人评论对齐任务上优于通用基线,生成更具体有用的建议。

Comments 17 pages, 5 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14717 2026-06-26 cs.LG 版本更新 57%

Training-Free Generation of Protein Sequences from Small Family Alignments via Stochastic Attention

基于随机注意力的小家族比对无训练蛋白质序列生成

Jeffrey D. Varner

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 提出随机注意力(SA)方法,利用现代Hopfield能量和Langevin动力学从少量序列中无训练生成蛋白质序列,在8个Pfam家族上实现低组成差异、新颖性和结构合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08275 2026-06-26 q-bio.NC cs.CL 版本更新 57%

Linguistics and Human Brain: A Perspective of Computational Neuroscience

语言学与人脑:计算神经科学的视角

Fudong Zhang, Bo Chai, Yujie Wu, Wai Ting Siok, Nizhuan Wang

机构 * Institute of AI and Robotics, College of Intelligent Robotics and Advanced Manufacturing, Fudan University(人工智能与机器人研究院,智能机器人与先进制造学院,复旦大学) Department of Language Science and Technology, The Hong Kong Polytechnic University(语言科学与技术系,香港理工大学) Department of Computing, The Hong Kong Polytechnic University(计算系,香港理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文从计算神经科学视角,通过建模、模拟和数据分析将语言层次动态结构转化为可测试神经模型,并利用深度学习和大语言模型探索语言处理的神经基础。

Journal ref Cognitive Neurodynamics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00208 2026-06-24 cs.LG 版本更新 57%

Similarity of Neural Network Representations in Superposition

神经网络表示在叠加中的相似性

Sunny Liu, Habon Issa, André Longon, Liv Gorton, Meenakshi Khosla, Alex Williams, David Klindt

机构 * Cold Spring Harbor Laboratory(冷泉港实验室) UC San Diego(加州大学圣地亚哥分校) Anthropic(Anthropic公司) New York University Flatiron Institute(纽约大学Flatiron研究所)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 研究线性对齐度量在神经网络叠加表示中的失效问题,通过理论推导和稀疏自编码器实验证明对齐度量受投影Gram矩阵影响,并展示基于恢复潜在特征的度量能正确反映特征共享。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03818 2026-06-23 cs.CL 版本更新 57%

Empirical Prompt Engineering for Construct Identification with Large Language Models

改善人机编码对齐:心理学构念识别中提示工程的实证评估

Kylie L. Anglin, Stephanie Milan, Brittney Hernandez, Claudia Ventura

机构 * Department of Educational Psychology, Neag School of Education, University of Connecticut(教育心理学系,教育学院,康涅狄格大学) Department of Psychological Sciences, College of Liberal Arts and Sciences, University of Connecticut(心理学系,文理学院,康涅狄格大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究提出一个实证框架,通过提示工程优化大语言模型在心理学文本中识别构念的性能。实验评估五种提示策略,发现构念定义和任务框架最关键,结合代码簿引导和自动提示工程的少样本方法最接近专家判断。

Comments 22 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00116 2026-06-23 q-bio.NC cs.AI 版本更新 57%

Meta-learning ecological priors from large language models explains human learning and decision making

从大型语言模型中元学习生态先验解释人类学习与决策

Akshay K. Jagadish, Mirko Thalmann, Julian Coda-Forno, Marcel Binz, Eric Schulz

机构 * Institute for Human-Centered AI, Helmholtz Computational Health Center(以人为本的人工智能研究所,海德堡计算健康中心) Computational Principles of Intelligence, Max Planck Institute for Biological Cybernetics(计算智能原理,马克斯·普朗克生物 cybernetics 研究院) Eberhard Karls University of Tübingen(图宾根大学) Princeton AI Lab, Princeton University(普林斯顿大学人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 提出生态理性分析框架,利用大语言模型生成生态有效任务,通过元学习得到ERMI算法,该算法内化自然问题空间的统计规律,灵活适应新情境,在15个实验中优于多个认知模型,表明人类认知可能反映对日常问题生态结构的适应性对齐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02885 2026-06-19 cs.CL 版本更新 57%

Med-R2: Perception and Reflection-driven Complex Reasoning for Medical Report Generation

Med-R2:面向医学报告生成的感知与反思驱动复杂推理

Hao Wang, Shuchang Ye, Jinghao Lin, Usman Naseem, Jinman Kim

机构 * The School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) The School of Computing, Macquarie University(麦考瑞大学计算机学院) Doubao Medical Group, ByteDance(字节跳动 doubao 医疗集团)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出Med-R2微调策略,通过引入感知驱动的长推理过程和放射学知识指导,并加入反思机制修正感知错误,提升LVLMs在医学报告生成中的病理特征感知和诊断准确性。

Comments 28 pages, 3 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17386 2026-06-19 eess.SY cs.LG cs.SY 版本更新 57%

A graph neural network surrogate model for mesh-based crashworthiness prediction of vehicle panel components

基于图神经网络的网格级车辆面板部件耐撞性预测代理模型

Haoran Li, Yingxue Zhao, Haosu Zhou, Tobias Pfaff, Nan Li

机构 * Dyson School of Design Engineering, Imperial College London(迪森设计工程学院,帝国理工学院伦敦分校) NVIDIA

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 提出递归图U-Net (ReGUNet) 代理模型,通过图表示有限元网格,结合层次架构和递归机制,高效准确预测车辆B柱等面板部件的动态变形和耐撞性指标。

Comments Accepted manuscript version. Final published version available in Results in Engineering via DOI: 10.1016/j.rineng.2026.110925

Journal ref Results in Engineering 30 (2026) 110925

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01697 2026-06-18 cs.CL 版本更新 57%

RCEM: Robust Conversational Search EMbedder in Distributional Shift

RCEM:配备查询重写技能的嵌入器,用于分布偏移下的鲁棒对话搜索

Kilho Son, Paul Hsu, Cha Zhang, Dinei Florencio

机构 * Microsoft(微软)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出RCEM模型,通过将LLM的查询重写能力蒸馏到嵌入模型中,实现无需显式重写的上下文感知检索,在分布偏移下提升鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25929 2026-06-18 cs.MA cs.LG 版本更新 57%

Multi-Agent Systems are Mixtures of Experts: Who Becomes an Influencer?

多智能体系统是专家混合:谁成为影响者?

Franka Bause, Jonas Niederle, Martin Pawelczyk, Rebekka Burkholz

机构 * CISPA Helmholtz Center for Information Security(CISPA海德堡信息安全中心) Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文通过Friedkin-Johnsen意见动力学模型分析多智能体LLM协商机制,揭示输入依赖的FJ参数使系统成为专家混合,并探讨基于自信度、感知自信度和初始观点对齐的影响者形成机制。

Comments Accepted at the 2nd Workshop on Compositional Learning at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07375 2026-06-18 cs.CL cs.SD eess.AS 版本更新 57%

TurnGuide: Enhancing Meaningful Full Duplex Spoken Interactions via Dynamic Turn-Level Text-Speech Interleaving

TurnGuide: 通过动态轮次级文本-语音交错增强有意义的全双工口语交互

Wenqian Cui, Lei Zhu, Xiaohui Li, Zhihan Guo, Haoli Bai, Lu Hou, Irwin King

机构 * The Chinese University of Hong Kong(香港中文大学) Huawei Technologies(华为技术)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出TurnGuide方法,通过动态分割助手语音为对话轮次并交错生成轮次级文本和语音,解决全双工语音语言模型在连续双通道音频中集成离散文本令牌导致的时间对齐问题,显著提升语义连贯性和轮次交互性能。

Comments Interspeech 2026 Long Paper Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00567 2026-06-18 cs.IR cs.AI 版本更新 57%

Improving Scientific Document Retrieval with Academic Concept Index

利用学术概念索引改进科学文献检索

Jeyun Lee, Junhyoung Lee, Wonbin Kweon, Bowen Jin, Yu Zhang, Susik Yoon, Dongha Lee, Hwanjo Yu, Jiawei Han, Seongku Kang

机构 * Korea University Seoul South Korea University of Illinois Urbana-Champaign Champaign United States Texas A\&M University College Station United States Yonsei University Seoul South Korea Pohang University of Science Korea University University of Illinois Urbana-Champaign Texas A\&M University Yonsei University

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 针对通用检索器在科学领域因词汇和需求不匹配而表现不佳的问题,提出基于学术概念索引的方法,通过概念覆盖查询生成和概念聚焦上下文扩展,提升查询质量和检索性能。

Comments Accepted for publication in ACM TIST, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03872 2026-06-17 cs.CL 版本更新 57%

Atlas: Orchestrating Heterogeneous Models and Tools for Multi-Domain Complex Reasoning

Atlas: 编排异构模型与工具实现多领域复杂推理

Jinyang Wu, Guocheng Zhai, Ruihan Jin, Jiahao Yuan, Yuhao Shen, Shuai Zhang, Zhengqi Wen, Jianhua Tao

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) East China Normal University(华东师范大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出ATLAS双路径框架,通过无监督聚类路由和强化学习多步路由动态选择最优模型-工具组合,在15个基准上超越GPT-4o,分布内外任务分别提升10.1%和13.1%。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21803 2026-06-16 cs.CL 版本更新 57%

SimSiam Naming Game: A Unified Approach for Emergent Communication and Representation Learning

SimSiam 命名博弈:一种用于涌现通信和表示学习的统一方法

Nguyen Le Hoang, Tadahiro Taniguchi, Tianwei Fang, Akira Taniguchi, Masatoshi Nagano

机构 * Kyoto University(京都大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出SimSiam命名博弈(SSNG),通过对称自监督表示对齐替代采样更新,实现无反馈的涌现通信,在CIFAR-10和ImageNet-100上线性探针分类准确率显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏