Real-Time Voice AI Hears but Does Not Listen
实时语音AI能听到但不倾听
机构 * Together AI ; Stanford University(斯坦福大学)
AI总结 评估四个领先实时语音系统,发现它们依赖文字而非声学线索,在情感理解上存在感知与行动脱节,提示需谨慎用于依赖语调的场景。
高校专区
实时语音AI能听到但不倾听
机构 * Together AI ; Stanford University(斯坦福大学)
AI总结 评估四个领先实时语音系统,发现它们依赖文字而非声学线索,在情感理解上存在感知与行动脱节,提示需谨慎用于依赖语调的场景。
相同证据,不同答案:多模态大语言模型中的顺序敏感性审计
机构 * Stanford University(斯坦福大学)
AI总结 提出Facet-Probe审计框架,评估18个多模态大语言模型在五种顺序扰动下的答案翻转率,发现所有模型均非顺序不变,最佳模型仍有13.4%翻转率,提示仅靠提示级缓解难以实现通用顺序鲁棒性。
Comments 22 pages, 4 figures, 5 tables
极限空间高效语言生成
机构 * EPFL(苏黎世联邦理工学院) ; Stanford University(斯坦福大学)
AI总结 针对空间效率约束下的极限语言生成问题,提出基于DFA假设类的流式算法,在多项式空间内实现生成差距O(k^{2s-2}),并证明近乎匹配的下界。
Comments Accepted at COLT 2026
BiPACE:基于双模拟引导与动作反事实估计的LLM智能体策略优化
机构 * University of Chicago(芝加哥大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Stanford University(斯坦福大学) ; University of Science and Technology of China(中国科学技术大学) ; Meituan(美团)
AI总结 针对分组强化学习中状态-动作信用分配不匹配问题,提出BiPACE优势估计器,通过双模拟引导的状态聚类和动作反事实基线,在无需批评网络或额外采样的前提下提升LLM智能体训练效果。
结构化稀疏:块稀疏特征化器捕获视觉概念流形
机构 * Goodfire ; Harvard University(哈佛大学) ; Stanford University(斯坦福大学) ; Brown University(布朗大学)
AI总结 提出块稀疏特征化器(BSF)来建模视觉概念流形,通过最小描述长度分析证明其比方向基特征化器更紧凑,并应用于解释曲线检测、发现新流形及控制图像生成。
面向LLM服务的几何感知在线调度:从理论界到系统实践
机构 * Gaoling School of Artificial Intelligence(人工智能学院) ; Renmin University of China(中国人民大学) ; Department of Management Science and Engineering(管理科学与工程系) ; Stanford University(斯坦福大学) ; Department of Industrial Engineering and Decision Analytics(工业工程与决策分析系) ; HKUST(香港科技大学)
AI总结 针对LLM推理中KV缓存动态内存占用问题,提出Smallest Volume First (SVF)算法,通过几何感知调度优化性能,理论证明将竞争比从48降至5,并在vLLM中实现即插即用,显著降低平均和尾部延迟。