Task Compass: Scaling Multi-task Pre-training with Task Prefix
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Findings of EMNLP 2022
AI 大模型
大模型数学、逻辑、规划、多步推理和测试时计算能力。
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Findings of EMNLP 2022
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Best Demo Award at CVPR 2022
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 18 pages, 13 figures
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted in EMNLP 2021-Findings. 15 pages, 12 figures, 3 tables
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2021
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2021 (15 pages, 4 figures, 14 tables)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 15 pages, 4 figures. Code and Data: https://github.com/INK-USC/CALM/
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 9 pages. 4 figures, 4 tables
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at NAACL'19
不同的教师,不同的能力:用于结构化文本丰富的低于1B的设备端蒸馏
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.CL、cs.AI
AI总结 研究将8B推理教师模型蒸馏成0.6B学生模型,添加对照,通过盲测评分。学生模型处理速度快,恢复部分摘要质量差距。不同教师模型转移不同能力,无单一引擎全胜,得出设备端丰富的按领域路由图。
Comments 12 pages, 5 figures. has a same-size non-reasoning-teacher control, a three-judge LLM-as-a-judge panel with a negative control, full-source faithfulness grading, and a per-field routing analysis
当推理模型损害行为模拟:多智能体大语言模型谈判中的求解器-采样器不匹配
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
AI总结 研究指出推理增强模型在模拟行为时可能表现不佳,通过三个多智能体谈判环境实验发现,有界推理能产生更多样且妥协导向的轨迹,强调模拟应将模型视为采样器而非求解器。
Comments 20 pages, 2 figures. Substantially revised. Formerly titled "When Reasoning Models Hurt Behavioral Simulation: A Solver-Sampler Mismatch in Multi-Agent LLM Negotiation"
机构 * University of Freiburg(弗赖堡大学) ; Prior Labs(Prior公司) ; ELLIS Institute(ELLIS研究所) ; Tübingen University of Freiburg(弗赖堡大学图宾根分校)
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI、cs.LG
Comments Accepted at the NeurIPS 2025 Workshop on Efficient Reasoning. 10 pages, 11 figures
专题命中 其他推理 :reasoning(abstract,comments);分类 cs.AI
Comments 31 pages, 9 figures, Accepted in the International Journal of Approximate Reasoning (2019)
Journal ref International Journal of Approximate Reasoning, year 2019, vol. 105, pp. 1-26
评分需要评分标准,而非智能
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出any-to-bench设计原则,证实小型语言模型依据明确评分标准评分的可靠性与高成本模型相当,评分标准中的官方答案是关键,可将评分与评分者智能解耦。
SGHA:基于证据的研究问题发现,使用本地语言模型
机构 * C-MInDS, IIT Bombay(印度理工学院孟买分校C-MInDS) ; Machine Learning Department, MBZUAI(穆罕默德·本·扎耶德人工智能大学机器学习系)
专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出SGHA,一种基于本地9B开源LLM的研究问题发现系统,通过构建文献证据图检测研究差距,经对比实验证明其可实现可核查的研究问题构建,无需依赖专有前沿模型。
Comments Link to Code and artifacts: https://github.com/SarveshVGharat/structural-gap-hypothesis-agent
上游决策,下游生成:定位与定价多语言MoE模型的跨语言拒绝回路
机构 * Gödel Machines(哥德尔机器) ; IIT Madras(印度马德拉斯理工学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对多语言MoE模型的跨语言拒绝不均衡问题,在sarvam模型中定位到由注意力对抗者约束的混合专家生成器回路,揭示其机制并量化了安全修复的成本。
Comments Accepted to the actionable Interpretability workshop at COLM 2026
AI聊天机器人中的广告:大型语言模型如何应对利益冲突分析
机构 * Princeton University(普林斯顿大学) ; University of Washington(华盛顿大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文分析了大型语言模型在面临用户与公司利益冲突时的决策问题,通过实验发现多数模型优先考虑公司利益而非用户福祉,展示了在广告推荐中潜在的风险。
Comments COLM 2026
大型语言模型在规则应用中展现出概念掌握能力的证据
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 本文通过两项心理学实验发现,Gemini Pro等部分LLMs在规则应用上展现类人表现,证实LLMs掌握规则概念,对法律决策与哲学探究有启示。
模型催眠:通过叠加阈下效应对AI进行强控制
机构 * University of Pennsylvania(宾夕法尼亚大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究发现AI模型普遍存在模型催眠现象,可通过组合提示中微弱无关线索强控制模型行为,该现象跨模型家族且具迁移性,对AI安全与可解释性构成挑战。
结合人类反馈的策略迭代:将后训练强化学习应用于上下文学习
机构 * Vanderbilt University(范德堡大学) ; Vanderbilt University Medical Center(范德堡大学医学中心)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出结合人类反馈的策略迭代(PIHF)方法,采用预训练语言模型为基底,经实验使其在罕见疾病诊断相关任务中显著提升了多个执行器的Recall@1指标,验证了其可行性。
Comments PIHF method paper
Mint-Agent:引入金融原生智能体基础模型
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 本研究提出金融原生智能体模型Mint-Agent,通过三大支柱开发出Mint-Cu(9B)和Mint-Ag(27B),在多个金融基准测试中展现出优异的可靠性与可执行性,为可信金融智能提供了新路径。
步骤级在线策略蒸馏:在线策略蒸馏与监督微调的插值方法
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) ; XingYun Lab, HUJING Digital Media & Entertainment Group(星云实验室,沪景数字媒体娱乐集团) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Data Science, Fudan University(复旦大学数据科学学院)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对令牌级在线策略蒸馏的局限,提出步骤级在线策略蒸馏SOPD,结合监督微调与在线策略蒸馏的优势,在推理和智能体任务上显著优于传统方法,为蒸馏研究提供新视角。
语言模型是否一致地编码了当前年份?
机构 * Stanford University(斯坦福大学)
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG
AI总结 该研究探究语言模型对当前年份的编码一致性,设计两项不同任务,发现关联与声明年份的编码机制不同,现有修改方法无法同时调整两者,表明当前年份未被一致编码。
Comments Accepted at the Conference on Language Modeling (COLM) 2026
LlamaRec-LKG-RAG:一种用于基于大语言模型的排序的单遍可学习知识图谱-RAG框架
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究提出LlamaRec-LKG-RAG框架,将个性化知识图谱上下文集成到LLM推荐排序中,经ML-100K等数据集实验,在MRR等指标上较LlamaRec取得提升,为知识感知个性化推荐奠定基础。
AI推荐的医生属于谁?大型语言模型辅助医生选择中声誉与人口统计信号的算法审计
专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI
AI总结 该研究通过随机算法审计发现,LLM辅助医生选择时,声誉信号影响最大,人口统计信号存在倾斜但模型解释未体现,提出重复行为审计是合适的监测技术。
Comments 26 pages, 9 figures, 10 tables