arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

共收录 3015
2607.29044 2026-08-03 cs.CL 新提交

From Inline Notes to Collected Commentaries: Toward Context-Preserving Organization of Exegetical Knowledge in Classical Chinese Texts

从夹注到集注:面向中文古典文本注疏知识的上下文保留式组织

Ke Liang, Qi Su, Churen Huang

机构 * The Hong Kong Polytechnic University(香港理工大学) Peking University(北京大学)

AI总结 本文提出保留夹注上下文依赖的计算框架,将集注编纂化为NLP任务,在《山海经》案例中CoNLL F1超97%,为历史注疏知识大规模组织及下游任务奠定基础。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27690 2026-08-03 cs.RO cs.AI 版本更新

LabEvolver: Training-Free Experience Evolution for Safe and Grounded Wet-Lab Agents

LabEvolver:面向安全且务实的湿实验室智能体的无训练经验演化框架

Jingya Wang, Yuyang Gao, Liuzhenghao Lv, Yonghong Tian, Yuyang Liu

机构 * School of AI for Science, Peking University(北京大学AI科学学院) School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) School of Computer Science, Peking University(北京大学计算机学院)

AI总结 LabEvolver是无训练框架,通过内外部循环为湿实验室智能体配备情景记忆,在溶液制备任务中提升效率与安全性,在ALFWorld中也提升了连续任务成功率,支持闭环自动化科学发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19345 2026-08-03 cs.CL cs.AI 版本更新

Copy Less, Ground More: Overcoming Repetitive Copying in Long-Context Reasoning via Evidence-Aware Reinforcement Learning

少复制,多扎根:通过证据感知强化学习克服长上下文推理中的重复复制

Lizhe Fang, Weizhou Shen, Tianyi Tang, Yisen Wang

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团)

AI总结 研究长上下文推理中语言模型的重复复制问题,提出GEAR奖励塑造方法,通过区分关键证据和干扰上下文来增强奖励信号,经实验验证该方法能提升模型性能,减少重复复制,凸显准确扎根证据对长上下文推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00177 2026-08-03 cs.GR cs.CV 版本更新

FieryGS: In-the-Wild Fire Synthesis with Physics-Integrated Gaussian Splatting

FieryGS: 在真实世界中实现火灾合成的物理集成高斯点云方法

Qianfan Shen, Ningxiao Tao, Qiyu Dai, Tianle Chen, Minghan Qin, Yongjie Zhang, Mengyu Chu, Wenzheng Chen, Baoquan Chen

机构 * School of EECS, Peking University(电子工程系,北京大学) School of Intelligence Science and Technology, Peking University(智能科学与技术学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) ByteDance Seed(字节跳动种子) Wangxuan Institute of Computer Technology, Peking University(王璇计算机技术研究所,北京大学) Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院,北京,中国)

AI总结 FieryGS通过整合物理准确的燃烧模拟与渲染,实现真实世界3D场景中逼真的火灾合成,结合多模态大语言模型进行物理材料推理,提升火灾动态的可控性和真实性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09361 2026-08-03 cs.LG cs.AI 版本更新

GeoRA: Geometry-Aware Low-Rank Adaptation for RLVR

GeoRA: 为强化学习可验证奖励设计的几何感知低秩适应

Jiaying Zhang, Lei Shi, Jiguo Li, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He

机构 * Meituan(美团) Peking University(北京大学)

AI总结 GeoRA通过利用RLVR更新子空间的各向异性与压缩性结构,采用SVD提取主方向初始化低秩适配器,冻结残差部分作为结构锚点,从而在数学、医学和编程领域优于现有低秩基线,同时在跨领域任务中表现更佳。

Comments Accepted at ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19683 2026-08-03 cs.RO 版本更新

GPA-RAM: Grasp-Pretraining Augmented Robotic Attention Mamba for Spatial Task Learning

GPA-RAM:用于空间任务学习的抓取预训练增强型机器人注意力Mamba

Juyi Sheng, Yangjun Liu, Sheng Xu, Zhixin Yang, Tiantian Xu, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(国家一般人工智能重点实验室,北京大学深圳研究生院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(智慧城市物联网重点实验室,澳门大学)

AI总结 该研究提出GPA-RAM框架,通过GPA增强模仿策略并开发RAM实现高效计算,在多机器人平台的空间操纵任务中显著提升成功率,兼顾精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28595 2026-07-31 cs.CV 新提交

Beacon: Knowing When and How to Perform Agentic Visual Reasoning

Beacon:智能体何时及如何执行智能体视觉推理

Qixun Wang, Yang Shi, Letian Cheng, Zhuoran Zhang, Yan He, Yuqi Tang, Qi Zhang, Xinlei Yu, Ruizhe Chen, Tianrun Xu, Yuanxing Zhang, Pengfei Wan, Haotian Wang, Xianghua Ying

机构 * Peking University(北京大学) Kling Team(Kling团队) HKUST(GZ)(香港科技大学(广州)) CUHK(香港中文大学) ZJU(浙江大学) THU(清华大学)

AI总结 本研究针对现有智能体视觉推理模型模式适应性有限、工具增益被损害抵消的问题,提出Beacon模型,通过强化学习相关机制提升性能与适应性,在多基准上表现优异。

Comments 33 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28225 2026-07-31 cs.CV 新提交

FaithEyes: Towards Faithful Tool Use via Multi-Agent Process-Image Verification

FaithEyes:通过多智能体过程图像验证实现可信的工具使用

Haoqing Wang, Xingrun Xing, Wei Xia, Ziheng Li, Yehui Tang

机构 * Samsung Research(三星研究院) Peking University(北京大学)

AI总结 本研究提出多智能体框架FaithEyes,通过子智能体判断主智能体的工具调用以提升工具使用可信性,在视觉感知与推理基准上实现了更优准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28182 2026-07-31 cs.LG 新提交

Multi-channel Uplift Policy Learning

多渠道提升策略学习

Changjian Liu, Tianyu Wang, Xiaoxuan Deng, WenTao Zhu, Yuwei Xu, Jungqi Jin, Yong Gao, Chuan Yu, Jian Xu, Bo Zheng

机构 * Peking University(北京大学) Alibaba Group(阿里巴巴集团) Beihang University(北京航空航天大学) CUHK-shenzhen(香港中文大学(深圳))

AI总结 针对电商多渠道营销预算分配的预测后优化范式失效问题,提出快慢因果框架ReAlloc,经淘宝模拟与A/B测试验证可同时提升支付订单量和收入。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28109 2026-07-31 cs.AI 新提交

Beyond Rephrasing: Book-Level Organization Improves Synthetic Textbook Data for Mid-Training

超越改写:书籍级组织提升训练中合成教科书数据的质量

Jiawen Tao, Miao Peng, Yaoming Li, Xiaokun Yuan, Mengzhou Wu, Wenhan Yu, Guoan Wang, Nuo Chen, Tong Yang, Maxm Pan

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本研究提出可扩展的合成教科书数据流程,发现书籍级组织可提升语言模型训练中期的下游性能,在Llama3-8B上也验证了该设计维度的有效性。

Comments 31 pages, 3 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28022 2026-07-31 cs.LG cs.AI 新提交

Flux-OPD: On-Policy Distillation with Evolving Contexts

Flux-OPD:基于演化上下文的在线策略蒸馏

Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang, Yifan Dai, Yang Shi, Bozhou Li, Chengzhuo Tong, Daili Hua, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team(KLING团队) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院)

AI总结 该研究针对开放域大语言模型训练缺乏可验证奖励的问题,提出Flux-OPD范式,利用演化上下文作为监督,通过分解反向KL目标优化,在开放域任务上性能优于现有OPD范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27973 2026-07-31 cs.LG cs.AI 新提交

TAPO: Transition-Aware Policy Optimization for LLM Agents

TAPO:面向大语言模型智能体的过渡感知策略优化

Cong Li, Peixi Peng, Yisen Zhao, Xinyu Hu, Shudong Liu, Zhan Su, Zhuojian Li

机构 * School of Electronic and Computer Engineering, Peking University(北京大学电子与计算机工程学院) Pengcheng Laboratory(鹏城实验室)

AI总结 该研究提出TAPO框架,通过策略优化与过渡监督交替训练,增强LLM智能体对环境过渡的敏感性,作为轻量即插即用模块,在WebShop和ALFWorld实验中提升任务性能。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27699 2026-07-31 cs.CV cs.AI 新提交

RefineSVG: Visual Feedback-Driven Reinforcement Learning for Image-to-SVG Generation

RefineSVG:视觉反馈驱动的图像转SVG生成强化学习

Shaobo Liu, Feiqiao Mao, Shuaishuai Zhou, Yan Zhan, Weiqi Tan, Zhiqiong Lu, Zhengping Liang

机构 * Shenzhen University(深圳大学) Peking University(北京大学)

AI总结 RefineSVG是一种视觉反馈驱动的闭环框架,通过引入SVG语义词汇表和渐进式训练,使MLLM实现高保真图像转SVG生成,性能优于现有基线。

Comments 17 pages, 5 main-paper figures. Accepted at the 34th ACM International Conference on Multimedia (ACM MM 2026). Includes the complete supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27379 2026-07-31 cs.CL 新提交

HSS-Synth: Humanities and Social Sciences Data Synthesis for LLMs

HSS-Synth:面向大语言模型的人文社科数据合成

Ru Peng, Tianyu Zhao, Xijun Gu, Zhiting Fan, Haokai Xu, Jinyang Zhang, Yawen Zeng, Yihong Zhuang, Kexin Yang, Junyang Lin, Dayiheng Liu, Junbo Zhao

机构 * Zhejiang University(浙江大学) Inclusion AI, Ant Group(蚂蚁集团Inclusion AI) Peking University(北京大学) Qwen Team, Alibaba Group(阿里巴巴集团通义千问团队)

AI总结 本文针对LLM的HSS数据稀缺问题,提出以学科为中心的HSS-Synth流水线,生成23.7万指令微调样本,使Qwen3-8B-Base达SOTA并提升相关能力。

Comments ACL Findings 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27248 2026-07-31 cs.AI cs.LG 新提交

Divergence Decoding: Training-Free Capability Fusion

分歧解码:无训练的能力融合

Yimi Wang, Hao Li, Shuo Yang, He Cao, Dechen Zhang, Ziang Wu, Zhiyuan Yan, Fanyang Mo, Li Yuan

机构 * Peking University(北京大学) International Digital Economy Academy (IDEA)(国际数字经济学院) The University of Hong Kong(香港大学)

AI总结 针对通用大模型缺领域知识、专家模型逻辑弱的问题,提出无训练的Divergence Decoding框架,通过Jensen-Shannon散度自适应路由,在科学基准上融合两类模型能力,性能优于单模型基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03126 2026-07-31 cs.LG cs.AI 版本更新

ACPO: Asymmetric Credit Policy Optimization via Mode-Local Entropy Surrogate

ACPO:通过细粒度替代熵实现自适应信用策略优化

Zijun Xie, Yuyang You, Yongzhi Li, Enlei Gong, Quan Chen, Yanhua Cheng, Peng Jiang, Binbin Zheng, Xiaolong Liu, Zeyu Chen, Yadong Mu

机构 * Peking University(北京大学) Baidu Inc.(百度公司) Kuaishou Inc(快手公司)

AI总结 研究针对强化学习中稀疏奖励致令牌级信用分配难的问题,提出基于模式局部替代熵的ACPO框架,通过不对称调制策略更新改进信用分配,实验表明其优于多种强化学习基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27036 2026-07-30 cs.CV cs.LG 新提交

Mitigating Compounding Error via Video Representation Regularization

通过视频表示正则化缓解复合误差

Taiye Chen, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

AI总结 针对视频扩散世界模型自回归生成的复合误差问题,研究发现其与表示维度崩溃相关,提出视频表示正则化方法,在VBench指标上显著优于Diffusion Forcing,提升了长视频生成的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26595 2026-07-30 cs.CV 新提交

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

SpatialQ:基于视觉的多模态大语言模型(MLLM)理解3D Gaussian Splatting场景质量

Jingxuan Su, Shenglin Wang, Tiesong Zhao, Ge Li, Wei Gao

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Fuzhou University(福州大学)

AI总结 针对3DGS场景质量评估的局限,本文提出SpatialQ框架,通过VGGT编码器与Qwen-MLLM实现结构感知的多模态质量评估,解决传统IQA仅依赖2D线索的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26181 2026-07-30 cs.AI 新提交

GoGoTB: Agentic RTL Verification with Specification-Grounded Coverage Closure

GoGoTB:基于规范驱动覆盖闭合的智能体式RTL验证

Xin Xin, Jincheng Lou, Junhui Li, Jinglin Yan, Panda Xiao, Di Wu, Haixiao Li, Weicong Lu, Weijian Fan, Xinyu Qu, Yuxiang Zhao, Min Yu, Zhixiong Di, Yibo Lin

机构 * Tencent(腾讯) School of Integrated Circuits, Peking University(北京大学集成电路学院) Southwest Jiaotong University(西南交通大学) Institute of Electronic Design Automation, Peking University(北京大学电子设计自动化研究所) Beijing Advanced Innovation Center for Integrated Circuits(北京集成电路高精尖创新中心)

AI总结 GoGoTB是实现端到端验证闭合的智能体式RTL验证框架,在8个RTL设计上无需人工干预,实现100%环境生成成功率及多维度高覆盖率,优于现有方法。

Comments 9 pages, 7 figures, 3 tables. Xin Xin and Jincheng Lou contributed equally to this work and share first authorship

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11719 2026-07-30 cs.CV cs.AI 版本更新

Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning

Ouroboros-Spatial:闭环数据-模型循环的空间推理

Enhan Zhao, Wei Wu, Yuanrui Zhang, Xueliang Zhao, Di He

机构 * Peking University(北京大学) Ant International(蚂蚁国际) The University of Hong Kong(香港大学)

AI总结 提出Ouroboros-Spatial自演化框架,通过提议器与求解器闭环交互,动态生成与模型能力匹配的训练样本,在六个空间推理基准上以十分之一数据量显著提升Qwen3-VL性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06256 2026-07-30 cs.AI 版本更新

RedKnot: Efficient Long-Context LLM Serving with Head-Aware KV Reuse and SegPagedAttention

RedKnot: 基于头部感知的KV重用和SegPagedAttention的高效长上下文LLM服务

Yang Liu, Zhaokai Luo, Huayi Jin, Zhiyong Wang, Ruozhou He, Boyu Wang, Guanjie Chen, Tao Xie, Junhao Hu

机构 * Xiaohongshu Inc., China(小红书公司,中国) Peking University(北京大学) Huawei Cloud(华为云)

AI总结 提出RedKnot系统,通过按KV头分解缓存并采用SegPagedAttention,实现位置无关的KV重用、前缀压缩、冷热分离和分布式放置,在不重训练模型的情况下提升资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00537 2026-07-30 cs.RO 版本更新

PACE: Phase-Aware Chunk Execution for Robot Policies with Action Chunking

PACE: 面向动作分块策略的相位感知分块执行方法

Junnan Nie, Jiayi Li, Jiachen Zhang, Junyi Lao, Chenghao Liu, Tianle Zhang, Liang Lin, Songfang Huang

机构 * Peking University(北京大学) JD Explore Academy(京东探索研究院)

AI总结 提出PACE方法,通过在线预测动作分块中的低速过渡点作为重规划边界,自适应选择执行步长,无需重新训练即可提升机器人策略成功率。

Comments 21 pages, 7 figures, 6 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04641 2026-07-30 cs.CR cs.CL cs.LG 版本更新

DP-MGTD: Privacy-Preserving Machine-Generated Text Detection via Adaptive Differentially Private Entity Sanitization

DP-MGTD:通过自适应差分隐私实体净化实现隐私保护的机器生成文本检测

Lionel Z. Wang, Yusheng Zhao, Jiabin Luo, Xinfeng Li, Lixu Wang, Yinan Peng, Haoyang Li, XiaoFeng Wang, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Hengxin Tech(恒心科技)

AI总结 DP-MGTD通过自适应差分隐私实体净化技术,在保障隐私的前提下实现对机器生成文本的高精度检测。

Comments This article is unable to reproduce the experimental results, and we no longer have confidence in the main conclusion of this article

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26017 2026-07-29 cs.CL 新提交

UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams

UniMem:用于无边界任务流的互补情景到参数记忆

Siyu Xia, Chenheng Zhang, Yanting Wu, Haoxuan Li, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Zhouchen Lin, Haifeng Zhang, Jun Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Lab of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院) Meituan(美团) AI Centre, Department of Computer Science, University College London(伦敦大学学院计算机科学系人工智能中心)

AI总结 研究针对大语言模型在无边界任务流部署的稳定性 - 可塑性困境,提出UniMem自路由框架,用可学习路由令牌协调互补记忆路径,能按需扩展记忆,实验证明其在长周期流任务序列中优于基线并保持执行保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25765 2026-07-29 cs.CL cs.DB 新提交

WorkSurface-Bench: Benchmarking Enterprise Agents on Multi-Surface Knowledge Routing

WorkSurface-Bench:在多表面知识路由上对企业代理进行基准测试

Hao Liang, Meiyi Qiang, Sizhe Qiu, Linzhuang Sun, Wentao Zhang

机构 * Peking University(北京大学) Zhongguancun Academy(中关村科学城) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 针对企业代理整合异构知识源时表面路由能力评估不足的问题,提出WorkSurface-Bench基准测试,含多种任务且答案可审计,评估多个模型主干,揭示表面选择与任务完成关系及干预效果,并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25675 2026-07-29 cs.AI 新提交

DecoEvo: Score-Decoupled Co-Evolution of Solver and Rubric-Generator Skills in Text Space

DecoEvo:文本空间中求解器与评分标准生成器技能的分数解耦协同进化

Jiangwang Chen, Zixin Song, Junlin Liu, Shuaiyu Zhou, Haiyan Wu, Haihan Shi, Chenxi Zhou, Hanqing Li, Xiao Yang, Da Zhu, Guanjun Jiang, Hai Wan, Xibin Zhao

机构 * Tsinghua University(清华大学) Qwen Business Unit of Alibaba(阿里巴巴的通义业务部) University of Chinese Academy of Sciences(中国科学院大学) Peking University(北京大学)

AI总结 研究文本空间优化中现有方法瓶颈,提出DecoEvo方法,通过解耦目标协同进化求解器与评分标准生成器技能,不依赖黄金评分标准,在多基准和大语言模型主干上表现优异,有显著相对增益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25299 2026-07-29 cs.LG cs.AI 新提交

Retraction-Free Optimization over the Stiefel Manifold for the LoRA Fine-Tuning

用于LoRA微调的Stiefel流形上无回缩优化

Yuan Zhang, Jiang Hu, Zhijian Lai, Lin Lin, Zaiwen Wen

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Yau Mathematical Sciences Center, Tsinghua University(清华大学丘成桐数学科学中心) Beijing International Center for Mathematical Research, Peking University(北京大学北京国际数学研究中心) Department of Mathematics, University of California, Berkeley(美国加州大学伯克利分校数学系) Center for Machine Learning Research and Changsha Institute for Computing and Digital Economy, Peking University(北京大学机器学习研究中心和长沙计算与数字经济研究院)

AI总结 研究针对Stiefel流形优化中现有方法的问题,提出无回缩且无惩罚参数算法,利用相关特性建立收敛保证。将LoRA微调问题转为流形优化问题,引入Manifold-LoRA,经实验验证其在加速训练及下游性能方面的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25270 2026-07-29 cs.CL cs.AI cs.LG 新提交

Where Steering Signals Come From: Activation Source Selection in Activation Steering

转向信号来自何处:激活转向中的激活源选择

Jiaran Ye, Lingxu Ran, Zijun Yao, Chenpeng Wang, Yong Jiang, Lei Hou, Juanzi Li, Liangming Pan

机构 * Peking University(北京大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) YiXin-AILab(易信人工智能实验室)

AI总结 研究激活转向中转向信号的来源选择,通过实验表明改变源激活会影响转向成功率,有效转向信号来自执行边界状态,基于此提出尾部减法,揭示转向取决于模型即将做的事而非已出现的内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24889 2026-07-29 cs.LG cs.AI cs.CE 新提交

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

GAUGE:在没有标准答案的情况下对代理构建的金融模型进行评分

Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

AI总结 研究针对金融模型无标准答案的问题,引入GAUGE基准,依据分析师实际做法评估代理构建的估值模型,通过多种方式验证,揭示高级、初级分析师及学生在模型评分上的差异,指出当前代理在模型构建与估值判断上的强弱情况,并发布相关资源。

Comments 35 pages, including appendices. Code, benchmark materials, and evaluation artifacts will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏