LLM Personalization:个性化对齐的方法、评测与风险

本文为个人技术笔记,整理自对近三年(2023.7–2026.7)LLM/Agent Personalization(个性化)相关论文的调研。主要参考两篇核心综述——A Survey on Personalized Alignment(Guan et al.)与 A Survey on Personalized and Pluralistic Preference Alignment in LLMs(Xie et al.)——及论文列表仓库 liyongqi2002/Awesome-Personalized-Alignment,以及文中列出的原始论文,具体出处见文末 References。 ...

七月 30, 2026 · 29 分钟 · 14378 字 · Mi Yan

Self-Evolving Agents:当 Agent 学会改进自己

本文为个人技术笔记,整理自对 2022–2026 年 Agent Self-Evolve(自进化智能体)相关论文的调研。主要参考两篇核心综述——A Survey of Self-Evolving Agents(Gao et al.)与 A Comprehensive Survey of Self-Evolving AI Agents(Fang et al.)——及其配套仓库 CharlesQ9/Self-Evolving-Agents、EvoAgentX/Awesome-Self-Evolving-Agents,以及文中列出的原始论文,具体出处见文末 References。 ...

七月 28, 2026 · 25 分钟 · 12234 字 · Mi Yan

Long-Horizon Agents: Harness, Learning, and Trust

本文为个人技术笔记,主要整理自 RUC-NLPIR/Awesome-Long-Horizon-Agents 及其对应综述论文 Towards Long-Horizon Agents: A Survey。文中涉及论文均尽量附原文链接,具体出处见文末 References。部分公式为对方法机制的抽象化表达,会在文中显式说明;若需引用具体方法细节,请以原始论文为准。 ...

七月 24, 2026 · 33 分钟 · 16468 字 · Mi Yan

Rubric:大语言模型评估范式的结构化转向

本文为个人技术笔记,整理自对近两年(2024–2026)Rubric-based Evaluation(基于评分细则的评估方法)相关论文的调研。主要参考 RUC-NLPIR/Rubrics_Survey(《The Rules of the Game: A Survey of Rubrics for Large Language Models》)及文中列出的原始论文,具体出处见文末 References。 ...

七月 23, 2026 · 17 分钟 · 8435 字 · Mi Yan

On-Policy Distillation: 重塑大模型后训练的新范式

本文综合了 Thinking Machines Lab 的 On-Policy Distillation 博客 与 OPD 前沿技术综述的内容,系统梳理同策略蒸馏(OPD)的核心原理、工业实践与最新算法进展。 大语言模型的能力并非一蹴而就——它们通常经历三个训练阶段:预训练(Pre-training) 教会模型语言理解与世界知识;中间训练(Mid-training) 注入领域知识;后训练(Post-training) 引导出指令遵循、数学推理或对话等目标行为。后训练是将基础模型变成有用工具的关键一步,而同策略蒸馏(On-Policy Distillation, OPD)正在以更高的样本效率和更密集的监督信号,重新定义这一阶段的范式。 ...

七月 3, 2026 · 15 分钟 · 7479 字 · Mi Yan

Diffusion Model for Video Generation

全文为Weng, Lilian. (Apr 2024). Diffusion Models Video Generation. Lil’Log.的中文翻译版本。 在过去几年里,扩散模型在图像合成方面显示出了优异的效果。现在,研究界已经开始着手一项更加艰巨的任务——将扩散模型用于视频生成。该任务可以看作是图像生成的超集,因为图像可以认为是1帧的视频,但是图像生成更加具有挑战性,原因如下: ...

二月 17, 2025 · 16 分钟 · 7783 字 · Mi Yan

What are Diffusion Models?

Update [2024.12.7]:增加条件生成以及潜在扩散模型的介绍。 Update [2024.12.11]:增加评估指标的对比以及超参数调整。 Update [2024.12.12]:增加对于扩散模型个性化生成微调方法的介绍 生成模型 目前主流的生成模型包括生成对抗模型 (GAN)、变分自编码器 (VAE)和基于流的模型 (Flow-based models)。 ...

十二月 7, 2024 · 20 分钟 · 9616 字 · Mi Yan