日程
统一管理您的计划安排,日历视图与计划列表一体化
今日焦点
暂无计划
周概览
所有计划
2026 年 4 月
23 项日历功能设计
已完成完成日历功能的PRD文档,包括产品需求、设计规范和UI组件设计
AI Agent研究
进行中研究AI Agent的最新进展和应用场景
日历组件开发
已完成实现月历视图,支持月份切换、日期点击显示详情
线性代数-Week1(向量几何)
待办书第1-3章:向量的几何意义、向量组。目标:理解向量就是空间中的箭头,运算都有几何对应
RLHF学习计划 - 第一阶段(第1-3天):RLHF概述与背景
待办Day 1: RLHF基本概念 - 什么是RLHF(Reinforcement Learning from Human Feedback) - RLHF解决了什么问题 - RLHF的发展历史与应用场景 Day 2: RLHF核心流程 - SFT(监督微调)→ Reward Model → PPO/GRPO - 整体pipeline详解 - 各阶段的作用与关系 Day 3: RLHF数学基础 - 强化学习基本概念回顾 - 策略梯度基础 - KL散度与约束优化
刷题计划 - 第一月:算法基础与数据结构
待办每日目标:至少2道算法题 + 1篇博客总结 刷题要求: - 必须独立思考,理解题目本质 - 每道题完成后写博客记录解题思路 - 博客要求:问题分析 → 思路推导 → 代码实现 → 复杂度分析 - 标注难点与收获,强制输出思考过程 本月重点: - 数组、链表、栈、队列基础 - 哈希表与集合 - 双指针与滑动窗口 - 递归与回溯入门 预期产出:约60题 + 30篇博客
开题报告
待办完成开题报告撰写与修改 - 研究背景与意义 - 文献综述 - 研究内容与目标 - 技术路线与方案 - 预期成果 - 时间安排
RLHF学习计划 - 第二阶段:MiniMind 入门 ⭐
待办Day 3: 环境搭建 + 跑通最简流程(26M 模型 Pretrain → SFT) Day 4: 全流程实验 Pretrain → SFT → LoRA → DPO Day 5: RLHF 强化学习 PPO/GRPO/CISPO Day 6: 高级特性 YaRN / Tool Calling / Adaptive Thinking 资源:https://github.com/jingyaogong/minimind
规划列表页面
待办实现规划列表展示页面,支持按状态分组
RLHF学习计划 - 第一阶段(第4-6天):SFT监督微调
待办Day 4: SFT基础理论 - 什么是SFT(Supervised Fine-Tuning) - SFT的数据准备与格式 - SFT的训练技巧 Day 5: SFT实战要点 - 数据质量的重要性 - 训练参数设置 - 常见问题与解决方案 Day 6: SFT进阶话题 - LoRA与全参数微调对比 - 多任务SFT - SFT与后续RL阶段的关系
RLHF学习计划 - 第一阶段(第7-9天):Reward Model奖励模型
待办Day 7: Reward Model基础 - 什么是Reward Model - Bradley-Terry模型 - 偏好数据的收集与处理 Day 8: Reward Model训练 - Reward Model的损失函数 - 训练技巧与注意事项 - Reward Model的质量评估 Day 9: Reward Model高级话题 - Reward Model的局限性 - Reward Hacking问题 - Process Reward Model vs Outcome Reward Model
RLHF学习计划 - 第三阶段:ms-swift 框架
待办Day 7-8: 环境搭建 + SFT + DPO/KTO 偏好学习 Day 9: GRPO 强化学习实战 Day 10: Megatron 并行 + 多模态支持 资源:https://github.com/modelscope/ms-swift
线性代数-Week2(向量空间与行列式)
待办书第4-5章:向量空间、行列式。目标:理解行列式是面积/体积的推广,行列式为零意味着什么
响应式设计适配
待办确保日历和列表在移动设备和桌面设备上都能良好显示
RLHF学习计划 - 第一阶段(第10-11天):四类模型角色详解
待办Day 10: Actor与Critic - Actor模型:生成策略与动作 - Critic模型:评估价值与优势 - Actor-Critic架构的工作原理 Day 11: Ref与Reward模型 - Ref模型:参考策略与KL约束 - Reward模型:奖励信号来源 - 四类角色的协同工作机制
RLHF学习计划 - 第四阶段:verl 深入
待办Day 11: verl 核心架构 Actor/Critic/Reward/Ref Day 12: GRPO + 多 GPU 扩展 Day 13: VLM + Agent 工具调用 资源:https://github.com/volcengine/verl
RLHF学习计划 - 第一阶段(第12-14天):PPO算法
待办Day 12: PPO基础 - 什么是PPO(Proximal Policy Optimization) - PPO的核心思想:限制策略更新幅度 - PPO-Clip目标函数 Day 13: PPO深入 - PPO的理论保证 - 重要性采样与GAE(广义优势估计) - PPO的超参数调优 Day 14: PPO在RLHF中的应用 - PPO的训练流程 - Reward与KL penalty的平衡 - PPO的优缺点分析
动画效果优化
待办实现折纸式展开、3D翻页、悬停光晕等动画效果
RLHF学习计划 - 第五阶段:OpenRLHF
待办Day 14: OpenRLHF 架构解析 Ray + vLLM Day 15: 高级特性 Packing / Dynamic Filtering / 调参 Day 16: 多节点集群部署 资源:https://github.com/openrlhf/openrlhf
线性代数-Week3(矩阵与线性方程组)
待办书第6-7章:矩阵、线性方程组。目标:理解矩阵变换是空间的拉伸旋转,方程组求解的几何本质
RLHF学习计划 - 第一阶段(第15-17天):GRPO算法
待办Day 15: GRPO基础 - 什么是GRPO(Group Relative Policy Optimization) - GRPO vs PPO的核心区别 - GRPO的样本效率优势 Day 16: GRPO深入 - GRPO的数学推导 - Group Sampling策略 - GRPO的超参数设置 Day 17: GRPO实战 - GRPO在LLM中的应用 - GRPO的代码实现要点 - GRPO vs PPO的实际对比
RLHF学习计划 - 第六阶段:实战项目
待办方向A:推理强化 Math / Coding(AIME / MATH-500 / HumanEval) 方向B:多模态 / VLM(MiniMind-V / Qwen2.5-vl) 方向C:Agent / Tool Calling 方向D:大规模分布式训练
RLHF学习计划 - 第一阶段(第18-19天):DAPO算法
待办Day 18: DAPO基础 - 什么是DAPO(Decoupled Clip and Dynamic Sampling Policy Optimization) - DAPO的核心改进点 - Decoupled Clipping机制 Day 19: DAPO深入 - Dynamic Sampling策略 - DAPO的实验结果与分析 - DAPO vs PPO/GRPO对比
2026 年 5 月
10 项Hexo博客重构
待办重构Hexo博客,优化主题设计和部署流程
RLHF学习计划 - 第一阶段(第20-21天):CISPO算法
待办Day 20: CISPO基础 - 什么是CISPO(Conditional Imitation Supervised Policy Optimization) - CISPO的设计理念 - CISPO的核心机制 Day 21: CISPO深入与对比 - CISPO的理论分析 - CISPO的适用场景 - CISPO vs 其他算法的对比
线性代数-Week4(二次型收尾)
待办书第8章+全书整理。目标:串联各章概念,形成整体几何图景
RLHF学习计划 - 第一阶段(第22-24天):算法对比与总结
待办Day 22: PPO vs GRPO - 算法原理对比 - 样本效率对比 - 训练稳定性对比 - 适用场景分析 Day 23: DAPO vs CISPO - 创新点对比 - 实验效果对比 - 工程实现复杂度 - 实际应用建议 Day 24: 完整总结 - 四类算法的优缺点总结 - 如何选择合适的算法 - RLHF的最佳实践 - 未来发展方向
RLHF学习计划 - 第一阶段(第25-27天):实战准备
待办Day 25: 环境搭建与工具准备 - 常用RLHF框架介绍 - 环境配置要点 - 实验设计规划 Day 26: 小规模实验设计 - 1B以下模型实验 - 数据集选择 - 评估指标设计 Day 27: 实验复现与改进 - 复现经典论文结果 - 分析常见问题 - 改进方向探索
RLHF学习计划 - 第一阶段(第28-30天):项目实战与总结
待办Day 28: 项目实战(一) - 选择合适的任务场景 - 完整pipeline实现 - 中期检查与调整 Day 29: 项目实战(二) - 训练优化与调参 - 结果评估与分析 - 问题诊断与解决 Day 30: 阶段总结 - 理论知识回顾 - 实践经验总结 - 下一阶段规划 - 推荐学习资源汇总
线性代数-Week5(视频1-9)
待办3Blue1Brown视频第1-9集:向量→矩阵→行列式。用动画加固前面书本学到的概念
刷题计划 - 第二月:算法进阶
待办每日目标:至少2道算法题 + 1篇博客总结 刷题要求: - 继续独立思考,理解题目本质 - 每道题完成后写博客记录解题思路 - 博客要求:问题分析 → 思路推导 → 代码实现 → 复杂度分析 - 标注难点与收获,强制输出思考过程 本月重点: - 树结构(二叉树、N叉树) - 图论基础(DFS/BFS) - 动态规划入门到进阶 - 贪心算法 预期产出:约62题 + 31篇博客
线性代数-Week6(视频10-16)
待办3Blue1Brown视频第10-16集:特征值→抽象向量空间。攻克最深最难的部分
线性代数-Week7(Gemini讨论+笔记整理)
待办把疑惑点抛给Gemini讨论,整理7周笔记,形成自己的线性代数几何理解体系
2026 年 6 月
2 项个人网站SEO优化
待办优化个人网站的SEO,提高搜索引擎排名
刷题计划 - 第三月:综合提升与专项突破
待办每日目标:至少2道算法题 + 1篇博客总结 刷题要求: - 继续独立思考,理解题目本质 - 每道题完成后写博客记录解题思路 - 博客要求:问题分析 → 思路推导 → 代码实现 → 复杂度分析 - 标注难点与收获,强制输出思考过程 本月重点: - 高级数据结构(并查集、线段树、Trie) - 动态规划专项突破 - 图论进阶(最短路、最小生成树) - 综合模拟题训练 预期产出:约60题 + 30篇博客