___ __ ____ ___ ____ / _ \(_ ) (_ _)/ __)( _ \ ( (_) )/ /_ _)(_ \__ \ )___/ \___/(____)(____)(___/(__)
Steve Chan
Clojure / Emacs / Python — Lisp hacker
About
My name is Steve Chan and I'm a Clojure / Emacs / Python Lisp hacker. I currently focus on Machine Learning and Deep Learning, with special interest in Reinforcement Learning and Large Language Models.
Projects
-
hulunote/hulunoteA note-taking system for thinkers and hackers — capture, link, and grow your knowledge graph.
-
hackerlibs/code-hackerA toolbox of hacker-grade utilities and experiments for code wranglers.
-
xlisp/CodeChatChat with your codebase — pair-program with LLMs over real source trees.
Writing
- 2026-08-20 随机性不是噪声,是搜索工具:从 GPT 的高维搜索到物理世界的状态空间
- 2026-08-20 为什么 AI、数学顶尖人才都绕不开数学分析?答案藏在微分方程里!
- 2026-08-20 为什么 AI、数学顶尖人才都绕不开高阶函数?答案藏在 λ 演算里!
- 2026-08-20 老师逼你"写出过程",原来是大模型学会推理的全部秘密
- 2026-08-20 小学一年级学的"数位对齐",原来是大模型至今算不明白数的根本原因
- 2026-08-20 老师最痛恨的"抄作业",原来是小模型追上大模型的唯一办法
- 2026-08-18 随机性不是噪声,是搜索工具:玻尔兹曼、GPT 和统计学家说的是同一件事
- 2026-08-07 建模:把数学当工具用 —— 从托勒密的本轮到 GPT 的权重,一条四千年没断过的线
- 2026-08-06 从玻尔兹曼到辛顿: 从 \(S = k \log W\) 到 gpt.py:145 的一条线
- 2026-08-06 程序 → 公式:把你已经会的 for 循环,翻译成 \(\Sigma\) —— 程序员逆袭数学的诚意手册
- 2026-08-06 英语考试的完形填空,就是大模型Tab写代码的全部方法
- 2026-08-05 菲尔兹奖照出中国教育最大的短板:为什么两位数学天才,都去了欧美?
- 2026-08-05 从"保护天才"到"滋养创新":邓煜、王虹的成长路径带来的一点思考
- 2026-08-04 为什么语言规律可以被学习:从梵语到 CodeChat 的 8B 权重
- 2026-08-01 把磁场掰斜一点点,你的位置就变成了一个角度
- 2026-07-31 为什么AI,物理学家顶尖的人才总是出现在欧美?原因出现在这!
- 2026-07-31 为什么 AI、数学、物理的底层理论,总是诞生在欧美?原因出现在这!
- 2026-07-31 为什么 AI 论文全是天书?因为每一个数学符号,其实都是一句人话
- 2026-07-30 大学4年没讲明白的神经网络数学,被一段 PyTorch 代码讲透了
- 2026-07-30 95% 的 LangGraph 教程,都没告诉你它真正解决了什么
- 2026-07-30 AI圈突然都在聊 Loop、Graph Engineering,炒作还是新东西?
- 2026-07-27 医院那台核磁共振,和大模型的位置编码、多模态,是同一件事
- 2026-07-23 训练写权重,推理用权重 + 脚手架:SFT / RL 训完之后到底是怎么生效的
- 2026-07-22 Mask、三角矩阵与因果掩码:历史、起源与原理
- 2026-07-17 Claude 的暗黑科技:把垃圾代码炼成黄金训练数据
- 2026-07-13 为什么AI,数学家顶尖的人才总是出现在欧美?原因出现在这!
- 2026-07-09 ChatGPT 会推理的秘密,藏在一款游戏身上
- 2026-07-09 训一条狗,和训出会"思考"的 DeepSeek,用的是同一套办法
- 2026-07-08 为什么大模型能堆到几十层还训得动?答案藏在一个最不起眼的动作里
- 2026-07-07 高中觉得最没用的"虚数 i",其实是大模型旋转位置编码最优雅的写法
- 2026-07-05 高中觉得最没用的 log,其实是大模型判断"自己错得有多离谱"的唯一标尺
- 2026-07-05 高中觉得只是"带箭头的线段"的向量,其实是大模型把"意思"变成"方向"的地基
- 2026-07-05 高中背到头秃的排列组合,其实解释了大模型为什么"不可能靠背、只能靠学"
- 2026-07-05 高中觉得最玄乎的"极限",其实是大模型"从犹豫到笃定"的那个旋钮
- 2026-07-05 高中最容易被忽略的数学归纳法,其实就是大模型"逐字生成"的骨架
- 2026-07-03 高中背了三年的数列,原来是 GPT 一个字一个字蹦出来的秘密
- 2026-07-01 大学4年没讲明白的信息论,被一段 PyTorch 代码讲透了
- 2026-07-01 高中背了三年的 sin 和 cos,原来是大模型记住"谁先谁后"的秘密
- 2026-06-28 Mythos、Fable 5 的背后,其实是一条 70 年没人讲透的 AI 主线
- 2026-06-27 大学4年没讲明白的概率论,被一段 PyTorch 代码讲透了
- 2026-06-25 高中老师说"买菜用得上求根公式吗"——可这条公式,是整个大模型的祖宗
- 2026-06-23 大学4年没讲明白的线性代数,被一段 PyTorch 代码讲透了
- 2026-06-21 用最小作用原理写一个 MCP:模型的那双手,该怎么造
- 2026-06-20 把提示词当代码写:Prompt Engineering 的第一性原理
- 2026-06-17 从 CoT 到 ReAct,再到"会自己思考"的模型
- 2026-06-15 AI 最大的缺陷不是智商,而是失忆:我们做了一个 AI 的海马体
- 2026-05-21 Harness 即一切:模型不是不够聪明,而是是否有足够有用的tools
- 2026-05-13 万能函数模拟器:大模型就是用微积分从数据里"积分"出来的函数 P
- 2026-05-06 从代码语义搜索到 GPT 写代码:五代范式、三次质变与一条贯穿始终的"搜索维度提升"主线
- 2026-05-06 GPT 是更高级的"万能谷歌搜索":从关键词到高维空间的搜索进化史
- 2026-05-06 EDA、符号主义与 LLM 的交汇
- 2026-05-06 Why You Not Student?
- 2026-05-04 概率就是面积,矩阵就是映射:大模型最底层的两块拼图
- 2026-04-28 深度学习是可微分编程:从 y = wx + b 讲到 CodeGPT
- 2026-04-26 物理学的影子:量子力学与统计力学如何塑造了深度学习
- 2026-04-25 同一个 Transformer,吃掉一切:为什么语音、图像、自动驾驶、大模型都在用它
- 2026-04-25 从图像视角理解 Transformer
- 2026-04-20 RAG 还是 SFT:面对一堆私有数据,该怎么选?
- 2026-04-20 Transformer Debugger:把大模型从黑盒拆成白盒
- 2026-04-19 多次 SFT 的灾难性遗忘:SFT 的本质、MoE 的本质、以及它们各自解决什么问题
- 2026-04-16 混合 SFT vs MoE:同一思路吗?
- 2026-04-14 从单卡到多卡:分布式训练原理与 FSDP 实战
- 2026-04-11 GRPO on SWE-bench Train: Docker-in-the-Loop RL
- 2026-04-08 CodeChat RL 算法选型
- 2026-04-02 LLM 训练技术详解:从 SFT 到 GRPO
- 2026-03-12 压缩即智能:从自编码器到 GPT 的认知哲学
- 2026-03-12 从 RNN 到 CodeGPT:序列建模的进化史
- 2026-03-12 强化学习对齐与柏拉图表征:ChatGPT 成功的另外两块拼图