Writing · Build · Read · Think

记录值得研究、
也值得做出来的东西。

记录技术阅读、动手实践和软件产品中的心得。

Now · 2026.09

最近正在发生什么

Reading

模型可解释性、校准与评测方法

Writing

最小实验、统计报告与运行记录

Building

PairQuest 双人非对称协作谜题

Inside the garden

从 123 篇记录进入三条主线

首页先给出地图;完整正文、配图与时间归档都在 Writing 中。

Latest

最近写下的

全部文章 · 123
01Reading论文结果报告模板:让每个数字都能回到实验日志开源 AI 论文复现实验与代码解读 · “平均提升两个点”并不是完整的实验结论。两个点来自哪些运行?是否使用同一测试集?误差线表示种子间波动,还是均值的不确定性?失败的运行有没有被悄悄删掉?本文围绕一个可执行目标组织报告:给定保存的实验日志,自动生成有明确统计含义的表格,…02ReadingAdversarial Robustness:攻击没成功,模型就鲁棒吗?开源 AI 论文复现实验与代码解读 · 给输入加一点噪声,模型仍然答对,不足以说明它能抵抗有目的的扰动。更隐蔽的错误是:攻击程序步数太少、梯度断开或预算单位错了,却把攻击失败当作模型成功。本文训练一个可解析的分类器,把随机搜索、单步梯度和多步攻击逐条对照最坏情况解。目标是…03ReadingCalibration:ECE 降低后,拒答阈值就可靠吗?开源 AI 论文复现实验与代码解读 · 模型给出九成把握,究竟表示什么?置信度校准讨论的是:在许多相似分数的预测中,实际正确比例是否接近这个分数。它不承诺某一道题一定正确,也不等于模型知道自己为什么错。本文从两篇论文和作者代码出发,用一个冻结的解析打分器验证温度缩放,再将…04ReadingProbing:线性探针读到了什么,模型就用到了什么吗?开源 AI 论文复现实验与代码解读 · 从隐藏层预测某个属性,准确率接近满分,能否说明模型靠它完成任务?本文阅读控制任务论文与官方代码,在冻结的小网络上训练线性探针,并把探针分数与模型行为分开验证。实验目标是复现测量协议和一个可检查的反例:表示中的信息可被读出,并不自动说…05ReadingActivation Patching:恢复答案之后,能否说找到了机制?开源 AI 论文复现实验与代码解读 · 模型的一层被替换后,错误答案恢复了,能否据此宣布找到了“知识存储位置”?本文从激活替换的三次前向计算出发,阅读 ROME 与 TransformerLens 官方代码,训练一个四百零二参数的小网络,实际检查替换方向、整层控制、组合效…06ReadingGNN + LLM:找对答案节点,为什么仍然缺少推理证据?开源 AI 论文复现实验与代码解读 · 把知识图谱接到大语言模型之前,先问一个小问题:检索到了答案实体,是否也保留了支持答案的路径?本文阅读 G-Retriever 官方实现,再训练一个十参数的图神经网络,比较完整结构、反向边和不同证据裁剪方法。三个种子的实际结果显示,答…

Selected Build · iOS

PairQuest

一个谜题,两块屏幕。你们各自只有一半信息,必须真正开口协作。

Stage
External TestFlight
Built with
SwiftUI · GameKit
Content
30 个免费谜题
阅读产品取舍与开发心得 →
PairQuest 首页:两个拼图角色和双人教学入口