Questions · Experiments · Evidence

Research

我想把医学图像里的证据变成更可靠、更节制的临床文本。 围绕这个目标,我也在研究小模型、表示效率,以及怎样让实验结论经得起复查。

Current Question

怎样让模型只根据可检查的证据生成医学报告,并在证据不足时知道应该少说什么?

这是我目前反复回到的问题。模型结构、训练目标和评测协议,最终都要回到这个边界上接受检验。

Focus Areas

三条正在交汇的研究线索

问题、当前关注与阶段性心得

01

Medical AI · Active

证据约束的医学报告生成

模型在写下一句医学描述前,能否明确自己依赖了哪些证据?

我关注的不只是报告是否流畅,而是每个临床结论能否回到图像、既往检查或结构化上下文。当前重点是把证据选择、临床概念与文本生成拆成可检查的接口。

生成系统最难的部分不是让文本更像一份报告,而是让它在证据不足时少说、谨慎说。
02

Efficient Models · Exploring

有限知识空间中的小模型

在边界清晰的专业任务里,小模型能否比更大的通用模型更稳、更可控?

比较参数规模之前,我更关心知识边界、表示压缩与推理预算。医学术语和报告结构相对受限,这让我持续思考:把专业空间组织好,也许比一味增加模型规模更重要。

效率不能只看参数量或 FLOPs,还要同时看可靠性、延迟、显存与部署成本。
03

Reproduction · Ongoing

可复现的模型与检索评测

怎样把论文里的方法主张,拆成可以运行、可以检查、也可以否证的最小实验?

最近的复现从 Transformer、LoRA、DPO 走到 RAG、Dense Retrieval 与 Reranker。我把代码跑通视为起点,更关心数据、负样本、候选召回上限和指标口径是否说得清楚。

一个小而透明的基线,往往比继续堆模块更早暴露真正的问题。

Recent Reproductions

最近完成的最小复现

全部研究写作 →
01ReadingReranker:Cross-Encoder 与 Hard Negative 最小复现开源 AI 论文复现实验与代码解读 · 检索系统常先从百万文档中召回几十到上千个候选,再用更精细的模型重排。Cross-Encoder(交叉编码器)把 query 与 passage 拼成一条序列,让两侧 token 在每一层直接交互;它通常比双塔打分更细,却必须为每个候…02ReadingDense Retrieval:DPR / Contriever 双塔检索最小复现开源 AI 论文复现实验与代码解读 · 稠密检索(dense retrieval)把查询和文档分别压缩为定长向量,再用点积或余弦相似度找最近邻。它真正值得复现的不是“调用一个 embedding API”,而是三个可检验环节:双塔如何产生向量,负样本如何塑造空间,离线索引…03ReadingRAG Baseline:BM25、Embedding、Rerank 与引用评测开源 AI 论文复现实验与代码解读 · 很多 RAG 演示把“上传文档后能回答”当作完成,但科研复现真正要回答四个不同问题:候选段落是否被检索到,排序是否把证据推到前面,生成内容是否逐条引用,以及引用是否真的支持相邻陈述。只看最终答案,很难知道改动影响的是哪一环。04ReadingDPO:数据格式、Loss 和“Reward-free”训练开源 AI 论文复现实验与代码解读 · DPO(Direct Preference Optimization,直接偏好优化)常被说成“不需要 reward model 的 RLHF”。这句话只对了一半:DPO 确实省去了单独拟合显式奖励模型和用 PPO 在线采样更新策略的…05ReadingLoRA / QLoRA:低秩更新、量化和显存预算开源 AI 论文复现实验与代码解读 · LoRA 和 QLoRA 常被概括成“省显存微调大模型”,但复现实验里真正容易出错的并不是口号,而是三笔账:哪些权重被冻结,低秩增量的形状是不是对的,4-bit 量化到底省的是基座权重、梯度还是优化器状态。本文的目标不是在本机复现…06ReadingAttention 可视化:热力图与解释边界开源 AI 论文复现实验与代码解读 · Attention 热力图很容易让人产生一种错觉:颜色越亮,那个 token 就“解释”了模型为什么这样预测。这个说法只对了一半。热力图确实展示了某一层、某个 head 在 softmax 后给不同 Key 位置分配的权重;但它通常…07Reading复现一个 Transformer Encoder:从论文公式到最小 PyTorch开源 AI 论文复现实验与代码解读 · 很多人第一次接触 Transformer,是从 nn.TransformerEncoderLayer、BERT 或 Hugging Face 模型开始的:几行代码就能得到输出,却不容易说清每一维张量为何这样变化,padding ma…