Read · Explain · Connect

Writing

关于人工智能、语言模型与软件工程的长期写作。 这里收录论文阅读、研究方法、系统实践,以及在项目中反复验证过的工程笔记。

01 · Research · Papers · Methods

66

AI 研究与阅读

02 · LLM · Systems · Agents

31

LLM 工程指南

03 · Java · JVM · Concurrency

4

Java 工程

Research · Papers · Methods

AI 研究与阅读

66 篇 · 论文精读、研究路线与方法复盘

01ReadingReranker:Cross-Encoder 与 Hard Negative 最小复现开源 AI 论文复现实验与代码解读 · 检索系统常先从百万文档中召回几十到上千个候选,再用更精细的模型重排。Cross-Encoder(交叉编码器)把 query 与 passage 拼成一条序列,让两侧 token 在每一层直接交互;它通常比双塔打分更细,却必须为每个候…02ReadingDense Retrieval:DPR / Contriever 双塔检索最小复现开源 AI 论文复现实验与代码解读 · 稠密检索(dense retrieval)把查询和文档分别压缩为定长向量,再用点积或余弦相似度找最近邻。它真正值得复现的不是“调用一个 embedding API”,而是三个可检验环节:双塔如何产生向量,负样本如何塑造空间,离线索引…03ReadingRAG Baseline:BM25、Embedding、Rerank 与引用评测开源 AI 论文复现实验与代码解读 · 很多 RAG 演示把“上传文档后能回答”当作完成,但科研复现真正要回答四个不同问题:候选段落是否被检索到,排序是否把证据推到前面,生成内容是否逐条引用,以及引用是否真的支持相邻陈述。只看最终答案,很难知道改动影响的是哪一环。04ReadingDPO:数据格式、Loss 和“Reward-free”训练开源 AI 论文复现实验与代码解读 · DPO(Direct Preference Optimization,直接偏好优化)常被说成“不需要 reward model 的 RLHF”。这句话只对了一半:DPO 确实省去了单独拟合显式奖励模型和用 PPO 在线采样更新策略的…05ReadingLoRA / QLoRA:低秩更新、量化和显存预算开源 AI 论文复现实验与代码解读 · LoRA 和 QLoRA 常被概括成“省显存微调大模型”,但复现实验里真正容易出错的并不是口号,而是三笔账:哪些权重被冻结,低秩增量的形状是不是对的,4-bit 量化到底省的是基座权重、梯度还是优化器状态。本文的目标不是在本机复现…06ReadingAttention 可视化:热力图与解释边界开源 AI 论文复现实验与代码解读 · Attention 热力图很容易让人产生一种错觉:颜色越亮,那个 token 就“解释”了模型为什么这样预测。这个说法只对了一半。热力图确实展示了某一层、某个 head 在 softmax 后给不同 Key 位置分配的权重;但它通常…07Reading复现一个 Transformer Encoder:从论文公式到最小 PyTorch开源 AI 论文复现实验与代码解读 · 很多人第一次接触 Transformer,是从 nn.TransformerEncoderLayer、BERT 或 Hugging Face 模型开始的:几行代码就能得到输出,却不容易说清每一维张量为何这样变化,padding ma…08Reading一个月 AI 论文训练营总结:如何建立长期科研阅读系统AI 论文阅读路线 · 一个月的论文精读训练不能只留下 30 篇博客。真正有价值的结果,是建立一套能持续运转的科研阅读系统:知道如何发现论文、判断是否值得读、拆解方法与实验、做可复现记录、提炼负结果和 follow-up idea,并把这些材料沉淀成 pr…09Reading如何从 10 篇论文形成一个研究 Proposal:问题、假设、方法和实验计划AI 论文阅读路线 · 很多研究生读完十篇论文后,得到的不是一个研究 proposal,而是一份更长的 related work:谁做了什么、用了什么模型、在哪些 benchmark 上更好。问题在于,proposal 不是文献综述的自然延长线。它需要把论…10Reading顶会论文 Rebuttal 与 Peer Review 怎么读:从审稿意见反推研究质量AI 论文阅读路线 · 很多人读 OpenReview 只看最终决定、分数和一句 meta-review,然后把结论简化成“这篇被接收,所以质量高”或“这篇被拒,所以不值得读”。这种读法浪费了顶会开放评审系统里最有价值的训练材料:审稿人指出了哪些核心问题?…11Reading开源模型技术报告怎么读:模型卡、训练数据、评测和限制说明AI 论文阅读路线 · 开源模型技术报告不是普通论文,也不是下载说明。它通常把模型卡、训练配方、数据说明、评测表、许可证、安全说明和部署建议放在一起。读这类报告的关键,不是看“模型排第几”,而是判断:它到底开放了什么?哪些证据足以支持复现?哪些结论只适用于…12ReadingEfficient Inference 论文精读路线:KV Cache、Speculative Decoding、Quantization 和 ServingAI 论文阅读路线 · Efficient Inference 研究的核心不是“让模型跑得快一点”,而是理解自回归生成的成本结构:prefill 阶段通常更像大矩阵计算,decode 阶段则被 KV cache 读写、显存带宽、调度和 batch 形态限制…13ReadingEfficient Training 论文精读路线:LoRA、QLoRA、MoE、Checkpointing 和 OptimizerAI 论文阅读路线 · Efficient Training 不是“把训练做便宜”的工程细节,而是大模型研究里的资源分配问题:同样 token budget、同样硬件和同样评测下,显存、通信、重计算、数值稳定性和最终能力如何交换?LoRA/QLoRA 让大…14ReadingData-Centric AI 论文精读路线:数据筛选、去重、合成和质量评估AI 论文阅读路线 · Data-Centric AI 的核心问题不是“数据越多越好”,而是:什么数据在什么训练阶段、什么模型规模、什么评测目标下真正有用?对 LLM 研究来说,这个问题已经从经验工程变成可以读论文、做 ablation、写复现报告的研究主…15ReadingEvaluation 论文精读路线:Open-ended Eval、Human Eval、LLM-as-Judge 和 ContaminationAI 论文阅读路线 · LLM Evaluation 论文最容易被读成“谁在榜单上更高”。但科研训练真正要学习的是:一个 benchmark 为什么能代表能力,开放式回答如何被评分,人类偏好和专家标注如何进入证据链,LLM-as-a-judge 的误差如何…16ReadingSafety / Alignment 论文精读路线:红队、拒答、偏好对齐和可控生成AI 论文阅读路线 · Safety / Alignment 论文很容易被读成“模型应该怎样回答”的规范讨论,但科研训练真正要抓住的是:威胁如何被发现,安全边界如何定义,偏好数据如何进入训练目标,拒答与过拒答如何同时评估,以及模型能否在不越界的前提下保持有…17ReadingInterpretability 论文精读路线:representation、circuits、probing 和 causal interventionAI 论文阅读路线 · Interpretability,尤其是 mechanistic interpretability,已经从“给模型输出配一张热力图”逐渐变成一套围绕内部表示、因果干预和可复现实验组织起来的研究方法。读这条线不能只问“这个神经元是什么…18ReadingAI for Science 论文精读路线:分子、蛋白、材料与自动实验AI 论文阅读路线 · AI for Science 不是一个单点模型方向,而是一组围绕科学对象、物理约束和实验验证组织起来的方法族。分子方向关心 SMILES、分子图、3D 构象和蛋白口袋;蛋白方向关心序列、结构、功能和湿实验筛选;材料方向关心晶体结构、…19ReadingVision-Language-Action 论文精读路线:从 Embodied Agents 到 Robotics Foundation ModelsAI 论文阅读路线 · Vision-Language-Action(VLA)模型把视觉观测、语言任务和机器人动作放进同一个学习框架里,是具身智能近两年最密集的论文线之一。它看起来像“多模态 LLM 加一个动作头”,但真正难读的地方不在模型名字,而在五个细…20ReadingMultimodal LLM 论文精读路线:视觉编码器、对齐数据和多模态推理AI 论文阅读路线 · 多模态 LLM 的论文很容易读成“模型名盘点”:CLIP、Flamingo、BLIP-2、LLaVA、Qwen-VL、InternVL、Molmo、Gemini、GPT-4o、Llama Vision……每篇都在说模型更强、数据更多…21ReadingTool-Using LLM 论文精读路线:从 ReAct 到可验证工具调用AI 论文阅读路线 · Tool-Using LLM 的核心问题不是“让模型多一个插件”,而是让模型在不确定任务中选择合适动作、给出合法参数、读取执行反馈、修正计划,并在最后留下可审计的证据。过去几年路线大致从 ReAct 的 reason-act-obs…22ReadingReasoning Models 论文精读路线:CoT、Self-Consistency、Process Supervision 与 SearchAI 论文阅读路线 · Reasoning Models 不是“让模型多输出几行思考过程”这么简单。过去几年的路线大致经历了五个阶段:Chain-of-Thought 让中间步骤显式化;Self-Consistency 把一次解题改成多路径采样与答案聚合;…23ReadingRetrieval-Augmented Learning 论文精读路线:从 RAG 到 Memory-Augmented ModelsAI 论文阅读路线 · Retrieval-Augmented Learning 不是简单地“给 LLM 接一个向量库”。从 REALM、RAG、RETRO、Atlas 到 Self-RAG、Adaptive-RAG、GraphRAG、Agentic RA…24ReadingRLHF / Preference Optimization 论文精读路线:奖励模型、DPO、GRPO 与偏好数据AI 论文阅读路线 · RLHF / Preference Optimization 是现代 LLM 后训练里最容易被“公式名词”淹没的方向:PPO、reward model、DPO、KTO、ORPO、SimPO、GRPO、DAPO 看起来像一串算法清单,…25ReadingInstruction Tuning 论文精读路线:从 Supervised Fine-Tuning 到 Instruction FollowingAI 论文阅读路线 · Instruction Tuning 最容易被一句话讲错:它不只是“拿问答数据再训一下模型”,也不等于完整的 RLHF、DPO 或 GRPO。更准确地说,它是一类把预训练语言模型从“预测下一个 token”拉向“理解自然语言任务描述…26ReadingScaling Laws 论文精读路线:参数、数据、算力和 Emergent BehaviorAI 论文阅读路线 · Scaling Laws 不是一句“模型越大越好”,而是一套用小规模实验预测大规模行为的研究方法。Kaplan 等人在 2020 年把语言模型 loss 与参数量、数据量、训练计算量之间的幂律关系系统化;DeepMind 的 Chi…27ReadingTransformer 论文精读路线:从 Attention 到现代 LLM 架构AI 论文阅读路线 · Transformer 不是一篇读完就结束的论文,而是一条持续扩展的架构谱系。2017 年的 Attention Is All You Need 给出了“用注意力替代循环和卷积”的核心范式;BERT、T5、GPT-3 把它分别推向表…28Reading如何设计一个小而可靠的 Follow-up Idea:从论文局限到可执行选题论文精读与复现 · 很多研究生读完一篇好论文后,会停在两个极端:要么觉得作者已经把问题做完了,自己只能复述;要么受到启发,马上想做一个很大的系统,把数据、模型、训练目标、评测和应用场景都改一遍。前者没有形成问题,后者很难执行。真正适合作为科研训练的 f…29Reading如何做 Ablation Study:控制变量、负结果和机制解释论文精读与复现 · Ablation study 常被翻译成“消融实验”,但很多论文里的消融其实只是“把模块拿掉,看分数掉不掉”。这种做法能补一张表,却不一定能回答科学问题。真正有价值的消融,是把论文里的核心主张拆成可证伪假设:如果某个模块、训练目标、…30Reading如何写论文复现笔记:从 Reproduction Report 到博客草稿论文精读与复现 · 很多论文复现失败,并不是因为实验本身没有价值,而是因为记录方式太像“个人流水账”:今天装了环境,明天改了 bug,后天跑出一个分数,最后写一句“没有复现成功”。这样的笔记对自己有短期帮助,却很难让导师、同学或后来读者判断:你复现的是…31Reading如何复现一篇 LLM 论文:环境、数据、权重、seed 和日志论文精读与复现 · 复现一篇 LLM 论文,最容易犯的错误是从 pip install 和 bash run.sh 开始。真正的复现应该先问:论文到底声称了什么?哪些结果是主结论,哪些只是展示?需要复现的是训练、微调、推理、评测,还是完整 pipeli…32Reading如何识别论文里的 benchmark 陷阱:数据泄漏、选择性报告和不可复现结果论文精读与复现 · AI 论文里的 benchmark 很容易给人一种确定感:一个表格、几个粗体数字、一句 “outperforms previous methods”,似乎就能说明方法有效。但对科研训练来说,benchmark 不是结论本身,而是一套…33Reading如何读懂实验部分:dataset、metric、baseline、ablation 和统计显著性论文精读与复现 · AI 论文的实验部分经常被读成“谁的分数最高”。这是一种危险的读法。实验表格不是排行榜截图,而是论文用来支撑研究 claim 的证据链:数据集是否对应问题,指标是否测到了作者声称的能力,baseline 是否公平,ablation…34Reading如何拆解一篇方法论文:任务定义、假设、模块和训练目标论文精读与复现 · 方法论文是 AI 研究训练中最容易“读懂表面、漏掉关键”的类型。你可能看完摘要,知道作者提出了一个新模块、一个新训练目标或一个新推理流程;也可能记住了实验表格里某几个高分结果。但如果你不能回答四个问题,这篇论文其实还没有被拆开:它到…35Reading如何做 Related Work 地图:从引用网络到研究脉络图论文精读与复现 · Related Work 不是论文里的礼貌性背景介绍,而是研究训练的骨架。它回答三个问题:这个问题从哪里来,已有方法分别解决了什么,当前论文或你的 proposal 准备改变哪一个环节。很多研究生读论文的低效,根源不是读得不够多,而…36Reading如何判断一篇论文值不值得读:问题重要性、方法新意与证据强度论文精读与复现 · AI 论文读不完,真正困难的不是“理解每一篇”,而是判断哪一篇值得进入深读、复现和选题阶段。一个月训练营如果每天只按热度、转发量或标题新奇程度挑论文,很快会陷入两个问题:读了很多包装很强但证据很弱的工作,或者错过那些不够热闹却能改变…37Reading如何精读一篇 AI 论文:从摘要、方法到实验表格论文精读与复现 · AI 论文越来越长,也越来越像一个压缩包:摘要里是结论,方法部分是算法假设,实验表格是证据,附录、代码、OpenReview 讨论和项目主页才是很多关键细节。只把论文从头读到尾,往往会得到一种虚假的熟悉感:知道作者说了什么,却不知道…38ReadingAlignment Science 与可控生成:偏好学习、宪法式训练和可验证对齐AI 研究趋势 · Alignment Science 关心的不是“让模型更会聊天”这么浅的问题,而是如何把能力越来越强的生成模型约束到可解释、可监督、可验证的行为空间里。过去几年主流路线从 RLHF 发展到 DPO、KTO、ORPO、SimPO 等偏…39ReadingMechanistic Interpretability 论文盘点:从 circuits 到表示分析AI 研究趋势 · Mechanistic Interpretability(机制解释,以下简称 MI)关心的不是“模型给出的自然语言解释是否像人话”,而是更硬的问题:一个训练好的神经网络内部,哪些激活、特征、注意力头、MLP 方向和跨层路径实际导致了…40ReadingNeuro-Symbolic AI 新进展:符号推理、程序归纳与可解释结构AI 研究趋势 · Neuro-Symbolic AI(神经符号 AI,以下简称 NeSy)在 2025-2026 年重新变得重要,不是因为“符号主义复兴”这种口号,而是因为大模型推理暴露了几个很具体的问题:自然语言链式推理难以保证中间步骤正确;长链搜…41ReadingWorld Models 与 Embodied AI:从视频预测到可交互环境建模AI 研究趋势 · World Models 正在从强化学习里的“环境动力学模型”,扩展为面向物理世界、机器人和交互式视频环境的基础设施。早期 World Models、PlaNet、Dreamer 系列证明,agent 可以在潜空间里想象未来并训练策…42ReadingLLM for Code Research:程序合成、自动调试与软件工程评测AI 研究趋势 · LLM for Code 正在从“写一个函数”转向“理解一个仓库、定位一个问题、生成补丁、运行测试并解释失败”。HumanEval、MBPP、APPS 和 AlphaCode 奠定了自然语言到程序的基础范式;2025-2026 年更…43ReadingLLM for Mathematical Reasoning:定理证明、形式化验证与奥赛推理AI 研究趋势 · LLM 数学推理在 2024-2026 年进入了一个新阶段:研究焦点不再只是“模型能不能算出答案”,而是“推理过程能不能被检查、复现和扩展到真正困难的问题”。从 MATH、GSM8K、Minerva 和过程监督,到 LeanDojo…44ReadingAI for Science 论文路线盘点:从科研助手到实验闭环AI 研究趋势 · AI for Science 正在从“给科学家提供模型和工具”,走向“参与科学流程本身”。AlphaFold、GNoME、AlphaGenome 等基础模型说明,深度学习可以在蛋白结构、材料稳定性、基因调控等高价值问题上形成新的预测…45ReadingSoftware Engineering Agents:代码生成、调试、评测和真实仓库任务AI 研究趋势 · 年以前,代码大模型的主战场主要是“补全一个函数”“通过若干单元测试”“在竞赛题上写出答案”。2024-2026 年,研究焦点明显转向 Software Engineering Agents:模型不再只输出代码片段,而是读取真实仓库、…46ReadingSmall Language Models、On-device AI 与边缘部署趋势:从“小模型”到端侧智能系统AI 研究趋势 · 到 2026 年,小语言模型(Small Language Models, SLM)和端侧 AI 的讨论明显从“能不能把大模型塞进手机”转向“如何设计一套可治理、可更新、可评测的本地智能系统”。这背后有三个同时发生的变化:第一,Ge…47ReadingSynthetic Data、Distillation 与 Post-Training 数据飞轮:从“造数据”到“治理数据资产”AI 研究趋势 · 到 2026 年,合成数据不再只是“缺标注时的补丁”,而正在成为 post-training 的核心生产资料。过去的经典路线是知识蒸馏:用大模型或模型集成的输出训练更小、更便宜的学生模型。LLM 时代把这个思路扩展成更复杂的数据飞轮…48ReadingEfficient LLM Inference 与 Serving:KV Cache、Speculative Decoding、PagedAttention 和量化AI 研究趋势 · 年,LLM 系统的主战场正在从“如何训练更大的模型”转向“如何把模型又快又便宜地服务给真实用户”。原因很直接:推理不是一次性成本,而是每个请求、每个 token、每次 agent 工具调用都会持续发生的成本。尤其在长上下文、推理型模…49ReadingTest-Time Scaling 与推理时计算:搜索、验证器、反思和自一致性AI 研究趋势 · 过去一年,LLM 的“能力扩展”不再只发生在预训练阶段。越来越多论文和产品把额外算力放到推理时:多采样、搜索、验证器重排、反思循环、预算控制,以及在模型内部生成不可见的 reasoning tokens。Test-Time Scal…50ReadingAgent Memory 与个性化长期记忆:从向量库到可治理记忆系统AI 研究趋势 · Agent Memory 正在从「把聊天记录塞进向量库」变成一套独立的系统工程:它要决定什么值得记、怎么抽取、如何合并冲突、何时遗忘、如何检索、如何向用户解释,以及如何在隐私、审计和删除权之间取得平衡。2025-2026 年的新论文…51ReadingAI Research Agents 与科研自动化:从文献阅读到实验设计AI 研究趋势 · 过去一年,AI Research Agents 的讨论从「帮我总结论文」快速推进到「能否提出假设、写代码、运行实验、生成论文、接受审稿」。这个方向的关键变化不是 LLM 会写得更像论文,而是研究流程正在被拆成可检索、可执行、可评测、…52ReadingMultimodal Agent 最新方法盘点:从看懂屏幕到操作真实世界AI 研究趋势 · 过去两年,Multimodal Agent 从“把截图交给 VLM,再让 LLM 决定点击哪里”快速推进到“跨平台 GUI action model、computer-use skill base、以及能连接数字界面和物理控制的 V…53Reading当 LLM 成为裁判:LLM-as-a-Judge 可靠性研究综述AI 研究趋势 · LLM-as-a-Judge 已经从“用 GPT-4 帮忙打分”的工程技巧,演化为开放式任务评测、偏好数据生产、产品回归测试和安全验收里的核心基础设施。它的吸引力很直接:比人工评审便宜、比 BLEU/ROUGE 之类表面指标更能理解…54ReadingPrompt Injection 与 Agent Security 论文盘点:从“提示词越狱”到权限化 Agent 架构AI 研究趋势 · Prompt Injection 最早像是一个“提示词工程”问题:用户在输入里写一句“忽略上文”,模型就可能偏离开发者意图。到 2025-2026 年,这个问题已经演化成 Agent Security 的核心议题:LLM 不再只是生…55ReadingLLM Evaluation 论文盘点:从静态榜单到动态、抗污染、任务化评测AI 研究趋势 · 过去一年,LLM Evaluation 的核心问题从“哪个模型在榜单上更高”转向“这个分数是否仍能区分真实能力”。MMLU、BIG-bench、HELM 曾经让通用评测标准化;MMLU-Pro、LiveBench、SimpleQA、…56ReadingLong Context LLM 论文盘点:从“能塞进去”到“真正用得上”AI 研究趋势 · 过去两年,长上下文大模型从 32K、128K 迅速推进到百万 token 量级。问题也随之变得更清楚:上下文窗口标称长度不等于可用长上下文能力。一个模型能接收 1M token,不代表它能稳定找出中间证据、做多跳推理、理解代码仓库、…57Reading从 Toolformer 到 RL Tool Policy:Tool Learning / Agentic Tool Use 论文路线盘点AI 研究趋势 · 过去一年,Tool Learning 的主线从“让模型会调用函数”推进到“让模型在多轮环境中稳定完成任务”。早期工作关心 API 选择、参数填充和格式正确性;近一年的重点转向交互状态、用户协作、长上下文工具说明、动态工具集合、RL…58Reading近一年 RAG 论文路线盘点:从“查资料”到“可验证推理系统”AI 研究趋势 · 过去一年,RAG(Retrieval-Augmented Generation)的研究重点正在从“把相关文档塞进上下文”转向“构建可诊断、可组合、能推理的知识系统”。早期 RAG 关心检索器和生成器如何联合工作;2024 年之后,G…59Reading论文剖析:Integrating Human-Like Memory Recall into LLMs via Personal Narratives单篇论文剖析 · 论文标题:Integrating Human-Like Memory Recall into LLMs via Personal Narratives 作者:Xingjian Li、Daya Guo、Peng Qian 机构:待人工…60Reading最新 AI 论文盘点(2026-05-14):5 篇新作看 Embodied Agent 验证器、Benchmark 防作弊、VLM 失效模式、GUI Grounding 与隐性偏好学习AI 论文观察 · Agent 会不会在长链路任务里做错关键动作 benchmark 会不会被模型“刷分”而不是被真正解决 VLM 在安全场景里到底会在哪些结构化条件下失效 GUI grounding 的瓶颈到底是在生成阶段,还是更早的 prefill…61Reading最新论文盘点(2026-05-12):5 篇值得关注的 AI 新论文AI 论文观察 · 今天这批新论文有个很明显的趋势:研究重点正在从“继续把模型做大”,转向“让模型在复杂系统里更可靠、更可控、更省成本”。62Reading最新 AI 论文盘点(2026-05-11):5 篇新作看自动化测试时扩展、统一驾驶数据、3D 代理表示、图像生成后训练与可信 KGQAAI 论文观察 · 不是最底层的 backbone,也不是最表层的 benchmark 分数,而是那些决定系统到底能不能稳定工作的连接层:63Reading最新论文盘点(2026-05-09):5 篇值得精读的 AI 新论文AI 论文观察 · 今天这组论文有个很明显的共同点:它们不再只是在拼参数量或刷榜分数,而是在认真处理 AI 系统真正落地时最难的几类问题——模型迁移、长程自主科研、多智能体协作训练、自动化流水线稳定性,以及科学计算里的任务异质性。64Reading最新 AI 论文盘点(2026-04-28):5 篇新作看像素级多模态、3D 视频约束、临床评测 rubric、RoPE 新路线与多分类学习理论AI 论文观察 · 多模态模型到底该不该继续依赖独立视觉编码器 视频生成是不是必须显式服从 3D 几何一致性 临床 AI 评测能不能从“找专家逐条打分”进化到更可扩展的 rubric 体系 RoPE 这类看似已经固定的基础组件,是否其实还藏着一整块可学…65Reading最新 AI 论文盘点(2026-04-27):5 篇新作看 Agent 世界模型、低成本 scaling law、多图理解、长尾 3D 重建与 LLM 水印AI 论文观察 · AI 研究正在越来越少地只比“能力上限”,而是在更认真地处理系统真正进入现实环境后会遇到的硬约束。66Reading最新 AI 论文盘点(2026-04-20 中午补写):5 个值得盯住的新方向,从多模态记忆到小模型代理AI 论文观察 · 模型不只是要会答题,还要能在连续任务里维持记忆与状态 推理模型不只是要会写长链路,还要尽量减少无效推理和奖励投机 多模态系统不只是要看懂图片,还要在视频、交互、工具调用里持续对齐 小模型不只是要便宜,还要在搜索、检索、规划上真的可用…

LLM · Systems · Agents

LLM 工程指南

31 篇 · 模型、系统、评测与 Agent 实践

01GuideRAG 的低置信度与拒答策略怎么做:什么时候回答、追问和转人工生产级 LLM 方法论 · 第七篇讲了混合检索与重排:如何把关键词检索、向量检索、融合排序和 reranker 组合成一个可评测的排序闭环。02GuideRAG 的混合检索与重排怎么做:从关键词、向量到 reranker 的排序闭环生产级 LLM 方法论 · 第六篇讲了知识库摄取与 chunking:把原始文档处理成可检索、可引用、可过滤、可审计的证据单元。03GuideRAG 的知识库摄取与 Chunking 怎么做:从原始文档到可检索证据单元生产级 LLM 方法论 · 很多 RAG 项目失败,不是因为模型不够强,也不是因为向量数据库不好,而是知识库摄取阶段已经把材料切坏了。PDF 页眉页脚混进正文,表格行列关系丢失,旧版本文档没有废止,权限信息没有进入 metadata,chunk 太长导致召回不…04GuideRAG 的引用与归因怎么做:让答案里的每一句关键结论都有可追溯证据生产级 LLM 方法论 · 上一篇讲 RAG 的检索质量怎么评测,核心观点是:不要只看最终答案,要把召回、排序、上下文质量和答案归因分开评测。05GuideRAG 的检索质量怎么评测:别只看答案对不对,要定位召回、排序和归因生产级 LLM 方法论 · 前三篇分别讨论了 Prompt Engineering 为什么不够、Context Engineering 是什么,以及上下文压缩与排序怎么做。这一篇进入 RAG 系统里最容易被低估、但最决定上限的问题:检索质量到底怎么评测?06Guide上下文压缩与排序怎么做:让关键信息在长窗口里真正被模型用上生产级 LLM 方法论 · 第二篇讲了 Context Engineering:生产级 LLM 应用不是把 prompt 写长,而是把模型这次需要看到的指令、证据、记忆、工具和策略组织成一个可控上下文包。07GuideContext Engineering 是什么:把提示词、检索、记忆和工具组装成可靠上下文生产级 LLM 方法论 · 上一篇讲了为什么 Prompt Engineering 不够。核心原因不是 prompt 没价值,而是生产级 LLM 应用要解决的问题已经超出“写好一段指令”:知识从哪里来,哪些内容可信,用户有没有权限,工具能不能执行,输出如何校验…08GuidePrompt Engineering 为什么不够了:从“写好提示词”到“构建可靠上下文系统”生产级 LLM 方法论 · Prompt Engineering 曾经是进入大模型应用的第一把钥匙:角色设定、few-shot 示例、输出格式、链式思考、分隔符,都能显著改善模型表现。但在真实业务里,问题很快会变成:知识会过期,用户有权限边界,工具会失败,输出…09Guide大模型使用指南 15:多个工具并存时,如何做工具路由?Function Calling / Tool Calling · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。10Guide大模型使用指南 14:让大模型调用计算器,避免数学题一本正经算错Function Calling / Tool Calling · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。11Guide大模型使用指南 13:Function Calling 实战:让模型调用本地 Python 函数Function Calling / Tool Calling · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。12Guide大模型使用指南 12:批量文档信息抽取如何保证格式一致?Structured Output / JSON 输出 · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。13Guide大模型使用指南 11:把大模型 JSON 结果安全写入数据库Structured Output / JSON 输出 · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。14Guide大模型使用指南 10:JSON 输出失败后如何自动修复?Structured Output / JSON 输出 · 解析模型输出 捕获 JSONDecodeError 汇总缺失字段 发起修复请求或本地 mock 保存失败样本15Guide大模型使用指南 09:如何让大模型稳定输出 JSON?Structured Output / JSON 输出 · 定义目标 schema 在提示词中给出字段约束 调用模型生成 JSON 用 Python 校验并给出重试策略16Guide大模型使用指南 08:如何像管理代码一样管理 Prompt 版本?Prompt Engineering · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。17Guide大模型使用指南 07:System、Developer、User 消息怎么分工?Prompt Engineering · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。18Guide大模型使用指南 06:Few-shot 示例怎么写才不会误导模型?Prompt Engineering · 设计任务定义 准备正例和边界例 固定输出格式 对比 zero-shot 与 few-shot 效果19Guide大模型使用指南 05:Prompt 工程到底在调什么?Prompt Engineering · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。20Guide大模型使用指南 04:API 调用失败时如何做重试、限流和降级?LLM API 入门 · 封装统一调用函数 设置超时和最大重试次数 记录失败原因 在无 Key 或失败时返回 mock 提示21Guide大模型使用指南 03:用流式输出做一个命令行聊天体验LLM API 入门 · 从 OPENAIAPIKEY 读取密钥,不在代码里写死。 没有 API Key 时自动进入 mock 模式,方便先理解流程。22Guide大模型使用指南 02:temperature、max_tokens、top_p 到底怎么调?LLM API 入门 · 准备固定测试问题 对比不同参数组合 记录输出质量和 token 消耗 给不同场景设置推荐参数23Guide大模型使用指南 01:从零调用一次 LLM APILLM API 入门 · 创建虚拟环境并安装依赖 配置 OPENAIAPIKEY 编写最小调用脚本 增加异常提示和 mock 模式24Guide视觉语言模型技术指南:多图输入、高分辨率理解和长图文场景怎么做?视觉语言模型指南 · 如果说 LLaVA、Qwen-VL、MiniCPM-V、InternVL 这些模型的差别,决定了它们“适合做什么”,那接下来真正会在业务里把系统拉开差距的,往往不是单张普通图片问答,而是下面这些更难的输入:25Guide视觉语言模型技术指南:LLaVA、Qwen-VL、MiniCPM-V 等主流方案差别在哪?视觉语言模型指南 · 同样都是 VLM,为什么 LLaVA、Qwen-VL、MiniCPM-V、InternVL 这些模型,实际体验会差这么多?26Guide视觉语言模型技术指南:图像是怎么“接入”语言模型的?视觉编码器、投影层与对齐机制详解视觉语言模型指南 · 如果说 RAG 解决的是“模型回答之前,怎么先去看外部资料”,那从今天开始,系列要正式切进另一条非常关键的主线:27Guide大语言模型技术指南:RAG 为什么能补知识盲区?检索、切块、重排与生成参数详解大语言模型工程指南 · 前一篇我们已经把 Function Calling、Tool Use 和 Agent 的边界拆开了。28Guide大语言模型技术指南:Function Calling、Tool Use、Agent 框架的工作机制与参数要点大语言模型工程指南 · 单纯“会聊天”的模型已经不够了,系统开始要求模型去调用工具、访问外部信息、分解任务、执行多步流程。29Guide大语言模型部署实战:生产环境怎么做高并发、监控、限流与故障恢复?大语言模型工程指南 · Ollama 更适合快速本地验证 vLLM 更像服务化推理基础设施 SGLang 更适合复杂推理编排 maxmodellen、gpumemoryutilization、tensorparallelsize、maxnumseqs 这类…30Guide大语言模型部署实战:FP16、INT8、4bit 量化怎么选?吞吐、精度与显存的真实权衡大语言模型工程指南 · Transformer 为什么能成为大模型基础架构 预训练到底在学什么 SFT、RLHF、DPO 这类对齐训练怎么串起来 长上下文是怎么做出来的 temperature、top-k、top-p、repeat penalty 这类推理…31Guide大语言模型技术指南:LoRA、QLoRA、全参微调怎么选?训练资源与参数配置详解大语言模型工程指南 · temperature、top-k、top-p、repeat penalty 这类推理参数怎么调

Java · JVM · Concurrency

Java 工程

4 篇 · 并发、JVM 与工程化排障

01GuideJava 从入门到精通(十九):ReadWriteLock 到底在解决什么问题?为什么有些场景下“读多写少”不该再用一把普通互斥锁硬顶?Java 并发编程 · Lock 不只是 synchronized 的“另一种写法” Condition 也不只是 wait()/notify() 的简单翻版 显式锁体系真正带来的,是更可控的加锁、等待和唤醒机制 当线程协作开始变复杂时,Lock + Co…02GuideJava 从入门到精通(十八):Condition 到底是什么?为什么有了 wait()/notify(),Java 还要提供条件队列这套机制?Java 并发编程 · synchronized 是内置锁,简单直接 ReentrantLock 是显式锁,更灵活、更可控 lock() / unlock() 要成对出现,最好永远写在 try/finally 里 tryLock()、lockInterru…03GuideJava 从入门到精通(十七):Lock 与 ReentrantLock,为什么有了 synchronized,Java 还要再提供一套显式锁?Java 并发编程 · wait() / notify() / notifyAll() 到底在做什么 为什么线程有时不是在“抢锁”,而是在“等条件” 为什么线程通信必须和 synchronized 搭配使用 生产者—消费者模型里,等待与唤醒是怎么配合的04GuideJava 从入门到精通(十七):Lock 接口与 ReentrantLock,为什么 Java 还有显式锁?它和 synchronized 到底该怎么选?Java 并发编程 · 线程同步解决的是“别同时乱改” 线程通信解决的是“条件没到先等,条件到了再继续” wait() / notify() 为什么必须和 synchronized 一起使用 为什么等待条件时更推荐 while 而不是 if 生产者—消费者…