# 最小合成数据过滤实验 依赖:Python 3.9+ 标准库;本次实际环境为 Python 3.9.6、CPU,无第三方依赖或模型下载。无须 API 密钥。 从文章目录执行: ```bash PYTHONPYCACHEPREFIX=/private/tmp/codex-ai-065-pycache python3 -m py_compile code/minimal_filter.py python3 code/minimal_filter.py > code/smoke_test.txt ``` Windows 或非 macOS 环境可直接运行 `python -m py_compile code/minimal_filter.py`;临时缓存前缀只是本机权限适配。 脚本固定种子 65,训练一个四维(含截距)逻辑回归分类器。24 条训练记录与 6 条开发记录来自互不重合的算术种子家族,但共享构造模板,因此不构成独立领域测试。正例为可读且正确的算术解释,负例为空回答或重复填充;标签在 `labeled_family` 中显式指定。实际训练的是这个窄标签定义的代理分类器,而非通用回答质量模型。 14 条候选由确定性模板生成,包含加法、排序、字符串反转、平方和,以及一个错误答案和一个空回答。候选从不参与拟合或阈值选择。`answer` 是独立的结构化最终答案;检查器比较它与四个内置纯函数的结果。它不验证 `response` 内每条自然语言论断。pool 中没有下游 benchmark 题目。 `features` 仅读取 response 文本:截距、是否非空、截断词数、词元去重比。`fit` 全批量梯度下降 1000 步、学习率 0.3、非截距参数 L2 系数 0.001;日志 BCE 不包括正则项。开发集扫描 0.3/0.4/0.5/0.6/0.7,F1 相同时选离 0.5 最近的阈值。开发集是非常容易的模板控制组,不能据此声称阈值已泛化。 多样性向量为人工任务家族 one-hot `[14,4]`,不是预训练 embedding。相似度严格大于 0.9 才拒绝,等于阈值仍保留。候选按质量降序、ID 升序固定打破平局,先遍历全部候选获得代表集合,再截取预算 3;难例策略从已通过有效性和质量检查的代表中保留至多一条平方和样本,再按分数填满。没有合法难例时不会用坏样本补齐。 输出 `results.json` 保存全部样本、标签、特征名称、权重、阈值扫描、筛选轨迹、策略指标、代码哈希与限制;`smoke_test.txt` 是真实 stdout。`response_words` 为本例英文正则词数,绝非模型 tokenizer 的 token 数。 阅读顺序:`features/fit` → `fixture_pool/validity` → `diverse` → `main`。主要断言覆盖错误答案特征碰撞、空池、零向量、严格阈值边界、家族划分和合法难例保留;两种数据预算不可混淆。 本次未运行 LLM 生成、DEITA 官方权重、神经语义表示、SFT 或独立基准。要扩展官方复现,应记录仓库 commit、权重 revision、tokenizer/chat template、dtype、环境锁文件、逐行稳定 ID 和 GPU 峰值显存;实际兼容性及训练结果待人工核验。本文不提供未经运行的模型输出。