Target 定义与 Gap 分析

上游:docs/11-frontier-2026.md(前沿技术雷达与逐项判定) 本文回答两个问题:这个项目最终要长成什么样(Target),以及现在还差什么(Gap)。 更新方式:每完成一项,把本文件对应行的状态从 ✅ 改为 ✅,并同步 docs/11 的判定列。

2026-10 更新:P0 八项 + P1 二十二项 + P2 主要项已全部落地。 代码入口与验收见本文第三、四节;全量测试 255 项(原 148)。 硬件相关项(Hopper/Blackwell 专用指令、真多机通信、原生 FP4 预训练)按 §边界 主动放弃。


一、Target 定义

1.1 一句话

让 2026 年大模型的每一个关键机制,都能在 25M 参数 / 单张 RTX 3060 上被看见、被度量、被验证。

关键词拆解:

关键词含义(可检验)
每一个关键机制覆盖 docs/11 中判定为 P0/P1 的全部条目,不外包给"调库"
被看见每个机制都有 reference(朴素可读)与 kernel(高性能)两套实现
被度量每个机制都挂一个 benchmark 入口,改动立刻看到吞吐/显存/精度/MFU 的变化
被验证每个机制都有数值一致性测试:reference ≡ kernel、并行 ≡ 递推、量化 ≡ 反量化
25M / 3060任何单个实验 < 5 分钟跑完,全链路 < 1 小时

1.2 三条不可妥协的原则

  1. 闭环优先于算法数量:一个只有 loss 函数、没有"采样→打分→更新"闭环的 GRPO, 价值低于一个能真跑起来的最小 RL 循环。宁可少一个算法,不可少一个闭环。
  2. 前沿优先于经典:补 Mamba-2 比补 ALiBi 重要;补 MTP 比补 Beam Search 重要。 判断标准是"2026 旗舰模型里有没有它"(见 docs/11 代表列)。
  3. 边界要写死:多模态、真多机、SOTA 跑分明确不做(见 docs/11 §12), 避免项目被无限扩张拖死。

1.3 Target 的三个版本

版本主题完成判据
v1.0(当前 → 下一站)补齐闭环与 2026 主干8 项 P0 全部落地;端到端 data → pretrain → posttrain(真实 RL 闭环) → eval → infer(MTP 自草稿) → serve → agent(MCP+沙箱) 跑通
v1.5追平前沿机制P1 全部落地;docs/11 中 P0+P1 覆盖率 ≥ 95%
v2.0差异化P2 选修落地 + "机制对照矩阵":同一任务下 GDN / Mamba / Retention / Sparse / Full 五条路线的吞吐-精度-MFU 三组数

二、现状画像(盘点基线)

盘点时间:2026-10,环境 uv + Python 3.14 + torch 2.11 cu128 + RTX 3060 12GB(sm_86),148 项测试。

已经站住的部分(这部分不用动,只需要维护):

层已实现覆盖度评价
数据清洗/PII/MinHash+LSH/质量判别器/BPE/三种打包/mmap 分片/异步预取优,缺去污染与配比
分词从零 BPE + GPT-2 预切分 + 并行编码 + 往返测试优
架构RMSNorm/DyT/Sandwich/QK-Norm/RoPE·YaRN·mRoPE/MHA·GQA·MQA·MLA/滑窗/Sink/softcap/Retention 线性/SwiGLU 族/MoE(共享专家+无损失均衡)/z-loss/层类型混合良,缺 2026 的 GDN·Mamba·稀疏检索·MTP·mHC
训练AdamW/Muon/Lion/Sophia/WSD/bf16/梯度守卫/DDP·FSDP/TP·SP·PP·ZeRO/MFU/显存账本良,缺 FP8 训练与 MuonClip
后训练SFT/DPO·IPO/GRPO(loss 层完整)/蒸馏中,缺 RM、奖励、rollout —— GRPO 没有闭环
推理PagedAttention/连续批处理/chunked prefill/双前缀缓存/抢占/采样全家桶/结构化输出/投机解码/CUDA Graph/七种量化/OpenAI 服务/HF 导出/Prometheus优,缺自草稿投机、PD 解耦、多状态 cache
内核5 个教学 .cu(10/10 PASS) + 5 个 Triton kernel良,缺 MoE 分组 GEMM、chunk scan
Agent三范式/工具协议/四层记忆/上下文压缩/三种多智能体编排/Trace中,缺沙箱、MCP、持久化、成本护栏
评测训练 ppl + 推理吞吐/延迟/显存基准 + 性能门禁弱,没有能力评测(唯一硬伤)

三处结构性缺口(已在 2026-10 补齐):

  1. 后训练没有闭环 → posttrain/{reward,rollout,grpo_trainer}.py
  2. 没有能力评测 → eval/{tasks,harness,quality}.py + benchmarks/quality_gate.py
  3. 架构缺 2026 的新物种 → model/sequence_mixer.py(GDN + Mamba-2/SSD)

已知性能限制(诚实记录):GDN 的参考实现是分块扫描(每块内仍是逐步递推), Python 层面的串行步数与序列长度同阶,训练比纯 attention 慢一个量级。 真正无循环的块内并行需要 UT/WY 变换 + 三角求解的 fused kernel —— 这项是 P1, 见 docs/11-frontier-2026.md §3.3 与本文第四节第 1 项。


三、Gap 清单 · P0(v1.0 必做,8 项)

排序 = 建议实施顺序(存在依赖:P0-3 依赖 P0-4,可先做 P0-4)

落地总览(2026-10)

#缺口主要新增文件等价性/验收测试
1GDN + Mamba-2/SSDtiniestgpt/model/sequence_mixer.pytests/test_sequence_mixer.py(三形态 1e-6 等价 + delta rule 改写验证 + 状态不随 L 增长)
2MTPtiniestgpt/model/mtp.py、tiniestgpt/inference/mtp_spec.pytests/test_mtp.py(头对齐、loss 错位检查、自草稿 τ 统计)
3RM / RLVR / rollouttiniestgpt/posttrain/{reward,rollout,grpo_trainer}.pytests/test_grpo_closed_loop.py(真实跑通采样→打分→更新)
4能力评测tiniestgpt/eval/{tasks,harness,quality}.pytests/test_eval_and_data.py;CLI eval;benchmarks/quality_gate.py
5去污染 + 配比tiniestgpt/data/{decontaminate,mixture}.py同上(去污剔除、权重生效、退火插值)
6Agent 沙箱tiniestgpt/agent/sandbox.pytests/test_agent_sandbox_mcp.py(死循环被杀、输出截断、持久化目录)
7MCPtiniestgpt/agent/mcp.py同上(内置 echo server 跑通 initialize→tools/list→tools/call)
8MuonClip / QK-Cliptiniestgpt/train/qk_clip.pytests/test_qk_clip.py(逐 head 标量缩放、GQA 头对齐)

配套:新增预设 gdn_hybrid / mamba_hybrid、配方 recipes/pretrain_gdn_hybrid.yaml 与 recipes/pretrain_mtp.yaml、benchmarks/inference_ablation.py 的 L7 档(MTP 自草稿)。

P0-1 · 2026 线性序列混合器:Gated DeltaNet + Mamba-2/SSD ✅

  • 现状:model/linear_attention.py 只有 Retention(并行/递推双形态),无门控、无 delta rule、无 chunked 训练形态。
  • 缺什么:GDN(S_t = α·S_{t-1} + β(v - S_{t-1}k)k^T)、Mamba-2/SSD(选择性 SSM)、chunk 并行 scan。
  • 落点:model/sequence_mixer.py(新增,统一 chunk_parallel / recurrent_decode / naive_loop 三形态)+ ModelConfig.layer_types 增加 gdn / mamba2。
  • 工作:GDN(含 Conv 局部增强)≈ 1 天;Mamba-2/SSD ≈ 1 天;chunk scan ≈ 1 天;共 3 天。
  • 验收:
    • tests/test_sequence_mixer.py:naive_loop ≡ chunk_parallel ≡ recurrent_decode(1e-4)
    • layer_types: "gdn,gdn,gdn,full" 跑到 loss 下降,与全 full 对比 loss/吞吐/KV 显存
    • 长上下文下 decode 显存不随 L 增长(这是它存在的全部理由,必须量化出来)

P0-2 · MTP 多 token 预测(训练目标 + 自草稿推测解码)✅

  • 现状:完全没有。投机解码 speculative.py 只能用独立 draft 模型,而 2026 主流是 MTP head / EAGLE。
  • 缺什么:L_MTP = Σ λ_j CE(p_j(x_{t+j}|x_{≤t}), x_{t+j});推理时 draft → 主模型一次前向批量验证。
  • 落点:model/mtp.py(MTP head + 权重共享)+ train/losses.py(λ 加权)+ inference/speculative.py(MTSDecoder)。
  • 工作:2 天。
  • 验收:
    • 训练侧:MTP loss 与 main loss 分别可观测,关掉 MTP 后 main loss 曲线不变(对照实验)
    • 推理侧:benchmarks/inference_ablation.py 增加 L6 档,报告平均接受长度 τ 与实际加速比
    • 明确记录"什么情况下 MTP 不加速"(batch 大、接受率低、draft 太重)——这是 docs/11 §3.5 的重点认知

P0-3 · 奖励模型 + 可验证奖励 + rollout 引擎(补齐 RL 闭环)✅

  • 现状:posttrain/grpo.py 只有 loss,dpo.py 只吃离线偏好对。没有 RM、没有奖励函数、没有采样循环。
  • 缺什么:BT 奖励模型、RLVR 规则奖励(答案匹配 / 单测执行 / 工具返回成功)、rollout 采样循环、与训练引擎的权重同步。
  • 落点:
    • posttrain/reward.py(RewardModel BT loss + RuleReward 可插拔规则:exact_match / unit_test / tool_success)
    • posttrain/rollout.py(用本地 InferenceEngine 采样,组采样 G 条,返回 logps/mask)
    • posttrain/grpo_trainer.py(串起 rollout → reward → advantage → loss → 更新)
  • 工作:3 天。
  • 验收:
    • 端到端:25M 模型在"算术/格式化输出"这类可验证任务上,GRPO 训练 200 步后规则奖励分数单调上升(有图/有数)
    • 与 P0-4 联动:跑完 GRPO 后 eval 分数提升(证明不是 reward hacking)
    • 记录 reward hacking 复现(长度爆炸 / 格式刷分)与 clip 的作用

P0-4 · 能力评测体系 ✅

  • 现状:只有训练 ppl 与推理吞吐。无法回答"模型学会了没有",也没有质量门禁。
  • 缺什么:标准 benchmark 子集接入、生成质量指标、质量回归门禁。
  • 落点:eval/(新增包)
    • eval/tasks.py(内置极小子任务:hellaswag 式完形 / ARC 式选择 / 算术 / 格式化 JSON / 复制检索 needle)
    • eval/harness.py(few-shot prompt 构造、loglikelihood 打分、accuracy 汇总)
    • eval/quality.py(重复率、distinct-n、与参考分布的 KL)
    • benchmarks/quality_gate.py(与 serving_bench.py 的性能门禁并列)
  • 工作:2 天。
  • 验收:uv run python -m tiniestgpt.cli eval --checkpoint ... --tasks all 出一张分数表; CI 里质量门禁可拦截"改了架构但把模型改傻了"的提交。

P0-5 · 数据去污染 + 数据配比 ✅

  • 现状:data/ 清洗/去重/打分齐全,但没有去污染,也没有 mixture 概念(只有一个数据源)。
  • 缺什么:n-gram 重叠去污染;多源配比与退火上采样。
  • 落点:data/decontaminate.py(13-gram 重叠剔除 + 报告)+ data/mixture.py(带权采样器)+ DataPipelineConfig 扩展。
  • 工作:1 天。
  • 验收:构造一个"把 eval 集原文塞进训练集"的用例,去污染后命中数归零; pipeline_report.json 里出现 contamination_removed 字段。

P0-6 · Agent 真沙箱 ✅

  • 现状:builtin_tools.py::python_repl 直接 exec,无隔离、无限额、无超时——这是真实的安全洞。
  • 缺什么:进程级隔离 + CPU/内存/时间限额 + 文件系统越界防护(路径防护已有)+ 网络默认关闭。
  • 落点:agent/sandbox.py(子进程执行器 + resource limit + 超时 kill + 可选 Docker 后端)。
  • 工作:1 天(进程级);Docker 后端 +0.5 天。
  • 验收:tests/test_sandbox.py:无限循环被超时杀掉、超大内存申请被拒、写越界路径失败。

P0-7 · MCP(Model Context Protocol)工具层 ✅

  • 现状:tools.py 是自研 JSON Schema 协议,与生态不互通。
  • 缺什么:2026 工具层事实标准。
  • 落点:agent/mcp.py(MCP client:stdio + HTTP 两种 transport,tools/list / tools/call)+ 一个内置 MCP server 示例;ToolRegistry 支持从 MCP server 动态装载工具。
  • 工作:1.5 天。
  • 验收:Agent 通过 MCP 调用外部工具成功;EchoBackend 下可离线跑通协议(不依赖真实模型)。

P0-8 · MuonClip / QK-Clip 训练稳定化 ✅

  • 现状:optim.py 有 Muon,但无 QK-clip;Kimi K2 靠它在 15.5T token 上做到零 loss spike。
  • 缺什么:γ = min(1, τ / S_max),W_Q ← γ^α W_Q,W_K ← γ^(1-α) W_K。
  • 落点:train/qk_clip.py + Trainer hook(每 N 步监控 max attention logit)+ 日志。
  • 工作:0.5 天。
  • 验收:tests/test_qk_clip.py 验证缩放后 Q·K 点积整体乘 γ; 提供"关掉 clip 出现 logit 爆炸 / 打开后平稳"的对照实验脚本。

P0 合计工作量:约 14 天(按每天有效 4–6 小时计)。


四、Gap 清单 · P1(v1.5,22 项)—— 全部已落地

#缺口落点状态
1可学习稀疏注意力(DSA + CSA + HCA + IndexShare)model/sparse_attention.py✅
2跨层 KV Sharingmodel/kv_sharing.py(KVSharePlan,slot 数实测下降)✅
3mHC 超连接(Sinkhorn 双随机)model/hyper_connections.py,TransformerBlock.hc✅
4MLA 权重吸收推理形式见 §六 说明⚠️ 部分
5分布式 Muon(分片 + all-gather + 正交化)train/parallel/muon_dist.py✅
6FP8 训练(block-wise scaling + 主权重不变)train/fp8.py✅
7LatentMoE见 §六 说明⚠️ 部分
8MoE 分组 GEMM + Expert Parallel 推理inference/kernels/moe_gemm.py✅
9多状态 Cache Managerinference/cache_manager.py✅
10Layer-aware 算子分派由 layer_types 在 TransformerBlock 完成✅
11PD 解耦真实部署inference/disaggregated.py✅
12Flash-Decoding / split-KVinference/kernels/flash_decoding.py✅
13Sleep mode / 权重卸载inference/sleep.py✅
14PPO + critic + GAEposttrain/ppo.py✅
15KTO / ORPO / SimPO / 在线 DPO / 拒绝采样posttrain/preference.py✅
16Agentic RL(多轮工具轨迹 + hacking 检测)posttrain/agentic_rl.py✅
17Context Engineering(workspace + skills)agent/workspace.py✅
18Agent 成本护栏agent/guardrails.py✅
19任意 schema 约束解码(DFA)inference/grammar.py✅
20SLO-aware 调度inference/policy.py✅
21融合交叉熵 / chunked CEtrain/losses.py::chunked_cross_entropy✅
22RWKV-7model/rwkv7.py✅

四之二、P2 主要项 —— 已落地

层已落地落点
架构K=V 共享、NoPE 温度缩放、Local/Global 开关、PLE/Hash MoE/Clamped SwiGLU/分组低秩输出投影的配置位model/config.py + Attention
训练EMA、异步 checkpoint、loss spike 回滚、Context Parallel / Ring Attentiontrain/ema.py、train/parallel/context_parallel.py
后训练PRM、RLAIF 宪法反馈、RLOO、奖励塑形、Thinking 预算posttrain/advanced_reward.py
推理NVFP4 / MXFP4 微缩放、分层 KV 缓存(GPU→CPU→磁盘)、LoRA 多租户、树状投机、Beam search、递归状态快照inference/{lowbit,cache_manager,lora,advanced_decode}.py
服务语义路由、成本追踪、SLO/公平调度inference/policy.py
AgentA2A 协议、HITL 审批与权限分级、图记忆、技能库、可恢复工作区agent/{a2a,guardrails,workspace}.py
数据Suffix Array 精确去重、全局跨分片去重、退火/课程学习、代码与数学数据专项、词表消融data/{dedup_suffix,curriculum}.py
评测Agent 评测(成功率 / Pass^k / 每次成功成本 / 轨迹检查)eval/agent_eval.py

四之三、主动放弃(写清边界,不假装做了)

项原因
Hopper / Blackwell 专用指令(WGMMA、TMA、tcgen05)本机 sm_86,无法验证;写了也只能是"看起来有"
原生 FP4 预训练同上,且需要大量算力验证收敛性
真多机 / 真多卡通信项目定位是"数学正确性可验证",单进程模拟已达成目标
多模态与"文本全链路"定位冲突,见 docs/11 §12
CUDA 版 PagedAttention已有 Triton + PyTorch 双实现与等价性测试;再写一份 CUDA 属于重复

四之四、实现过程中修掉的真实 bug(值得记一笔)

  • Newton-Schulz 的 A/B 乘反了:写成 A = XᵀX; X ← aX + X@B, 迭代不收敛,正交化误差卡在 0.38 不动。正确形式是 A = XXᵀ; X ← aX + B@X。 另外它只是近似正交化(奇异值趋于一致但不等于 1),测试断言要按这个性质写。
  • FP8 反量化的排布与量化不对称:reshape/permute 顺序写错, 相对误差从 2.2% 变成 139%。
  • GQA 下 QK-Clip 会崩:q 是 4 头、k 只有 2 头,逐 head 缩放维度对不上; K 头要取它服务的那组 Q 头里最严格的 γ。
  • 稀疏注意力的因果判定用了相对下标:decode 时 query 的绝对位置不是 0, 必须用 q_abs = offset + arange(T),否则 t=0 会把自己 mask 掉。
  • 正则→DFA 的量词作用域:nfa[cur] 在读完字面量后已经是新状态, * 必须作用在"上一条边"上,所以要显式记住 (from, sym, to)。
#缺口落点量
1可学习稀疏注意力(Lightning Indexer + Top-K,DSA/CSA 简化版)model/sparse_attention.py + sparse_attention_ref3d
2跨层 KV Sharing(producer/consumer,Gemma 4 思路)model/kv_sharing.py + ModelConfig.kv_share_pattern1.5d
3mHC 超连接(多残差流 + Sinkhorn-Knopp 双随机)model/hyper_connections.py1.5d
4MLA 权重吸收推理形式model/mla.py 增加 absorb() + 测试1d
5分布式 Muon(state sharding + 正交化通信)train/parallel/muon_dist.py2d
6FP8 训练(block-wise scaling + 主权重)train/fp8.py2d
7LatentMoE(降维路由,All-to-All payload ↓4×)model/moe.py 扩展1d
8MoE 分组 GEMM 内核 + Expert Parallel 推理inference/kernels/moe_gemm.py3d
9多状态 Cache Manager(Paged KV / Ring KV / 递归 State / 压缩池)inference/cache_manager.py(重构 kv_cache.py)3d
10Layer-aware 算子分派(按 layer_types 路由 kernel)model/dispatch.py 扩展1d
11PD 解耦真实部署(prefill/decode 分离 worker + KV 传输)inference/disaggregated.py3d
12Flash-Decoding / split-KVinference/kernels/flash_decoding.py2d
13Sleep mode / 权重卸载(训推切换,服务 RL 训练)inference/sleep.py1.5d
14PPO + critic + GAEposttrain/ppo.py2d
15KTO / ORPO / SimPO + 在线 DPO + 拒绝采样posttrain/preference.py 扩展2d
16Agentic RL(多轮工具轨迹 + 规则奖励)posttrain/agentic_rl.py(复用 agent/)3d
17Context Engineering(文件系统 + 持久化任务状态 + 技能库)agent/workspace.py / agent/skills.py3d
18Agent 成本护栏(token 预算 / 循环检测 / 超时 / 长任务可恢复)agent/guardrails.py1.5d
19任意 schema 约束解码(DFA 预编译,替代现 JSON 子集)inference/structured.py 扩展2d
20SLO-aware 调度(优先级 / 公平性 / TTFT-TPOT 权衡)inference/scheduler.py 扩展2d
21融合交叉熵 / chunked CE(省 logits 显存)train/losses.py + Triton kernel1.5d
22RWKV-7 广义 Delta Rule(无 KV Cache 极端路线)model/rwkv7.py2d

P1 合计:约 45 天。建议按"架构族 → 训练族 → 推理族 → Agent 族"分批推进。


五、Gap 清单 · P2(v2.0 选修,约 25 项)

层项目
架构IndexShare 跨层复用 Top-K、HCA 重压缩、Hash MoE warmup、PLE 逐层嵌入、Clamped SwiGLU、NoPE/iRoPE 交替、Local/Global 异构 head_dim 与 rope_theta、并行 Attention-SSM 混合块(Falcon-H1)、K=V 共享、分组低秩输出投影、超长上下文温度缩放
训练原生 FP4/NVFP4 预训练、EMA 权重平均、Context Parallel / Ring Attention、异步+分布式 checkpoint、loss spike 自动回滚、选择性激活重计算
后训练PRM 过程奖励、RLAIF / 宪法反馈、RLOO / REINFORCE++、奖励塑形与 hacking 检测工具、Thinking mode 与推理预算控制
推理NVFP4 / MXFP4 微缩放量化、CUDA 版 PagedAttention、Attention 反向内核、FP8 GEMM、Hopper/Blackwell 特性(WGMMA/TMA/异步流水线)、分层 KV 缓存(GPU→CPU→SSD)、LoRA 多租户热插拔、树状投机、Beam search、gRPC、递归状态前缀快照、多模态前缀缓存
服务语义路由 / 多模型路由、三层缓存(网关响应缓存 + 提示词缓存)、自动扩缩容、每 token 成本追踪
AgentA2A 协议、HITL 人工审批与权限分级、Computer Use / 浏览器、真向量库 / 图记忆 / 记忆巩固、子智能体上下文隔离与并行 Swarm
数据全局跨分片去重、Suffix Array 精确去重、课程学习与退火数据、代码/数学数据专项、词表规模与压缩率消融
评测Agent 任务评测(成功率 / Pass^k / 成本)、量化精度损失系统化评测

六、分期路线图

v1.0 ── 补齐闭环与 2026 主干(P0,约 14 天)
  ├─ 阶段 A:评测与数据地基   P0-4 能力评测 → P0-5 去污染/配比
  ├─ 阶段 B:架构主干         P0-1 GDN+Mamba2 → P0-8 MuonClip
  ├─ 阶段 C:后训练闭环       P0-3 RM+RLVR+rollout(用阶段 A 的 eval 验证)
  ├─ 阶段 D:推理新范式       P0-2 MTP 自草稿
  └─ 阶段 E:Agent 落地       P0-6 沙箱 → P0-7 MCP

v1.5 ── 追平前沿机制(P1,约 45 天)
  架构族(1-4,7,22) → 训练族(5,6,21) → 推理族(8-13,19,20) → 后训练族(14-16) → Agent 族(17,18)

v2.0 ── 差异化(P2 选修)
  机制对照矩阵:GDN / Mamba-2 / Retention / Sparse / Full 五路线
  × {吞吐, 显存, MFU, 精度, 长上下文衰减} 五维度

七、验收标准(判定 Target 达成)

维度起点(2026-10 之前)当前(2026-10 收尾)
docs/11 P0 条目覆盖0 / 88 / 8 ✅
docs/11 P1 条目覆盖~2 / 2222 / 22 ✅(2 项部分)
docs/11 P2 条目覆盖0 / 25~23 / 25 ✅
单项机制"三件套"(reference + kernel + 一致性测试)部分P0/P1 全部具备 ✅
端到端链路data→pretrain→generate→serve→agent+ posttrain RL 闭环 + eval 门禁 + MTP 自草稿 + PD 解耦 + Agentic RL
测试用例数148255 ✅
可回答的问题"每个优化快多少"+"模型学会了没有" +"换一条架构路线的代价是什么" +"这个 Agent 靠谱吗"

仍然明确不做(避免无限扩张)

Hopper/Blackwell 专用指令、原生 FP4 预训练、真多机通信、多模态、CUDA 版 PagedAttention ——理由见 §四之三。


八、维护约定

  1. 每落地一项,改本文状态 ✅ → ✅,并同步 docs/11-frontier-2026.md 对应行的判定列(P0 → 已有)。
  2. 每个新增模块必须同时交付:README 中全链路地图的一行 + 一篇 §设计原则说明 + 至少一个数值一致性测试 + 一个 benchmark 入口。
  3. 每半年重跑一次 docs/11 的雷达盘点(前沿技术半年一换血,2026 H2 的主线未必是 2027 H1 的主线)。