1、从上下文工程到从上下文工程到Harness Engineering构建高效的 Agent 执行环境:上下文工程&工具链设计About me周晓/zhoushaw字节 Web Infra 成员AI Coding/Harness EngineeringMidscene.js/Module Federation 2.0 为什么 AI 出出现后,研发普遍觉得更累了?更累了?真正的瓶颈:编码提速并未打破系统性天花板,非编码工作量正在随着代码生成量的增加而指数级爆发。软件开发工作时间分配非非编码工作占比高达70%30%40%20%10%编码(AI赋能环节)验证/CI/测试部署/发布/灰度排障/沟通/Cod
2、e Review局部最局部最优陷阱AI 目前只在开发环境里极速写代码,但并没有帮你解决测试、验证和沟通等环节。价值上限被后续流程死死锁住。痛点爆痛点爆发:代码生成得越快越多,你用于手动测试、验证排障和Code Review 的工作量正在呈指数呈指数级上升。破局:破局:Harness Engineering必须从单行代码补全跃升至让Agent 执行跨越整个生命周期的长时间闭环任务(Long-term Tasks)。核心路径:核心路径:通过专属工具链集成,解决上下文爆炸问题,让AI 接管测试与排障,彻底打破 70%的非编码流程枷锁。范式范式转移:什么是 Harness Engineering?工程
3、工程师角色转变从“编写代码”转向“设计环境、明确意图”Harness Engineering构建Agent 专属工具链,实现受控执行Agent 可可读性北极星指标:代码库重塑为模型能“读懂”的环境“不要只把大模型看作大脑,必须为它打造专属的工作室。”PART 01唯快不破唯快不破 从从 Transformer 原理到原理到 Prompt CacheTransformer 自回归、KV Cache、Prompt Cache、ReAct 循环、上下文布局Claude Code/Codex 在遵循哪些在遵循哪些“物理限制物理限制”?你觉得产品“慢、笨、会幻觉”?其实每个行为都是一道工程选择题SLOW
4、/慢慢并非并非产品 Bug自回归逐Token 生成是物理铁律;上下文越长,Prefill 就越久,这是算力的基本开销。DUMB/笨笨并非模型能力弱并非模型能力弱上下文塞得越多,注意力被稀释得越严重。在万行代码中,关键逻辑往往被掩埋。HALLUCINATION/幻幻觉并非故意欺并非故意欺骗当上下文中缺少事实锚点,模型为维持概率连贯,只能进行“合理的猜测”。产品设计并非在对抗限制,而是在做Harness Engineering:顺应物理限制,在约束中求解最优体验。1.21.3 KV Cache&Prompt Cache解释了为什么System Prompt 要保持极高稳定性只有稳定,缓存才能命中,
5、响应才能加速1.4 ReAct 循循环机制解释了为什么Agent 要想做看反复迭代利用外部反馈来对冲模型的概率波动上下文布局与上下文布局与压缩解释了为什么会自动Compact 在有限的注意力槽位内,塞入信噪比最高的信息理解理解这些约束=理解理解Harness Engineering 的底的底层逻辑NEXT:以Transformer 第一个Token 为起点,逐层拆解1.1 为什么是一个 token 一个一个 token 吐?吐?自回自回归分解LLM 本质是下一个 token 预测器P(x1,.,xT)=P(xt|x1,.,xt-1)流式渲染暴露了模型自回归的物理现实无KV Cache 时,吐第
6、100 词 前99 词全部重算Coding Agent 塞入几万字 Prefill 阶段极其昂贵PyTorch 朴素推理(无朴素推理(无KV Cache)for step in range(max_tokens):#朴素实现:每步全量前向out=model(input_ids)next=argmax(out.logits)#拼接 序列越来越长input_ids=cat(input_ids,next)结论:上下文越长 Prefill 越重 首 Token 延迟越大 这就是 KV Cache 的动机1.2 KV Cache:为什么追加追加便宜?便宜?推理两推理两阶段:Prefill(全量算KV)D