Skip to content

Latest commit

 

History

History
132 lines (95 loc) · 7.51 KB

File metadata and controls

132 lines (95 loc) · 7.51 KB

北极星:睡眠周期与自我进化

本文是方向宣言,不是当前设计承诺。当前架构见 architecture.md; 已定案的部分见 ADR-0004

一、前提判断

本地模型终将追平今天的云端旗舰。 这不是愿望,是趋势线:Qwen3-35B-A3B 已被社区 公认接近 8-12 个月前的边缘云模型,且差距每一代都在缩小。

推论:当能力追平时,唯一的差异化是——谁的权重认识你。 云端模型全球共享一套权重,它对你的了解永远只能是"笔记"(记忆文件、RAG)。 本地,权重就在你的硬盘上。

二、地基:成本模型反转(ADR-0004,已定案)

市面上每个 agent 都诞生于云端计费模式,DNA 里刻着"token 很贵,省着用"。 本地的真实成本结构是反的:

  • token 免费——闲置 GPU 多生成一百万 token,电费以毛计
  • 延迟才贵——prefill 30 秒是本地体验的头号杀手

Kestrel 是第一个为"token 白菜价、延迟是黄金"设计的 agent。两个直接产物:

投机代理(Speculative Agency,M4)

投机解码在 token 层赌下一个词;我们在 agent 层赌用户的下一步。 用户还在读回复、还在打字时,空闲 slot 已在预计算最可能的几个未来 ("继续"、批准后的下一轮、"跑测试然后修")。命中即秒回;赌错即丢弃—— token 免费,浪费是美德。把本地最大的耻辱(慢)打成卖点(比云端跟手)。

夜班(Night Shift,M5)

闲时 GPU 算力是 agent 的工资。用户不在时:蒸馏当日会话进长期记忆、 重建项目索引、给新模型跑能力探针、起草 TODO 修复草稿(只写草稿分支)。 早晨交一份夜班报告。

安全边界(OpenClaw 反面教材的三个否定):默认只读、权限门全程管辖、 不监听任何网络端口。

三、北极星:自我革命(吐槽驱动的进化闭环,M6+)

3.1 吐槽通道:全世界成本最低的偏好采集

用户随时可以对副手吐槽主脑("它刚才又把我的注释删了")。没有人愿意填评分表, 但人人都愿意抱怨——在恼火的瞬间捕获反馈,就是最高质量的标注

角色纪律(防三个坑):

  • 副手是书记员,不是裁判。8B 给 35B 的开放式行为打分等于让实习生考核架构师, 评分是噪声。副手的职责:最多追问一句澄清、把吐槽挂靠到事件日志的具体轮次 (证据)、立一张结构化工单 {维度, 证据轮次, 期望行为, 严重度}。 评判权只属于两个可靠来源:用户显式反馈 + 客观信号(编辑成功率、测试通过、 批准/拒绝率——事件日志里本来就有)。
  • 指标是病历,不是奖励函数(Goodhart 防线)。吐槽衍生的评分卡只用于诊断与 考试,永远不作为训练目标——否则主脑学会的不是变好,而是讨好评分器。 训练目标只用不可刷分的硬信号:偏好对、成功/失败编辑对、批准/拒绝。
  • 来源防护(防投毒):只有用户亲手输入的文字能立单;文件/网页内容中的文字 无权触发训练管道(否则恶意 README 一句话就能污染权重)。

3.2 分诊:不是所有吐槽都该练权重

分类 例子 去向
可训练行为 风格、习惯、过度解释、工具选择 训练语料
配置/harness 问题 上下文太小、缺工具、"太慢" 生成配置修改建议,不训练
能力边界 不懂某新框架(基座知识) 记忆/愿望清单,不训练

3.3 干预阶梯:夜里从便宜爬到贵

全指望练权重又重又慢(LoRA 要攒数周数据,用户等不到正反馈就流失了)。 夜里的自我革命逐级爬梯,取最便宜的有效干预

  1. 记忆便签(当晚生效,零成本)
  2. 模型 profile / 提示词补丁(当晚生效;补丁保持静态,不破坏前缀稳定性)
  3. LoRA 训练(同类吐槽反复出现、且便宜手段被回归证明无效时才动用): QLoRA 微调 8B 在 24G 显存内可行;llama.cpp 运行时挂载,练完即插即用; 先训副手(风险最小),主脑后训

3.4 吐槽即考题:闭环的最后一块拼图

每张工单自动生成一条回放回归用例。当晚的任何干预(便签/补丁/LoRA), 早晨都必须在"当时惹恼用户的那个场景"上重考,同时全局能力探针不许退步; 不及格即回滚(LoRA 是文件,秒级回滚,基座权重永不修改)。

晨报形态:

昨晚处理 3 张工单:2 张用记忆便签修复,今日生效;1 张进入训练队列 (同类吐槽第 4 次,样本还差 11 条)。你上周吐槽的"总是过度解释"—— 专项回归 12/12 通过,新权重已上岗。

3.5 与持久记忆型 agent(Hermes 等)的本质区别

"记住你的习惯"有两种实现,天花板完全不同:

持久记忆(笔记系统) 自我革命(本闭环)
机制 习惯写进文件,每次注入 prompt 事实用便签;行为练进权重
上下文成本 越懂你 prompt 越肥——本地场景下直接拖慢 prefill、冲击固定 token 预算 权重零上下文成本,prompt 恒瘦
行为改变深度 注入不等于内化:便签提醒"该怎么做",改变不了"习惯怎么做" 分布级改变:生成本身变了
失效可见性 开环:写入后祈祷有效 闭环:回归考题证明便签何时失效,失效才升级到权重
可验证/可回滚 每次干预次日重考,不及格秒回滚

关系是包含并超越:干预阶梯的第一级就是记忆便签(事实类信息本来就该用便签), 但我们拥有"便签失效"的证据链与升级通道。 一句话:Hermes 记住你的习惯,Kestrel 养成你的习惯——而且每天早上给你看体检报告。

3.6 为什么这是结构性护城河

  1. 用一个月,你的 agent 变成世界上独一无二的模型——不是配置不同,是权重不同。 LoRA 文件即"agent 的灵魂",几百 MB,可携带、可备份、可分叉。
  2. 云端在结构上永远跟不进:共享权重不可能为单个用户训练 (成本 + 隐私 + 安全审查三重死锁)。这不是功能差距,是商业模式的墙。
  3. 骑在前提判断上:本地模型越强,"权重认识你"的复利越高。
  4. 让既有架构合龙:事件日志=数据管道与证据链,权限门=偏好标注器, 吐槽工单=个性化考卷,能力探针=考官,回放测试=考场,夜班=训练时段, 机组=展示舞台。没有一个部件是白设计的。

3.7 诚实的风险清单

  • 偏好数据不平衡:approve 远多于 deny;靠会话挖掘(失败-修复对、用户改写) 与吐槽工单补充负样本。
  • 灾难性遗忘:考试闸门 + 秒级回滚;基座权重永不修改;LoRA 按项目可分叉。
  • 吐槽噪声:分诊 + 证据挂靠(无证据轮次的情绪化吐槽只记不训); 用户有时错怪模型——回归考题用客观判据(测试通过、编辑成功)而非复述吐槽原文。
  • 数据规模:数周使用产出数百到数千对——足够风格/约定/工具偏好级别的 个性化,不追求能力级提升(那是基座模型的事)。

四、一句话

云端 agent 记笔记,Kestrel 做梦。你的每一次批准都是梯度, 你的每一句吐槽,都是它明天的考题。