2026-04-23

又是将近一个月之后的重新记录,时间过的太快了😭

几乎忘记该如何写东西了,依旧梦到哪就写哪吧。

  1. 工位 我去申请了一下苏州的领军计划,然后因此认识了 SISPARK 负责招商的梁师兄,是们学校大我三届的师兄。然后他给我们介绍了位于我家附近的独墅湖数字经济产业园的 OPC 共享工位。前三个月免费,从第四个月开始按照 500cny/人/月的收费方式来定,不过据说也是不要钱。

    然后 PGW 听闻之后感到非常有兴趣因此也来了,所以在苏州就我和 cz 还有 pgw 一人一个工位,今天已经是办公的第四天了。重新开始上班的感觉有一点神奇,按 cz 的话来说就是“有点怀念”。对我来说的话就是能够显著区分工作状态和非工作状态。能够让我的精力更加集中,我认为这是好的,另一个好处就是和同事一起办公有助于思想和观点的碰撞。能够产生一些新的 idea,更紧密的协作意味着更整体同一的产品。

    至于其他的我们以观后效。

  2. 迭代 legion-mind 我感受到 legion-mind 现在容易打偏,缺少一个 brainstorm 的能力,于是我把 superpower clone 下来仔细研究了一下,然后学习吸收了它中间的先进经验,用来迭代 legion-mind。

    这件事显著拖慢了我做任何其他事情的节奏,因为想象我是一个伐木工,而 legion-mind 就是我手中的斧子,现在我在修斧子,自然没法很高效地砍树。很多时候我不知道我的一个修改到底在什么程度上以何种方式影响了整个 harness 工具的能力。

    因此我需要一个 benchmark,上次我想要使用 SWE 的 benchmark,但是感觉是走偏了,我不是在测试大模型的工具使用能力,这一点大模型自己已经做到了,我要的是构建几个我能理解且典型的例子,然后从稳定性和创造性两个方面去评估它。

    我最近经常看到去让大模型去生成一段用来生成“鹈鹕骑自行车”动图的脚本,那就把它作为一个面试题,比如说:

    “用 TypeScript 生成一个 512x512、4 秒、24fps、无缝循环的 GIF:一只鹈鹕骑自行车沿海边公路前进。要求有天空/海面/道路三层背景,车轮持续转动,踩踏动作与轮速同步,身体有轻微上下 bob,头部有轻微摆动。支持 --seed 和 --out 参数。”
    

    然后让 llm 用这套 harness 工具做一个能用的小产品,自己理解需求,自己设计,自己实现,自己测试,中间不要来烦我,然后最后看看效果。

    然后是 llm 对于数据的理解和处理,处理一段 csv 数据?从中洞察出一些信息?这个我还没想好,似乎又是在测试大模型能力而不是 harness 工具的能力了。

    然后是修 bug 和添加 feature。

    总而言之,想用例是一件很难的事情,我之前都是在实际的项目中来测试 harness 的能力,希望能有一举两得的效果。但是这种做法其实就是在祈祷一切不要出岔子,我现在要用一种更科学的方式来完成这个事情。

    cz 在搞 AIM(AI project Manager),这正是之前 legion 想要前往的方向。我将会把 legion 作为 AIM 的 harness 层嵌入进去。

  3. 其他的事情 有许多其他的事情我想要做但是还没正式开始的,一个是 1earn 的 AI 化操作,一个是 PMA 体育套利。我之前想的是在 AI 的加持下我完全可以兼顾两者,但是现在看来真正稀缺的是我的注意力资源。在同时推进多个重要事情的时候我很可能顾此失彼。也正如前面的日记所说,我真正能同时做的也就是 2-3 件事情。

    在 AI 加持的时代下,更重要的其实就是人的注意力的管理,我其实可能需要的是主动剪枝,主动让自己的注意力只集中在几个事情上,一次不要太多,然后把事情 close 掉再搞新的事情。

    OKR 我已经搞了,但是 review 的过程比较缓慢,有时候我就是太懒了,而且太过于需求那个“完美的工作状态”,导致只要工作状态不完美就开始磨洋工,我要用日程和坚持打破自己给自己架设的这种桎梏。就好像那个 82 岁还每天 4:30am 去健身的老登说的,“带伤工作”。