2026-04-23
Wieder fast einen Monat später – die Zeit vergeht viel zu schnell 😭
Ich habe fast vergessen, wie man schreibt, also schreibe ich einfach drauflos, wo immer die Gedanken hinführen.
Arbeitsplatz
Ich habe mich für das „Führungsprogramm“ (领军计划) von Suzhou beworben und dabei den für die Ansiedlung von SISPARK zuständigen Senior Liang kennengelernt – ein drei Jahrgänge älterer Kommilitone von meiner Uni. Er hat uns die OPC-Geteiltarbeitsplätze im Dushu Lake Digital Economy Industrial Park in der Nähe meiner Wohnung vorgestellt. Die ersten drei Monate sind kostenlos, ab dem vierten Monat werden 500 CNY/Person/Monat berechnet, aber angeblich ist es auch dann umsonst.Als PGW davon hörte, war er sehr interessiert und kam ebenfalls dazu. So haben jetzt cz, pgw und ich in Suzhou je einen Arbeitsplatz – heute ist bereits der vierte Arbeitstag. Es fühlt sich irgendwie magisch an, wieder zu arbeiten; wie cz sagt, „ein bisschen nostalgisch“. Für mich bedeutet es, dass ich Arbeits- und Freizeit deutlich trennen kann, was meine Konzentration verbessert – ich denke, das ist gut. Ein weiterer Vorteil: Zusammen mit Kollegen zu arbeiten fördert den Austausch von Ideen und Standpunkten. Es entstehen neue Gedanken, und engere Zusammenarbeit führt zu einem kohärenteren Produkt.
Was den Rest betrifft: Wir werden sehen.
Iteration von legion-mind
Ich habe gemerkt, dass legion-mind leicht vom Kurs abkommt und es ihm an einer „Brainstorming“-Fähigkeit mangelt. Also habe ich superpower heruntergeladen, genau studiert, die fortgeschrittenen Erkenntnisse daraus aufgesaugt und damit legion-mind weiterentwickelt.Diese Sache hat mein Tempo bei allen anderen Aufgaben deutlich verlangsamt. Stell dir vor, ich sei ein Holzfäller und legion-mind meine Axt. Jetzt schärfe ich die Axt, kann also nicht effizient Bäume fällen. Oft weiß ich nicht, in welchem Ausmaß und auf welche Weise eine Änderung die Fähigkeiten des gesamten Harness-Werkzeugs beeinflusst.
Daher brauche ich einen Benchmark. Letztes Mal wollte ich den SWE-Benchmark verwenden, aber das fühlte sich falsch an – ich teste nicht die Werkzeugnutzungsfähigkeit eines großen Sprachmodells (das kann das Modell bereits selbst), sondern ich brauche ein paar für mich verständliche und typische Beispiele, um es hinsichtlich Stabilität und Kreativität zu bewerten.
In letzter Zeit sehe ich oft, dass man das große Modell bittet, ein Skript zu generieren, das ein GIF von „einem Pelikan, der Fahrrad fährt“ erzeugt. Das nehme ich als Einstiegsinterviewfrage, zum Beispiel:
“Erzeuge mit TypeScript ein 512×512, 4 Sekunden, 24 fps, nahtloses GIF: Ein Pelikan fährt mit dem Fahrrad eine Küstenstraße entlang. Anforderungen: drei Ebenen (Himmel, Meer, Straße), Räder drehen sich kontinuierlich, Tretbewegung synchron mit Radgeschwindigkeit, leichter Auf- und Abbounce des Körpers, leichte Kopfbewegung. Unterstützung der Parameter --seed und --out.”Dann lasse ich das LLM mit diesem Harness-Werkzeug ein funktionierendes kleines Produkt erstellen – es soll die Anforderungen selbst verstehen, selbst entwerfen, implementieren und testen. Es soll mich dabei nicht stören, und am Ende schaue ich mir das Ergebnis an.
Als nächstes kommt die Fähigkeit des LLM, Daten zu verstehen und zu verarbeiten: Kann es eine CSV-Tabelle auswerten und daraus Erkenntnisse ableiten? Dazu habe ich noch keine klare Idee – das scheint wieder mehr die Fähigkeit des Modells zu testen als die des Harness-Werkzeugs.
Dann kommen Bugfixes und das Hinzufügen von Features.
Kurz gesagt: Es ist sehr schwer, Testfälle zu finden. Bisher habe ich die Fähigkeiten des Harness an echten Projekten geprüft und hoffte auf einen doppelten Nutzen. Aber in Wirklichkeit war das nur ein Beten, dass nichts schiefgeht. Jetzt möchte ich das Ganze wissenschaftlicher angehen.
cz arbeitet an AIM (AI Project Manager) – genau die Richtung, in die legion ursprünglich steuern sollte. Ich werde legion als Harness-Schicht in AIM einbetten.
Andere Dinge
Es gibt viele andere Vorhaben, die ich umsetzen möchte, aber noch nicht offiziell begonnen habe: zum einen die KI-gestützte Weiterentwicklung von 1earn, zum anderen das PMA-Sport-Arbitrage. Früher dachte ich, mit KI-Unterstützung könnte ich beides gleichzeitig bewältigen, aber jetzt merke ich, dass wirklich knapp meine Aufmerksamkeitsressourcen sind. Wenn ich mehrere wichtige Dinge gleichzeitig vorantreibe, verliere ich leicht den Überblick. Wie bereits in früheren Tagebucheinträgen geschrieben, kann ich wirklich nur 2–3 Dinge gleichzeitig tun.Im Zeitalter der KI kommt es vor allem auf das Management der eigenen Aufmerksamkeit an. Eigentlich müsste ich aktiv „Äste beschneiden“, meine Konzentration auf nur wenige Dinge lenken, nicht zu viel auf einmal, Aufgaben abschließen und dann neue in Angriff nehmen.
OKR habe ich bereits eingeführt, aber der Review-Prozess ist langsam. Manchmal bin ich einfach zu faul und verlange zu sehr nach einem „perfekten Arbeitszustand“. Wenn der nicht erreicht ist, fange ich an zu trödeln. Ich muss mit einem festen Tagesplan und Durchhaltevermögen diese selbst auferlegten Fesseln sprengen – genau wie der 82-Jährige, der jeden Tag um 4:30 Uhr ins Fitnessstudio geht und sagt: „Arbeite trotz Verletzung.“ (带伤工作).