2026-01-25
Heute bin ich zum Friseur gegangen. Als ich zurückkam, stellte ich fest, dass das System instabil war. Letztendlich lag es daran, dass Jige zwei Terminalsid mit demselben Dienst gestartet hatte, die sich gegenseitig übernommen haben, was zu einem großen Problem führte.
Was ich heute gemacht habe:
Ich habe versucht, den Cluster hinter eine NAT zu migrieren, natürlich mit der brandneuen Legion. Mein Vorgehen war:
Zunächst änderte ich den kops‑Cluster, erstellte ein neues VPC mit den Subnetzen 172.21.0.0/24 und 172.21.1.0/24. Dann erstellte ich eine NAT für den ausgehenden Datenverkehr.
Eigentlich hatte ich einen Bereich mit 10.0 vorne geplant, aber nach einem Versuch stellte ich fest, dass AWS diesen CIDR nicht erlaubt, also änderte ich ihn auf 172.21. Dabei gab es eine Falle: In der Cluster‑Ressource muss der vorhandene Loadbalancer auf das entsprechende VPC verweisen (normalerweise implizit standardmäßig zugewiesen, jetzt muss man wegen des zusätzlichen CIDR manuell angeben).
Dann erstellte ich eine neue Instance Group, die auf das neue VPC zeigt. Es gab einen kleinen Zwischenfall: Die neue IG hatte keine S3‑Berechtigungen – aus irgendeinem Grund. Nach manuellem Hinzufügen traten die Knoten normal dem Cluster bei.
Der nächste Schritt war, die Dienste manuell in die neue IG zu migrieren.
Schließlich entfernte ich die ursprüngliche IG.
Als alles erledigt war, stellte ich fest, dass der gesamte ausgehende Verkehr des Clusters nur eine einzige IP hatte, was unseren IP‑ratenbegrenzten Dienst ziemlich überforderte. Ich musste das Rollback durchführen und zuerst die HTTP‑Proxy‑Fähigkeiten entwickeln, bevor ich weitermachen konnte.
Multi‑Agent wurde verwendet, um ein Skript zur automatischen Aktualisierung des Midas‑Nettowerts zu praktizieren. DeepSeek hat lange daran gearbeitet, und ich bin recht zufrieden. Das Kernproblem dabei ist: Wenn ich früh im Entwurf einen Fehler übersehe, erwartet mich eine enorme Verschwendung von Token und Zeit, da ich festgestellt habe, dass die Agenten nicht besonders schnell arbeiten.
Derzeit sind diese Coding‑Agenten noch recht primitiv. Sie stürzen oft aufgrund von Netzwerkproblemen ab. Es ist noch etwas schwierig, sie für ernsthafte langlaufende Arbeiten einzusetzen – der SLI ist noch nicht gut genug. Das könnte auch eine Chance sein, aber es erfordert Kenntnisse in Softwareentwicklung und Hochverfügbarkeit, um zu funktionieren.
Was ich denke:
Heute hatte ich nicht viele Gedanken; sie sind alle inline in den obigen Abschnitten geschrieben.
Was ich morgen vorhabe:
- Das HTTP‑Proxy‑Mechanismus von Yuan entwerfen.
- Nach dem Deployment den Cluster erneut migrieren.