2026-01-25
Hoy fui a cortarme el pelo, y al volver noté que el sistema estaba inestable. Al final resultó que Hermano Ji había iniciado dos terminalesid con el mismo servicio, compitiendo entre sí, lo que provocó un gran problema.
¿Qué hice hoy?
Intenté migrar el clúster detrás de una NAT, utilizando la nueva
legionpara ello. Mi procedimiento fue el siguiente:Primero modifiqué el clúster de kops, creé una nueva VPC usando los rangos 172.21.0.0/24 y 172.21.1.0/24. Luego creé una NAT para la salida de tráfico.
Originalmente pensé en usar el rango 10.0.x.x, pero al intentarlo descubrí que AWS no permite crear esa CIDR, así que cambié al rango 172.21.x.x. Hubo un detalle: en el recurso del clúster tuve que apuntar el load balancer existente a la nueva VPC (antes era implícito por defecto, pero al agregar una CIDR nueva hay que especificarlo manualmente).
Luego creé un nuevo grupo de instancias (instance group) apuntando a la nueva VPC. Hubo un pequeño contratiempo: el nuevo IG no tenía permisos de S3, no sé por qué. Lo agregué manualmente y los nodos se unieron al clúster sin problemas.
El siguiente paso fue migrar manualmente los servicios al nuevo IG.
Finalmente, eliminé el IG original.
Al terminar, descubrí que el tráfico de salida del clúster solo tenía una IP, lo que colapsó el servicio de limitación por IP. No tuve más remedio que revertir los cambios. Primero debo implementar el mecanismo de proxy HTTP antes de continuar.
El multi-agent se utilizó para crear un script que actualiza automáticamente el valor neto de Midas. Deepseek estuvo escribiendo durante bastante tiempo, y la verdad me quedé satisfecho. El problema central es que si cometo un error en el diseño temprano sin darme cuenta, me espera un desperdicio enorme de tokens y tiempo, porque noté que el agente no trabaja tan rápido.
Estos coding agents todavía son bastante primitivos; a menudo se caen o se cuelgan debido a problemas de red, etc. Para tareas serias de larga duración, el SLI es todavía insuficiente. Quizás esto sea una oportunidad: a simple vista creo que se necesita conocimiento de alta disponibilidad en ingeniería de software para que funcione.
¿Alguna idea?
Hoy tuve pocas ideas, las he ido escribiendo en línea dentro de la sección anterior.
¿Qué planeo hacer mañana?
- Diseñar el mecanismo de proxy HTTP de Yuan.
- Una vez implementado, volver a migrar el clúster.