2026-04-23

Ha pasado casi otro mes y vuelvo a escribir. ¡El tiempo vuela! 😭

Casi he olvidado cómo escribir. Escribiré sobre lo que recuerde sobre la marcha.

  1. Puesto de trabajo
    Solicité el programa de liderazgo de Suzhou, y gracias a eso conocí al hermano mayor Liang, exalumno de mi escuela tres años mayor que yo, que se encarga de atraer inversiones en SISPARK. Él nos presentó los puestos de trabajo compartidos OPC en el Parque de Economía Digital Dushu Lake, cerca de mi casa. Los primeros tres meses son gratuitos, y a partir del cuarto mes se cobrarían 500 CNY por persona al mes, aunque al parecer podría ser gratis.

    Después de oírlo, PGW se mostró muy interesado y también se unió. Así que en Suzhou, Cz, PGW y yo tenemos cada uno un puesto de trabajo. Hoy es el cuarto día trabajando allí. La sensación de volver al trabajo es un poco extraña, como dijo Cz: «un poco nostálgico». Para mí, significa poder distinguir claramente entre el estado de trabajo y el de no trabajo, lo que me ayuda a concentrarme mejor. Creo que es positivo. Otra ventaja es que trabajar con colegas facilita el intercambio de ideas y puntos de vista. Pueden surgir nuevas ideas y una colaboración más estrecha significa un producto más cohesionado.

    En cuanto a otras cosas, ya veremos cómo evoluciona.

  2. Iteración de legion-mind
    Siento que legion-mind tiende a desviarse y carece de capacidad de lluvia de ideas. Por eso, cloné y estudié a fondo superpower, absorbí sus buenas prácticas, y las estoy usando para iterar legion-mind.

    Esto ha ralentizado notablemente mi ritmo para hacer cualquier otra cosa, porque imagina que soy un leñador y legion-mind es mi hacha. Si estoy afilando el hacha, no puedo cortar árboles con eficiencia. Muchas veces no sé en qué medida ni de qué manera un cambio mío afecta a las capacidades de todo el harness.

    Por eso necesito un benchmark. La última vez quise usar el benchmark de SWE, pero siento que me desvié: no se trata de probar la capacidad de las grandes herramientas modelo —eso ya lo hacen ellos—, sino de construir algunos ejemplos típicos que pueda entender y evaluar desde dos aspectos: estabilidad y creatividad.

    Últimamente he visto a menudo pedirle a un gran modelo que genere un script para crear un GIF de «un pelícano montando en bicicleta». Lo tomaré como una prueba de entrevista, por ejemplo:

    "Genera un GIF en TypeScript de 512x512, 4 segundos, 24 fps, bucle sin fin: un pelícano andando en bicicleta por una carretera costera. Se requiere un fondo de tres capas (cielo, mar, carretera), las ruedas girando continuamente, el movimiento de pedaleo sincronizado con la velocidad de las ruedas, un ligero balanceo vertical del cuerpo y un pequeño movimiento de la cabeza. Soporta los parámetros --seed y --out."
    

    Luego, que el LLM use este conjunto de herramientas Harness para construir un pequeño producto funcional, que entienda los requisitos por sí mismo, diseñe, implemente, pruebe y no me moleste en el proceso; al final veremos el resultado.

    Después, la comprensión y el procesamiento de datos por parte del LLM: ¿procesar un CSV y extraer información? Aún no lo he pensado bien, parece que volvemos a probar la capacidad del modelo grande, no la del harness.

    Luego, corregir errores y añadir funciones.

    En resumen, pensar en casos de prueba es difícil. Antes probaba la capacidad del harness en proyectos reales, esperando matar dos pájaros de un tiro. Pero esa práctica en realidad es como rezar para que nada salga mal. Ahora quiero hacerlo de una forma más científica.

    Cz está desarrollando AIM (AI Project Manager), que es precisamente la dirección hacia la que Legion quería ir. Voy a integrar Legion como capa de harness de AIM.

  3. Otras cosas
    Hay muchas otras cosas que quiero hacer pero que todavía no he empezado formalmente: una es la operativización con IA de 1earn, y otra es el arbitraje deportivo de PMA. Antes pensaba que con la ayuda de la IA podría ocuparme de ambas, pero ahora veo que lo realmente escaso es mi atención. Al avanzar en varias tareas importantes a la vez, probablemente descuide unas por otras. Como ya mencioné en diarios anteriores, lo máximo que puedo hacer simultáneamente son 2 o 3 cosas.

    En la era de la IA, lo más importante es la gestión de la atención humana. Quizá necesito podar activamente, centrar mi atención solo en unas pocas cosas a la vez, no demasiadas, y cerrar una antes de empezar otra.

    Ya he puesto en marcha OKR, pero el proceso de revisión es lento. A veces soy demasiado vago y anhelo demasiado ese «estado de trabajo perfecto», de modo que si no es perfecto empiezo a holgazanear. Debo romper esta atadura autoimpuesta con horarios y constancia. Como decía ese señor de 82 años que sigue yendo al gimnasio a las 4:30 a. m.: «trabajar con heridas».