guía interna · onboarding técnico

Este es el stack.
Y este es el porqué.

Bienvenido a HAILO. Construimos el ecosistema digital de otras empresas y le metemos agentes que lo operan — y para eso usamos estas herramientas. Aquí está cada una: qué hace, por qué la elegimos, cuándo no usarla y dónde está su documentación. Y también los modelos: cuál va en cada trabajo y qué cuesta. No es teoría: es lo que vas a tocar esta semana.

50

herramientas documentadas, 27 de ellas marcadas como base

23

modelos comparados: para qué sirve cada uno y qué cuesta

7

capas, de lo que ve el cliente hasta lo que avisa cuando algo truena

30

días para pasar de tu primer día a producción con tu nombre en el PR

última revisión: agosto 2026 · si algo aquí ya no es cierto, cámbialo en lib/stack.ts y abre PR

01 · las capas

Un proyecto de HAILO,
de arriba a abajo.

Casi todo lo que entregamos tiene esta forma. Cambian las piezas —a veces Convex, a veces Postgres— pero las preguntas son siempre las mismas siete.

01

Lo que el cliente ve

¿Qué ve y toca el cliente?

Next en Vercel, estilos con Tailwind y componentes de shadcn repintados con los tokens de HAILO. Rápido, en español y funcionando en el celular del director.

Next.jsReactTypeScriptTailwind CSSshadcn/uiMotion

02

Dónde vive la información

¿Dónde vive la información y quién la mueve?

Convex cuando queremos tiempo real y que el agente escriba directo; Postgres —vía Supabase o Neon— cuando el cliente necesita SQL y reportes. Nunca las dos por gusto.

ConvexSupabasePostgreSQLDrizzle ORMNeonUpstash Redis

03

Quién entra y a qué

¿Quién entra y a qué tiene derecho?

Clerk para producto nuevo; WorkOS cuando el corporativo pide SSO, SCIM y bitácora de auditoría. La sesión se valida en el servidor, sin excepción.

ClerkWorkOS

04

El agente que opera

¿Quién piensa y con qué herramientas trabaja?

Claude como cerebro, MCP para darle herramientas reales, el AI SDK para que responda en vivo y Zod para que lo que devuelve sea confiable antes de tocar la base.

Claude APIMCPAI SDKComposioZod

05

Cara y voz

¿Con qué cara y qué voz sale el agente?

ElevenLabs le pone voz, HeyGen le pone cara. Es lo que convierte una demo en algo que el cliente enseña en su junta de consejo.

ElevenLabsHeyGenDeepgramLiveKit

06

Por dónde llega

¿Por dónde llega el mensaje o la llamada?

WhatsApp es el canal principal en México, y a WhatsApp entramos por Kapso. Twilio o Telnyx cuando hay llamadas, SMS o números propios de por medio.

WhatsApp Business APIKapsoTwilioTelnyx

07

Que no se caiga

¿Dónde corre y cómo sabemos que no se cayó?

Vercel publica, GitHub guarda y revisa, Sentry avisa y PostHog mide. Sin esto, el proyecto no está terminado: está en el aire.

VercelGitHubBunSentryPostHogCloudflare

03 · los modelos

El cerebro se elige,
no se hereda.

La herramienta es la carrocería; el modelo es el motor. Casi siempre podemos cambiarlo con una línea, así que elegirlo bien es la decisión más barata y la que más se nota en la factura y en la cara del cliente.

si no sabes cuál

Para esto, este.

  • Agente que atiende clientes en WhatsAppClaude Sonnet 5Aguanta volumen sin que la conversación se sienta tonta, y cuesta la mitad que Opus.
  • Clasificar, extraer datos, enrutar mensajesClaude Haiku 4.5 o GPT-5.6 LunaSon centavos por millar de mensajes. Gastar Opus en esto es tirar dinero.
  • Código, refactor grande, migraciónClaude Opus 5 en Claude CodeEs donde más se nota la diferencia, y el error sale más caro que los tokens.
  • Segunda opinión cuando algo no cierraGPT-5.6 Sol vía CodexOtra cabeza, otros sesgos. Dos modelos que discrepan encuentran el bug.
  • Documentos, audio o video larguísimosGemini 3.7 FlashUn millón de contexto multimodal a precio de entrada bajo.
  • El dato no puede salir de la empresaQwen 3.6 o DeepSeek V4Pesos abiertos: corren en la infraestructura del cliente y nadie ve nada.
  • Voz en una llamada en vivoElevenLabs Flash v2.5Setenta y cinco milisegundos. Arriba de eso, la persona siente el hueco y habla encima.
  • Video con presentador para una demoHeyGen Avatar IVFoto más guion, sin estudio ni cámara.

Claude Opus 5

Anthropic

El caballo de batalla: agentes largos, código complicado, trabajo que no puede salir mal.

contexto1Musd / 1M$5 / $25
claude-opus-5

Nuestro default. Piensa por default y el esfuerzo se ajusta con effort (low a max); en tareas rutinarias, bajarlo cuesta menos y casi no se nota.

documentación ↗

Claude Sonnet 5

Anthropic

Calidad muy cercana a Opus por la mitad y con más velocidad.

contexto1Musd / 1M$3 / $15
claude-sonnet-5

El que va en producto de cara al cliente cuando el volumen pesa: chat, soporte, clasificación con criterio. Si la tarea es de verdad difícil, súbela a Opus.

documentación ↗

Claude Haiku 4.5

Anthropic

Lo barato y rápido: clasificar, extraer, resumir, enrutar.

contexto200Kusd / 1M$1 / $5
claude-haiku-4-5

Perfecto para el paso previo — “¿esto es una queja, una cotización o spam?” — antes de gastar un modelo caro. Ojo: 200K de contexto, no un millón.

documentación ↗

Claude Fable 5

Anthropic

El techo: razonamiento y trabajo autónomo de horas.

contexto1Musd / 1M$10 / $50
claude-fable-5

Se saca para lo que de plano no sale con Opus. Piensa siempre (no se puede apagar) y un turno puede tardar minutos: planea los timeouts. No es el default por precio.

documentación ↗

GPT-5.6 Sol

OpenAI

El tope de la familia GPT: lo más duro de código y análisis.

contexto1.05Musd / 1M$5 / $30
gpt-5.6-sol

Nuestra segunda opinión cuando Claude y nosotros nos atoramos en lo mismo. Dos modelos que discrepan encuentran el error más rápido que tú solo.

documentación ↗

GPT-5.6 Terra

OpenAI

El de todos los días de OpenAI: soporte, herramientas internas, documentos.

contexto1.05Musd / 1M$2 / $12
gpt-5.6-terra

Bajó de precio el 30 de julio. Buen punto medio si el cliente ya vive en el ecosistema de OpenAI.

documentación ↗

GPT-5.6 Luna

OpenAI

Volumen puro: resumir, redactar, automatizar lo repetitivo.

contexto1.05Musd / 1M$0.20 / $1.20
gpt-5.6-luna

Le bajaron 80% el 30 de julio y quedó ridículamente barato para tareas de a montón. Compite directo con Haiku.

documentación ↗

Gemini 3.7 Flash

Google

Rápido, con un millón de contexto y muy buen precio de entrada.

contexto1Musd / 1M$0.75 / $3.75
gemini-3.7-flash

Fuerte cuando hay que tragarse documentos, audio o video largo. Ese precio es promocional hasta el 31 de diciembre de 2026: después se duplica. No cotices a tres años con él.

documentación ↗

Gemini 3.1 Pro

Google

El hermano grande de Flash, para razonamiento y multimodal pesado.

contexto1Musd / 1M$2 / $12
gemini-3.1-pro

Entra cuando el cliente ya está casado con Google Cloud o Workspace y quiere todo bajo el mismo contrato.

documentación ↗

Grok 4.6

xAI

Agentes de larga duración y trabajo visual e interactivo.

contexto500K

En el radar, no en producción. Útil saber que existe cuando el cliente pregunta; hoy no tenemos nada nuestro corriendo ahí.

documentación ↗

Kimi K3

Moonshot AI

El mejor todoterreno de pesos abiertos: razonamiento, código y agentes largos.

contexto1M

Encabeza las tablas abiertas, pero pesa 2.8 billones de parámetros (~1.6 TB): no lo vas a correr en la laptop, y su licencia comercial hay que leerla antes de venderla.

documentación ↗

DeepSeek V4

DeepSeek

Código de nivel frontera a precio de risa; V4 Flash es el más barato de todos.

contexto1Musd / 1M$0.14 / $0.28

El Pro tiene el mejor resultado publicado de un modelo abierto en SWE-bench. El precio es de la API de DeepSeek: si el dato del cliente no puede salir del país, se autoaloja y ahí el costo es el GPU.

documentación ↗

Qwen 3.6

Alibaba

La familia más práctica: desde un 27B que corre en una GPU hasta el Plus para agentes.

contexto1M

Es el que recomendamos cuando el cliente quiere “su propia IA” dentro de su infraestructura. Licencia permisiva y tamaños para todos los bolsillos.

documentación ↗

GLM-5.2

Z.ai

Razonamiento y matemáticas; también código de horizonte largo.

contexto1M

La alternativa a Kimi cuando el trabajo es más de razonar que de ejecutar. Segundo lugar consistente en las tablas abiertas.

documentación ↗

Venice AI

Venice

Correr modelos abiertos sin que las conversaciones queden guardadas en ningún servidor.

No es un modelo: es la forma de usar Llama, Qwen, DeepSeek o Mistral con privacidad y sin filtros de producto. Se menciona cuando el cliente pregunta “¿y esto dónde queda guardado?”. Sin filtros también significa sin red: lo que salga es tu responsabilidad.

documentación ↗

Claude Code

Anthropic

El agente de terminal con el que trabajamos aquí, corriendo Opus 5.

Conoce el repo, sigue el CLAUDE.md y abre PRs. Es el default del equipo — no porque sea el único, sino porque es el que tiene nuestras convenciones escritas.

documentación ↗

GPT-5.6 Codex

OpenAI

El modelo detrás de Codex, afinado para agentes de programación.

Codex corre con la familia 5.6 desde julio. Es la segunda cabeza: cuando algo lleva una hora sin salir, se le pregunta a este.

documentación ↗

Composer 2.5

Cursor

El modelo propio de Cursor: rapidísimo y baratísimo por tarea.

No gana en las tareas más difíciles, pero para editar, renombrar y moverle a lo que ya está, el costo por tarea es una fracción de lo que cuesta un modelo de frontera.

documentación ↗

T3 Code

Theo · t3.gg

La interfaz para traer a Codex y a Claude Code trabajando en paralelo.

No trae modelo: pone pantalla y worktrees encima de los agentes que ya pagas. Útil el día que llevas tres tareas al mismo tiempo.

documentación ↗

Eleven v3

ElevenLabs

La voz más expresiva, con emoción y más de 70 idiomas.

Para lo que se graba una vez y se escucha mil: demos, cápsulas, contenido. En una llamada en vivo se siente lento.

documentación ↗

Flash v2.5

ElevenLabs

La voz de baja latencia (~75 ms) para agentes que contestan el teléfono.

Es la que va en tiempo real. Cambia expresividad por velocidad, y en una llamada la velocidad gana: 32 idiomas.

documentación ↗

Avatar IV

HeyGen

Una foto y un guion se vuelven video hablando, con gestos y labios que cuadran.

Es lo que convierte una demo en algo que el cliente enseña en su junta de consejo. Aguanta fotos de perfil y más de 175 idiomas. Con cara de una persona real: permiso por escrito, siempre.

documentación ↗

Avatar V

HeyGen

El más nuevo: separa la actuación de la apariencia.

Actúas tú y la cara puede ser otra, así que el gesto ya no depende de la foto. Todavía es la versión que estamos probando; para entrega a cliente, Avatar IV.

documentación ↗

Precios y nombres al corte de agosto de 2026, en dólares por millón de tokens (entrada / salida) y sin descuento por caché. Esto se mueve cada pocas semanas: antes de meterlo en una cotización, ábrele la documentación. Y el id del modelo vive en una variable de entorno — nunca escrito a mano en veinte archivos.

04 · cómo se elige

Dos caminos buenos.
Cuál tomamos y cuándo.

Ninguna de estas parejas tiene un ganador absoluto. Lo que sí hay es un criterio, y es el mismo para todos: qué necesita ese cliente, no qué se nos antoja probar.

¿Convex o Supabase?

Convex

Producto con agentes, tableros que se mueven solos y equipo chico. La lógica vive junto a los datos y no mantienes websockets.

vs
Supabase

El cliente necesita SQL de verdad: reportes, contabilidad, gente suya consultando la base, o migrar a otro Postgres el día de mañana.

¿Clerk o WorkOS?

Clerk

Producto nuevo, usuarios que se registran solos, organizaciones e invitaciones. Se resuelve en una tarde.

vs
WorkOS

El área de TI del corporativo manda requisitos: SSO con su proveedor, altas y bajas por SCIM, auditoría.

¿Kapso o la API de Meta a pelo?

Kapso

Casi siempre. Queremos el agente hablando esta semana, con el alta del número, los webhooks y el panel de entregas ya resueltos.

vs
WhatsApp directo

El cliente ya tiene su propio proveedor de WhatsApp, o su área de TI exige que el número y los mensajes no pasen por nadie más.

¿Twilio o Telnyx?

Twilio

Hay prisa, el volumen es normal y quieres documentación que resuelva sola. Cuesta más por mensaje y se paga solo en tiempo.

vs
Telnyx

Hay volumen alto en México y el costo por minuto o por mensaje ya pesa en la propuesta. Pide más manos para integrar.

¿Claude Code o Codex?

Claude Code

El día a día: conoce el repo, sigue el CLAUDE.md y trabaja con nuestras convenciones.

vs
Codex

Segunda opinión cuando algo se atora o para contrastar un diseño. Dos modelos discrepando encuentran el error más rápido que tú solo.

↳ ¿dudas? la decisión se toma en la junta técnica, no a media implementación

05 · reglas de la casa

Siete acuerdos
que no cambian con el stack.

Las herramientas se cambian cuando salga algo mejor. Esto no.

01

El cliente no compra software: compra que su operación jale

Antes de escribir una línea, ten claro qué proceso se arregla y cómo se va a medir. Si no lo puedes decir en una frase, todavía no entendiste el problema.

02

Si un agente lo puede operar, que lo opere

Todo lo que construimos se piensa para que un agente lo use: funciones con nombre claro, datos accesibles, herramientas expuestas por MCP. Ese es el negocio.

03

Los secretos van en .env, nunca en el repo ni en el chat

Ni en una captura, ni en Notion, ni pegados en Slack. Si se te escapó uno, se rota el mismo día y se avisa — sin drama, pero se avisa.

04

Nada llega al cliente sin liga de vista previa

Rama, PR, vista previa de Vercel. “En mi máquina sí funciona” no es una entrega y no se enseña en junta.

05

El código se escribe en inglés; la interfaz y los comentarios, en español

Variables y funciones en inglés porque así están las librerías. Lo que lee un humano —comentarios, textos, mensajes de error del usuario— en español claro, como el resto de este sitio.

06

La IA escribe, tú firmas

Usa Claude Code todo lo que quieras, pero el PR lleva tu nombre. Si no puedes explicar en junta por qué el código hace lo que hace, todavía no está listo para mandarse.

07

Preguntar rápido es más barato que atorarse elegante

Treinta minutos atorado y ya toca preguntar en el canal. Nadie aquí puntúa por sufrir en silencio.

06 · tus primeros 30 días

De tu primer día
a producción.

Palomea conforme avanzas. Se guarda en tu navegador y nadie más lo ve — sirve para que tú sepas qué te falta, no para calificarte.

avance— / 13

Día 1

0/4

Que la máquina esté lista y hayas tocado el código.

Semana 1

0/5

Entender cómo se arma un proyecto de punta a punta.

Mes 1

0/4

Entregar algo real, con tu nombre en el PR.

07 · glosario

Las palabras que vas a oír
en la primera semana.

Nadie nace sabiendo qué es un embedding. Aquí están, en cristiano.

Agente
Un modelo con herramientas y permiso para usarlas. La diferencia con un chat es que el agente ejecuta acciones, no solo contesta.
MCP
Model Context Protocol. El estándar para exponerle herramientas y datos a un modelo sin escribir una integración a la medida por cada cliente.
RAG
Recuperar primero, responder después: buscas los documentos relevantes y se los das al modelo en el prompt para que conteste con la información del cliente.
Embedding
Un texto convertido en números para poder compararlo por significado. Es lo que hace que “factura vencida” encuentre “pago pendiente”.
Webhook
Una URL tuya que otro sistema llama cuando pasa algo. Verifica siempre la firma y aguanta recibir el mismo evento dos veces.
Idempotente
Que correrlo dos veces da el mismo resultado que correrlo una. Obligatorio en cobros y en mensajes.
RSC
React Server Components: componentes que se pintan en el servidor y no mandan su JavaScript al navegador. El default en Next.
Serverless
Tu código corre solo cuando alguien lo llama y escala solo. A cambio: arranques en frío y nada de estado en memoria entre llamadas.
RLS
Row Level Security: reglas en Postgres que deciden qué filas puede ver cada usuario. Sin esto, Supabase enseña toda la tabla.
TTS y STT
Texto a voz y voz a texto. Las dos mitades de un agente que contesta el teléfono.
Ventana de 24 h
En WhatsApp, el tiempo que tienes para responder libre después de que el usuario escribe. Fuera de ahí, solo plantilla aprobada.
Rate limit
Tope de peticiones por usuario o por IP. Protege la factura de tokens y evita que alguien te tire el endpoint.
Vista previa
La URL que Vercel genera por cada PR. Es la forma correcta de enseñar trabajo sin publicarlo.
Token
La unidad con la que se cobra un modelo — más o menos tres cuartos de palabra. Cachear el prompt fijo baja la cuenta muchísimo.
Ventana de contexto
Cuánto le cabe al modelo en una sola conversación, contando lo que le mandas y lo que responde. Un millón de tokens son como diez libros; cuando se acaba, hay que resumir o cortar.
Pesos abiertos
Modelos cuyos archivos puedes descargar y correr en tu propia infraestructura — Qwen, DeepSeek, Kimi. Es la respuesta cuando el cliente dice que sus datos no salen de su casa. Abierto no siempre es gratis: revisa la licencia comercial.
Effort
La perilla de cuánto piensa el modelo antes de contestar, de low a max. Subirla cuesta tokens y tiempo; bajarla en tareas rutinarias casi no se nota y sí se ve en la factura.

antes de que te atores

Aquí nadie gana puntos por sufrir en silencio.

Media hora atorado en algo que otro ya resolvió es media hora que le cobramos al cliente sin darle valor. Pregunta en el canal correcto y sigue.

#ingenieria

Se atoró el código, la build o un despliegue.

#agentes

Prompts, herramientas, MCP y todo lo que huela a modelo.

#clientes

Dudas de alcance, de cuenta o de qué prometimos.

tu líder técnico

Accesos, decisiones de arquitectura y lo que te esté frenando.