Concepto

Agentes de IA local-first

Un agente de IA local-first corre en tu propio equipo, no en la nube de un proveedor. Aquí explicamos qué significa, cómo se compara con las configuraciones en la nube y autoalojadas, y por qué importa para la privacidad, los costos y el control.

¿Qué partes corren realmente en local?

Lo local-first no va solo de dónde arranca un programa. Un agente tiene cuatro piezas móviles: el bucle de control que planifica y decide, la memoria que acumula, las herramientas que ejecuta y el modelo de lenguaje con el que piensa. Con Veyllo (VAF), las tres primeras corren siempre en tu hardware. El modelo es el único punto donde eliges entre local y alojado. Esa separación es toda la diferencia con un agente en la nube, donde las cuatro están en manos del proveedor.

La diferencia

Nube, autoalojado y local-first

Tres formas de ejecutar un agente, y dónde viven tus datos en cada una.

Agente en la nube

Corre por completo en los servidores de un proveedor. Cómodo para empezar, pero tus datos, tu contexto y tus claves viven con él — y el interruptor también: una caída, un cambio de condiciones o una cuenta suspendida detienen al agente, sea cual sea el motivo.

Agente autoalojado

Corre en infraestructura que tú operas, normalmente un servidor que administras. El control está de tu lado, pero el servidor también: correrlo y mantenerlo es cosa tuya.

Agente local-first

Corre en tu propio equipo, en su propia ventana. El instalador prepara el servidor local y la cuenta por ti, y tus datos se quedan contigo. Sin infraestructura remota que aprovisionar ni mantener. Así funciona Veyllo por defecto.

Lo local-first y lo autoalojado se solapan: en ambos el control está de tu lado. Local-first significa, en concreto, que el agente corre donde tú estás, en tu dispositivo. Con Veyllo puedes ambas cosas: correr en local, o autoalojar el harness en tu propio servidor.

Local no significa individual

Un host, todo tu equipo.

Local-first no significa una sola persona. Hasta la aplicación de escritorio se abre a tu red con un interruptor, sin instalación de servidor aparte. Tu equipo, una máquina libre en casa o un servidor de la empresa se convierte en el host, y todos en la red local llegan por HTTPS.

Server
Compartir con un interruptor. Activa el conmutador en la aplicación (o ejecuta vaf server on) y VAF queda accesible en tu red por HTTPS. Basta una instalación de escritorio normal; no hace falta un servidor aparte.
Una cuenta para cada quien. Cada persona tiene su espacio aislado: memoria, tareas y preferencias separadas. Nadie ve lo de los demás.
Sin suscripción por usuario. Una sola instancia atiende a todo el equipo o el hogar. La corres una vez, en vez de pagar por cada persona.
Por qué importa

Lo que ganas con esto.

Prompts que nunca viajan. Un texto que no sale del equipo no puede registrarse, retenerse, usarse para entrenar ni entregarse ante una petición. Con un modelo local eso cubre toda la cadena de procesamiento, no solo el almacenamiento.
Ningún proveedor entre tú y tu trabajo. Nadie puede subir precios, jubilar el modelo del que dependes, cambiar los límites ni suspender una cuenta. Una configuración que funciona hoy funciona el año que viene, con los mismos pesos del modelo.
Electricidad en vez de tokens. Un modelo local no tiene factura por token. Los contextos largos, las ejecuciones repetidas y los lotes nocturnos cuestan lo mismo que un equipo en reposo — eso es lo que hace asequibles las tareas programadas y de varios pasos.
Funciona sin conexión. En un tren o en una red cerrada, el agente sigue con un modelo local — memoria y archivos incluidos.
La única decisión real

¿Modelo local o modelo alojado?

Todo lo demás en un agente local-first ya está resuelto. Esta es la decisión que de verdad te toca — y puede cambiarse después.

Modelo local. Corre en tu propia GPU o CPU. Nada sale del equipo y no hay factura por token; la velocidad y la calidad siguen al hardware. Los modelos pequeños llevan bien los borradores, resúmenes y archivos del día a día; el razonamiento exigente pide una GPU potente.
Modelo alojado. El agente sigue corriendo en local; solo la llamada al modelo sale. Así los modelos de frontera quedan al alcance sin comprar hardware, facturados por token; el prompt y los archivos adjuntos llegan al proveedor del modelo.
Ambos, según la tarea. La mayoría de configuraciones acaba mixta: el modelo local para lo rutinario y lo confidencial, uno alojado para los casos difíciles. Cambiar es una línea de configuración, así que la elección nunca es definitiva.
Cómo lo hace Veyllo

Lo que Veyllo pone encima del modelo.

Veyllo convierte un modelo de lenguaje en un agente que trabaja en local: una memoria vectorial persistente que recuerda entre sesiones, un juego completo de herramientas (web, código, archivos, navegador) más todo lo que conectes por MCP, subagentes en los que delegar, y ejecución de código en un sandbox. Córrelo con un modelo local, o apúntalo a la API de Veyllo, compatible con OpenAI, cuando quieras un backend en la nube. Código abierto, AGPL-3.0, con licencia comercial disponible.

Preguntas frecuentes

Preguntas, respondidas.

¿Qué es un agente de IA local-first?

El bucle de control, la memoria y las herramientas corren en tu dispositivo; solo el modelo puede estar en otra parte, si eliges uno alojado. Un agente en la nube pone todo eso en los servidores del proveedor, incluido el contexto de cada solicitud.

¿Un agente local-first es lo mismo que autoalojar?

Coinciden en quién tiene el control, no en dónde ocurre el trabajo. Autoalojar traslada el software a un servidor que administras; local-first lo pone en el equipo frente a ti, sin servidor que aprovisionar. Veyllo hace ambas cosas, y el host autoalojado puede atender a un equipo entero.

¿Necesito enviar mis datos a la nube para usar Veyllo?

No. Veyllo es local-first: puedes ejecutar el agente por completo en tu equipo, modelos incluidos. La API de Veyllo alojada es opcional: aporta los modelos que VAF usa (texto, visión y voz) si prefieres no correr los tuyos.

¿Puede más de una persona usar una sola instalación de Veyllo?

Sí. Activa el uso compartido en red y VAF queda accesible en tu red local por HTTPS, incluso desde una instalación de escritorio normal. Cada quien tiene su cuenta con memoria y tareas aisladas; un solo host atiende a todos sin suscripción por usuario.

¿Puedo usar el SDK de OpenAI con la API de Veyllo?

Sí. La API de Veyllo es compatible con OpenAI. Apunta cualquier SDK de OpenAI o cliente HTTP a api.veyllo.app/v1 y usa tu clave de Veyllo. Se admiten chat y visión.

¿Puedo construir mis propios agentes de IA con VAF?

Sí. VAF está en PyPI: pip install --pre vaf instala el núcleo, y sobre el framework construyes tus propios agentes, herramientas y soluciones, incluido tu propio harness. Los extras como el servidor o la pila de memoria se instalan igual, y la guía de integración de la documentación de VAF te lleva paso a paso. El flag --pre hace falta mientras VAF está en alfa.

¿Qué licencia usa Veyllo?

El Veyllo Agentic Framework (VAF) tiene doble licencia: AGPL-3.0 para el uso de código abierto, más una licencia comercial para equipos que necesitan otras condiciones.

¿Qué sistemas operativos admite Veyllo?

Veyllo corre en macOS, Windows y Linux: como aplicación de escritorio, en un servidor o desde la terminal.

Agentes de IA local-first, explicados · Veyllo