Conceito

Agentes de IA local-first

Um agente de IA local-first roda no seu próprio computador, não na nuvem de um fornecedor. Aqui explicamos o que isso significa, como se compara às configurações em nuvem e auto-hospedadas, e por que importa para privacidade, custos e controle.

O que roda de fato localmente?

Local-first não é só sobre onde um programa inicia. Um agente tem quatro peças móveis: o loop de controle que planeja e decide, a memória que se acumula, as ferramentas que ele executa e o modelo de linguagem com que pensa. Com o Veyllo (VAF), as três primeiras rodam sempre no seu hardware. O modelo é o único ponto em que você escolhe entre local e hospedado. Essa divisão é toda a diferença para um agente na nuvem, onde as quatro ficam com o fornecedor.

A diferença

Nuvem, auto-hospedado e local-first

Três jeitos de rodar um agente, e onde os seus dados moram em cada um.

Agente na nuvem

Roda inteiramente nos servidores de um provedor. Fácil de começar, mas seus dados, contexto e chaves moram com ele — e o interruptor também: uma queda, uma mudança de termos ou uma conta suspensa param o agente, seja qual for o motivo.

Agente auto-hospedado

Roda em infraestrutura que você opera, geralmente um servidor que você administra. O controle fica do seu lado, mas o servidor também: rodar e manter é com você.

Agente local-first

Roda no seu próprio computador, em sua própria janela. O instalador prepara o servidor local e a conta para você, e os dados ficam com você. Nenhuma infraestrutura remota para provisionar ou manter. É assim que o Veyllo funciona por padrão.

Local-first e auto-hospedado se sobrepõem: nos dois, o controle está do seu lado. Local-first significa, especificamente, que o agente roda onde você está, no seu aparelho. Com o Veyllo dá para os dois: rodar localmente, ou auto-hospedar o harness no seu próprio servidor.

Local, não individual

Um host, o seu time inteiro.

Local-first não quer dizer uma pessoa só. Até o aplicativo desktop se abre para a rede com um interruptor, sem instalação de servidor à parte. Seu computador, uma máquina sobrando em casa ou um servidor da empresa vira o host, e todos na rede local chegam por HTTPS.

Server
Compartilhar é um interruptor. Vire a chave no aplicativo (ou rode vaf server on) e o VAF fica acessível na sua rede por HTTPS. Uma instalação desktop comum basta; não precisa de servidor à parte.
Uma conta para cada pessoa. Cada um tem seu espaço isolado: memória, tarefas e preferências separadas. Ninguém vê o dos outros.
Sem assinatura por usuário. Uma única instância atende o time ou a casa inteira. Você roda uma vez, em vez de pagar por pessoa.
Por que importa

O que você ganha com isso.

Prompts que nunca viajam. Um texto que não sai do computador não pode ser registrado, retido, usado para treino nem entregue sob demanda. Com um modelo local, isso cobre toda a cadeia de processamento, não só o armazenamento.
Nenhum fornecedor entre você e o seu trabalho. Ninguém pode subir preços, aposentar o modelo de que você depende, mudar limites de taxa nem suspender uma conta. Uma configuração que funciona hoje funciona no ano que vem, com os mesmos pesos de modelo.
Eletricidade em vez de tokens. Um modelo local não tem conta por token. Contextos longos, execuções repetidas e lotes madrugada adentro custam o mesmo que uma máquina parada — é isso que torna viáveis as tarefas agendadas e de várias etapas.
Funciona sem conexão. No trem ou numa rede fechada, o agente segue com um modelo local — memória e arquivos inclusos.
A única escolha de verdade

Modelo local ou modelo hospedado?

Todo o resto num agente local-first já está resolvido. Esta é a decisão que é sua de fato — e dá para mudar depois.

Modelo local. Roda na sua GPU ou CPU. Nada sai do computador e não há conta por token; velocidade e qualidade seguem o hardware. Modelos pequenos dão conta de rascunhos, resumos e arquivos do dia a dia; raciocínio pesado pede uma GPU forte.
Modelo hospedado. O agente continua rodando localmente; só a chamada ao modelo sai. Modelos de ponta ficam ao alcance sem comprar hardware, cobrados por token; o prompt e os arquivos anexados chegam ao provedor do modelo.
Os dois, trocando por tarefa. A maioria das configurações acaba mista: o modelo local para a rotina e o confidencial, um hospedado para os casos difíceis. Trocar é uma linha de configuração, então a escolha nunca é definitiva.
Como a Veyllo faz

O que a Veyllo coloca em cima do modelo.

A Veyllo transforma um modelo de linguagem em um agente que trabalha localmente: uma memória vetorial persistente que lembra entre sessões, um conjunto completo de ferramentas (web, código, arquivos, navegador) mais tudo o que você conectar via MCP, subagentes para delegar, e execução de código em sandbox. Rode com um modelo local, ou aponte para a API da Veyllo, compatível com OpenAI, quando quiser um backend na nuvem. Código aberto, AGPL-3.0, com licença comercial disponível.

Perguntas frequentes

Perguntas, respondidas.

O que é um agente de IA local-first?

O loop de controle, a memória e as ferramentas rodam no seu aparelho; só o modelo pode ficar em outro lugar, se você escolher um hospedado. Um agente na nuvem coloca tudo isso nos servidores do fornecedor, incluindo o contexto de cada solicitação.

Agente local-first é o mesmo que auto-hospedagem?

Coincidem em quem tem o controle, não em onde o trabalho acontece. Auto-hospedar move o software para um servidor que você administra; local-first coloca-o na máquina à sua frente, sem servidor para provisionar. O Veyllo faz os dois, e o host auto-hospedado atende um time inteiro.

Preciso mandar meus dados para a nuvem para usar o Veyllo?

Não. O Veyllo é local-first: você pode rodar o agente inteiramente no seu computador, modelos inclusos. A API da Veyllo hospedada é opcional: ela fornece os modelos que o VAF usa (texto, visão e voz) se você preferir não rodar os seus.

Mais de uma pessoa pode usar uma única instalação do Veyllo?

Sim. Ative o compartilhamento em rede e o VAF fica acessível na sua rede local por HTTPS, mesmo a partir de uma instalação desktop comum. Cada pessoa tem sua conta com memória e tarefas isoladas; um único host atende todo mundo, sem assinatura por usuário.

Posso usar o SDK da OpenAI com a API da Veyllo?

Sim. A API da Veyllo é compatível com OpenAI. Aponte qualquer SDK da OpenAI ou cliente HTTP para api.veyllo.app/v1 e use a sua chave da Veyllo. Chat e visão são suportados.

Posso construir meus próprios agentes de IA com o VAF?

Sim. O VAF está no PyPI: pip install --pre vaf instala o núcleo, e sobre o framework você constrói seus próprios agentes, ferramentas e soluções — incluindo o seu próprio harness. Extras como o servidor ou a pilha de memória instalam-se do mesmo jeito, e o guia de integração na documentação do VAF acompanha passo a passo. A flag --pre é necessária enquanto o VAF está em alfa.

Qual é a licença do Veyllo?

O Veyllo Agentic Framework (VAF) tem licença dupla: AGPL-3.0 para uso em código aberto, mais uma licença comercial para times que precisam de outras condições.

Quais sistemas operacionais são suportados?

O Veyllo roda no macOS, Windows e Linux — como aplicativo desktop, num servidor ou pelo terminal.

Agentes de IA local-first, explicados · Veyllo