Assistente Cognitiva Local-First & VTuber Companion

Automação Natural.
Privacidade Total.

A Lary combina conversação em linguagem natural, execução direta de comandos no Windows e inteligência artificial rodando na sua própria máquina. Inteligente, carismática e com personalidade marcante.

"Inteligente, sarcástica e carismática, ela está aqui para te ajudar, te motivar e deixar seu dia muito mais produtivo."
100% Processamento Local
0ms Privacidade de Dados
12+ Recursos Nativos
LARY ATIVA // WINDOWS CONECTADO
Lary Avatar Concept
Expressões Lary:

"Bora focar nesse projeto, gênio? 🙄"

Fundamentos e Arquitetura

Conceito

Visão Geral do Projeto

A Lary é uma assistente cognitiva desenvolvida para oferecer uma experiência de interação mais natural entre pessoas e computadores.


Seu foco é combinar conversação em linguagem natural, automação de tarefas e processamento local, preservando a privacidade do usuário e permitindo que a inteligência artificial participe ativamente do fluxo de trabalho diário. Diferente de assistentes convencionais que vivem na nuvem, a Lary se integra diretamente às APIs do Windows e aos modelos LLM locais (via Ollama), executando ações físicas no sistema sem depender de conectividade externa constante.

Interação Natural Processamento Local Fluxo de Trabalho Diário
Expandir
Desafio

O Problema que Busca Resolver

Grande parte das assistentes atuais responde perguntas, mas possui pouca capacidade de agir diretamente no computador do usuário.


A Lary foi criada para reduzir essa distância, permitindo que a IA compreenda solicitações em linguagem natural e execute tarefas locais quando apropriado, mantendo o processamento prioritariamente na máquina do usuário. Assistentes comerciais comuns são confinadas ao navegador e exigem que você execute manualmente cada passo. A Lary opera na camada do sistema operacional.

Assistentes Tradicionais
  • Dependência 100% da Nuvem
  • Apenas respostas de texto
  • Sem acesso ao sistema local
Lary AI Engine
  • Processamento 100% Local
  • Execução ativa no Windows
  • Compreensão de intenção
Expandir
Trajetória

História do Projeto

O projeto nasceu como um estudo sobre assistentes locais e evoluiu para uma plataforma completa voltada à automação e produtividade.


Desenvolvido com foco em pesquisa de inteligência artificial aplicada, o sistema cresceu de um simples protótipo de script Python para uma arquitetura desacoplada robusta. Seu desenvolvimento é incremental e prioriza modularidade, segurança e evolução contínua, permitindo acoplar novos módulos de fala, visão computacional e automações do Windows com facilidade.

01 Estudo de IA Local
02 Arquitetura FastAPI + Ollama
03 Plataforma Completa Local-First
Expandir
Vantagens

Diferenciais Exclusivos

A Lary prioriza processamento local, privacidade, automação do sistema operacional e continuidade de contexto.


Buscando oferecer uma experiência mais próxima de um assistente pessoal humano do que de um chatbot tradicional, a Lary combina percepção em tempo real com avatar VTuber e integração perfeita de áudio (VB-Cable). O usuário ganha uma parceira de trabalho diária que se lembra de contextos anteriores e reage visualmente a eventos.

Automação nativa do Windows
Avatar interativo VTube Studio
Roteamento de áudio profissional
Expandir

A Identidade Visual da Lary

Inspirada visualmente em Momo Ayase (Dandadan), combinando tom de pele moreno, brincos turquesa compridos e presença marcante na tela.

Lary Character Reference Sheet

Especificações do Modelo VTube Studio:

• Rigging completo para rastreamento de cabeça, corpo e cabelo.
• Sincronização labial adaptativa (Lipsync com TTS).
• Microexpressões: piscar, respirar, sobrancelhas e blushes dinâmicos.
• Paleta de cores: Preto obsidian, Vermelho carmim e Brinco turquesa (#00f2fe).

Expandir
Modo 1

Modo VTuber (Tela Cheia)

Modelo completo em tela ou overlay dedicado para lives, apresentações e interação imersiva de trabalho.


Neste modo, a Lary aparece em escala inteira (162 cm de referência), permitindo expressividade gestual máxima. Integração nativa com OBS Studio via VB-Cable para roteamento direto de voz e efeitos sonoros.

Expandir
Modo 2

Visão do Modelo (Frente, Lado, Costas, 3/4)

Modelo tridimensional articulado com 8 expressões faciais dinâmicas para transmissões e streaming.


Expressões disponíveis: Neutra, Falando, Sorrindo, Sarcástica, Pensando, Surpresa, Rindo e Irritada. O modelo reage instantaneamente aos comandos de áudio e às interações do usuário.

Expandir

Detalhes Técnicos & Funcionalidades

Explore todas as 12 funcionalidades atuais, ecossistema, stack de linguagens e os 5 princípios orientadores da Lary.

Funcionalidades Atuais do Sistema

12 Módulos Ativos no PDF

1. Conversação por Voz e Texto

Interface fluida bidirecional que aceita comandos de voz e digitação em tempo real.


Permite transição perfeita entre modo silencioso (chat) e modo fala (voz contínua), utilizando pipelines otimizados de baixa latência.

Expandir

2. Pesquisa Web em Tempo Real

Capacidade de consultar a internet dinamicamente quando o conhecimento local precisar de atualização.


A Lary decide autonomamente quando buscar fontes online para entregar respostas sobre notícias recentes, clima ou documentações de código.

Expandir

3. Controle de Aplicações Locais

Automação direta de softwares essenciais: Navegador, VS Code, Explorador e Bloco de Notas.


Executa abertura de arquivos, criação de notas rápidas, navegação por abas e manipulação de diretórios sem intervenção manual.

Expandir

4. Percepção Visual da Tela

Captura contextual da tela para apoio visual na solução de problemas e interpretação de UI.


Utiliza OpenCV e Pillow para analisar frames da tela do usuário, identificando erros de código, layouts ou formulários em tempo real.

Expandir

5. Integração Diálogo-Execução

A Lary conversa sobre a tarefa enquanto a executa no fundo do sistema operacional.


Garante feedback auditivo e visual contínuo ao usuário enquanto scripts, compilações ou automações locais estão em andamento.

Expandir

6. Voz em Tempo Real (WebSockets)

Streaming duplex de dados de áudio para baixa latência de resposta durante conversas.


Elimina o atraso tradicional de APIs HTTP síncronas, permitindo interrupções naturais na fala da assistente.

Expandir

7. Integração VB-Cable

Roteamento de áudio profissional compatível com OBS Studio, Discord e plataformas de transmissão.


Isola a saída de áudio sintético da Lary em um dispositivo virtual, facilitando a captura limpa para streamers e criadores de conteúdo.

Expandir

8. Interface Web de Acompanhamento

Dashboard web intuitivo para monitorar chats, logs de automação e métricas do sistema.


Exibe em tempo real os eventos disparados, requisições de API local e permite inspeção detalhada de memória.

Expandir

9. Reconhecimento & Síntese (STT/TTS)

Transformação instantânea de fala em texto e geração de voz sintética expressiva.


Modelos locais otimizados de síntese que refletem as emoções e o tom característico da personagem Lary.

Expandir

10. APIs Nativas do Windows

Comunicação profunda com subprocessos, gerenciador de janelas e sistema de arquivos do Windows.


Utiliza hooks nativos para focar janelas, manipular atalhos do teclado e executar programas sem depender de softwares de terceiros.

Expandir

11. Pesquisa Web em Tempo Real

Extração automatizada de snippets e artigos relevantes diretamente no fluxo de conversa.


Filtra e sumariza conteúdos complexos da web antes de apresentar os pontos-chave ao usuário.

Expandir

12. Memória Contextual Contínua

Retenção de histórico e preferências do usuário para continuidade de interações longas.


Armazena em banco de dados local o contexto do projeto atual, evitando repetições desnecessárias.

Expandir
Módulo NLU

Compreensão de Linguagem Natural Flexível

A Lary interpreta a intenção do usuário em vez de depender de frases exatas ou comandos rígidos.


Diferente de sistemas legados que exigem sintaxe estrita (ex: exec open_browser --target google), a Lary compreende variações coloquiais do dia a dia e mapeia para a mesma ação subjacente no Windows:

"Abra o Google"
"Entre no navegador"
"Quero pesquisar uma coisa"
Mapeado para: Ação Única -> LaunchBrowser(default_search)
Expandir

Stack Tecnológico

Python 3.11+ Linguagem Core

Utilizado para orquestração de threads, processamento assíncrono e controle das bibliotecas de IA.

FastAPI & WebSockets Servidor Backend

Prover endpoints REST de altíssima velocidade e comunicação em tempo real via canal duplex.

Ollama (Local LLM) Motor de Linguagem

Executa modelos como Llama 3, DeepSeek R1 e Mistral 100% offline no hardware do usuário.

OpenCV & Pillow Visão Computacional

Leitura de tela, pré-processamento de frames e detecção de elementos gráficos da UI.

Pygame-ce & Win32 APIs Áudio & SO

Gerenciamento de áudio com baixa latência e controle direto das janelas nativas do Windows.

Princípios & Limitações

5 Princípios Orientadores

  • Local-first sempre que possível: Máxima autonomia sem nuvem.
  • Privacidade do usuário: Nenhum dado pessoal é transmitido a terceiros.
  • Linguagem natural acima de comandos rígidos: Flexibilidade total.
  • Evolução modular: Módulos desacoplados fáceis de expandir.
  • Automação segura: Execução controlada com confirmação quando necessário.
Expandir

Limitações Atuais do Projeto

  • Hardware Compatível: Requer GPU/RAM adequada para modelos LLM locais maiores.
  • Plataforma Principal: Otimizado prioritization para o ecossistema Windows.
  • Catálogo de Automações: Em expansão contínua para novas aplicações.
Expandir

Roadmap Público & O Futuro da Lary

Acompanhe as 5 etapas de desenvolvimento planejadas para transformar a Lary em uma assistente autônoma multi-etapas.

1
Fase 1

Evolução das Capacidades de Voz

Aprimoramento contínuo da síntese e reconhecimento de fala (TTS/STT).


Introdução de síntese emocional adaptativa com modulação de tom em tempo real, redução adicional de latência para menos de 200ms e melhor isolamento de ruído ambiente durante a captação de voz.

Expandir
2
Fase 2

Expansão da Percepção Visual

Evolução da interpretação de tela para suporte multimodal completo.


Integração com modelos VLM (Vision Language Models) locais, permitindo que a Lary leia diagramas, identifique botões de interfaces complexas sem depender de OCR tradicional e compreenda vídeos em tempo real.

Expandir
3
Fase 3

Novas Integrações e Automações

Ampliação do catálogo de suporte para softwares de terceiros e APIs locais.


Expansão das capacidades de controle para softwares de edição (Photoshop, Premiere), suítes de escritório (Excel, Word), ferramentas de comunicação (Discord, Slack) e suporte a scripts Python dinâmicos gerados pela própria IA.

Expandir
4
Fase 4 - Marco Principal

Agentes Capazes de Executar Planos de Múltiplas Etapas

Autonomia para decompor objetivos complexos em sub-tarefas encadeadas.


A Lary deixará de executar apenas comandos pontuais para planejar e realizar fluxos de trabalho completos (ex: "Baixe este relatório, extraia a tabela em CSV, abra no Excel e crie um gráfico resumo") de forma 100% autônoma e com auto-correção de erros.

Expandir
5
Fase 5

Interface Gráfica Mais Imersiva

Interface de usuário holográfica e integração profunda no desktop.


Transição para overlays 3D em tempo real com física avançada, animações procedurais e personalização completa de cenários, transformando a Lary em uma presença visual impressionante no seu monitor.

Expandir

Perguntas Frequentes sobre o Projeto

A Lary precisa de internet para funcionar?

Não para o núcleo! Por ser Local-First, a conversação, a automação do Windows e o raciocínio da IA rodam inteiramente na sua máquina via Ollama. A conexão só é utilizada se você solicitar pesquisas na web em tempo real.

Expandir

Como funciona a integração com o VTube Studio?

A Lary se comunica via WebSocket com a API oficial do VTube Studio ou utiliza sprites procedurais em Pygame-ce para alternar expressões faciais (Neutra, Sorrindo, Sarcástica, etc.) em tempo real durante a fala.

Expandir

Quais são os requisitos mínimos de sistema?

Recomenda-se Windows 10/11 64-bit, processador quad-core+, 16GB de RAM e uma GPU com pelo menos 6GB de VRAM (NVIDIA RTX) para rodar modelos LLM locais (Llama3/Mistral/DeepSeek) com excelente fluidez.

Expandir
PROJETO DE PORTFÓLIO DE ENGENHARIA DE IA

Interessado nesta Arquitetura Cognitiva?

Este projeto foi projetado para demonstrar expertise em automação local, integração de LLMs offline, interfaces modernas e arquitetura desacoplada em Python.