Todas as mudanças notáveis neste projeto serão documentadas neste arquivo.
- Segmentação Semântica (Context Bubbles): Implementação da Double-Call Architecture. O motor agora é capaz de fatiar mensagens complexas com múltiplas intenções em bolhas de contexto independentes.
- Isolamento de Contexto: Cada bolha é processada individualmente, prevenindo alucinações de contexto cruzado e garantindo respostas mais precisas.
- Reconciliação Estruturada: Novo motor de síntese que agrupa as respostas das bolhas em um único payload JSON estruturado.
- Campo
thinking: Suporte para exibição do raciocínio interno da LLM separadamente da resolução final no JSON de saída.
- Parser de JSON Indestrutível: Implementada busca robusta por delimitadores
{e}para suportar modelos de raciocínio (como DeepSeek R1) que enviam rascunhos de pensamento (<think>) fora do JSON. - Tolerância a Falhas (Fallback): Sistema de Block Recovery que consolida a mensagem em um único bloco caso o fatiamento enfrente timeouts ou erros críticos.
- NVIDIA NIM Integration: Otimização do roteamento LiteLLM para modelos NVIDIA, com timeouts ajustados para 90s para suportar inferências de alta complexidade.
- Remoção de referências legadas ao namespace
engine_v3. - Padronização do contrato
InboundMessagecom obrigatoriedade desession_ideuser_id. - Correção de transições de estado duplicadas na FSM do Orchestrator.
- Lançamento inicial da Engine V3.
- Base assíncrona com FastAPI e Uvicorn.
- Integração nativa com LiteLLM e AgentBR Cerebro.
- Máquina de Estados Finita (FSM) para orquestração.