Memória de longo prazo para agentes de IA.
O WOS é uma API de memória. Você armazena as memórias de um usuário uma única vez e depois recupera apenas as relevantes para cada consulta, passando-as ao prompt do seu modelo.
A qualidade do recall é a mesma em todos os idiomas, medida em 95,2% de recall@5 sobre 70 pares de idioma de armazenamento e idioma de consulta. Cada consulta retorna um contexto pequeno e limitado, não importa quanto você tenha armazenado, e nenhum modelo é executado sobre suas memórias armazenadas.
Operações principais
store- salva uma memória para um usuário.recall- obtém as memórias relevantes para uma consulta. Esta é a chamada principal.search- busca semântica bruta sobre as memórias armazenadas.supersede- atualiza ou substitui uma memória desatualizada.forget- exclui uma única memória ou um usuário inteiro (GDPR).
Além da janela de contexto.
O WOS recupera de históricos de 1.4M tokens - muito maiores que qualquer janela de contexto de LLM - e ainda assim devolve uma fatia enxuta de ~1,470 tokens.
A memória do seu agente não é limitada pelo que cabe em um prompt. Ela guarda tudo e recupera apenas o que importa, não importa o quanto o histórico cresça.
Privado, e seu.
Seus dados permanecem no seu store. Nunca treinamos com eles, os visualizamos ou os reutilizamos - apenas os organizamos para que você possa recuperá-los.
- BYOK. Sua chave de LLM é enviada a cada requisição e nunca armazenada.
- Isolado. As memórias têm escopo por workspace e, depois, por store (
user_id). - Exclusão GDPR. Uma única chamada apaga um usuário - cada memória, imagem e revisão, sem deixar nada.
Por que o WOS
- Três modelos, uma mesma linhagem. Os modelos WOS recebem nomes das formas como as pessoas preservaram o conhecimento ao longo da história - Tablet, Scroll, Book. Pedra, pergaminho, livro
- Pague $2 para nós. Economize muitas vezes esse valor no seu LLM. O WOS entrega ao seu LLM ~1,000 tokens por consulta - uma fatia limitada e relevante - em vez de enfiar o histórico completo em cada prompt. A diferença é
- Todos os idiomas, a mesma precisão. A qualidade do recall é idêntica, quer seus usuários escrevam em 日本語, 中文, Español ou inglês. Medimos como uma grade de 70 pares de idioma de armazenamento e
- Nenhum modelo é executado sobre suas memórias.EN Nada do que você envia é reescrito e o motor é barato, rápido e determinístico. Nenhum modelo é executado sobre suas memórias armazenadas. O Tablet não usa
- 67,5 %, medido e reproduzível. 67,5 % no BEAM 1M, média de 5 execuções independentes (σ 0,22 %, nenhuma escolhida a dedo), avaliado por gpt-4.1-mini com o prompt de julgamento do próprio
- Duas tarifas de token por modelo, mais $0.0001 por requisição. Por milhão de tokens mais uma taxa fixa de $0.0001 por requisição, pagamento conforme o uso. Sem assinatura, sem aluguel de armazenamento, sem limites de
Para desenvolvedores
- Três chamadas: armazenar, recuperar, responder. Uma única API. A chamada recall() retorna contexto de curto prazo, de longo prazo e do entorno em uma única ida e volta, pronto para inserir no seu prompt.
- Seu primeiro recall em 5 minutos. Uma chave, uma linha de instalação, três chamadas - seu agente tem memória. Cada trecho de código nesta página foi realmente executado; as respostas são
- Stores - criar, listar, excluir.EN Um store é o user_id sob o qual você lê e escreve - um espaço de memória isolado por usuário final, agente ou tópico. Stores são explícitos : crie um antes
- Recalls repetidos, por um décimo do preço.EN Ative por solicitação e o WOS armazena em cache o resultado da busca sob o texto da consulta, com as mesmas regras de prefixo do prompt caching dos LLMs
- Memória que sabe quem disse.EN As pessoas lembram por pessoa: o que o Bob prometeu, o que você disse que faria. Marque cada memória com um falante e seu agente faz o mesmo, em todos os
- ImagensEN Uma memória pode carregar uma imagem. O motor indexa a imagem, então uma consulta em texto em qualquer idioma a encontra mesmo quando o registro não tem
- verifyEN verify permite que uma busca execute passadas adicionais. Cada passada exclui o que as passadas anteriores retornaram, então uma segunda passada alcança
- lineageEN A cadeia de edições por trás de uma memória, da mais antiga para a mais recente. revisions diz quanto um store mudou; esta chamada diz o que aconteceu com um
- Sua memória dentro de cada ferramenta de IAEN Um único comando dá ao Claude Code, Claude Desktop, Cursor ou qualquer host MCP uma memória de longo prazo baseada na sua conta WOS. Sem código de
- EngramsEN Ferramentas de recall invocáveis pelo seu modelo - cada uma é uma estratégia de recuperação diferente sobre a mesma memória. Use uma, ou execute várias ao
- Todos os endpoints, uma única URL base.EN Nenhum SDK necessário - qualquer cliente HTTP funciona. URL base https://api.wontopos.com , autenticação via o cabeçalho X-API-Key , JSON na entrada e na
- Os mesmos recursos para todos. Os níveis só aumentam seus limites.EN Todo nível executa o motor completo - mesma qualidade de recall, mesmos idiomas, todos os métodos. Os níveis avançam automaticamente até o Nível 5 conforme
- Quando algo dá errado.EN Os erros retornam como um envelope JSON com um type estável, uma mensagem legível e um request_id que você pode nos enviar ao relatar um problema.
- Won é para quem lê a memória.EN A maior parte desta API responde com memória. Won responde sobre ela: quanto de um store foi reescrito e até onde dá para confiar nele. É voltado ao lado que
- Python - todos os métodos, três grupos.EN Python - todos os métodos, três grupos. Escrever, ler, excluir. Todos os exemplos abaixo foram executados contra a API em produção em 2026-08-01; as
- TypeScript - todos os métodos, três grupos.EN TypeScript - todos os métodos, três grupos. Escrever, ler, excluir. Todos os exemplos abaixo foram executados contra a API em produção em 2026-08-01; as
- Rust - todos os métodos, três grupos.EN Rust - todos os métodos, três grupos. Escrever, ler, excluir. Todos os exemplos abaixo foram executados contra a API em produção em 2026-08-01; as respostas
- curl - sem instalação, os mesmos métodos.EN Nenhum SDK para instalar - qualquer cliente HTTP funciona. Defina sua chave uma vez e chame os mesmos endpoints que os SDKs encapsulam. URL base
- Time_awarenessEN Uma forma de entrega - escolhida por chamada. Passe form - memoir ou archive - em qualquer chamada de um modelo compatível (Scroll 1.2 e superiores), e a
- deep_recallEN Recall multi-hop. Segue os vínculos entre memórias e traz contexto vinculado que uma busca única deixaria passar. Ideal quando as memórias referenciam umas
- timelineEN Recall em ordem temporal. Retorna memórias ordenadas do mais recente para o mais antigo por quando o evento aconteceu , não por relevância. Para perguntas de
- gatherEN Coleta ampla. Uma rede mais ampla que o deep_recall. Use-o para trazer tudo relacionado a uma pessoa, projeto ou tópico em uma única chamada. Retorna até ~18.
- equilibriumEN Correção de desvio. À medida que uma sessão se alonga, as respostas podem começar a repetir-se, a ficar planas ou a girar em torno do último assunto. Este
- tone_stabilizerEN A própria voz. Sessões longas afastam um assistente do seu registo: as respostas alongam-se, viram relatório ou assumem o humor do último trecho. A
- Quanto esta chave gastou e quanto restaEN usage responde a «posso continuar?». Devolve o custo acumulado desta chave, o do seu workspace num período, quanto custou cada armazenamento nesse período e
- Quanto de um store foi reescritoEN revisions responde revised de total : quantas memórias de um store foram alteradas depois de escritas. Vale a pena perguntar antes de se apoiar na memória
Mais
- ComplementoEN O mapa completo e legível por máquina da API - cada endpoint, requisição, resposta e erro.