Memoria a largo plazo para agentes de IA.
WOS es una API de memoria. Almacenas las memorias de un usuario una sola vez, luego recuperas solo las relevantes para cada consulta y las pasas al prompt de tu modelo.
La calidad del recall es la misma en todos los idiomas, medida en 95,2 % de recall@5 sobre 70 pares de idioma de almacenamiento e idioma de consulta. Cada consulta devuelve un contexto pequeño y acotado sin importar cuánto hayas almacenado, y nunca se ejecuta un modelo sobre tus memorias almacenadas.
Operaciones principales
store- guarda una memoria de un usuario.recall- obtiene las memorias relevantes para una consulta. Esta es la llamada principal.search- búsqueda semántica directa sobre las memorias almacenadas.supersede- actualiza o reemplaza una memoria desactualizada.forget- elimina una sola memoria o un usuario completo (GDPR).
Más allá de la ventana de contexto.
WOS recupera de historiales de 1.4M tokens - mucho más grandes que cualquier ventana de contexto de un LLM - y aun así entrega un fragmento compacto de ~1,470 tokens.
La memoria de tu agente no está limitada por lo que cabe en un prompt. Lo conserva todo y recupera solo lo que importa, sin importar cuánto crezca el historial.
Privado, y tuyo.
Tus datos permanecen en tu store. Nunca entrenamos con ellos, los vemos ni los reutilizamos - solo los organizamos para que puedas recuperarlos.
- BYOK. Tu clave de LLM se envía por solicitud y nunca se almacena.
- Aislado. Las memorias tienen alcance por workspace y luego por store (
user_id). - Borrado GDPR. Una llamada borra a un usuario - cada memoria, imagen y revisión, sin dejar nada.
Por qué WOS
- Tres modelos, un mismo linaje. Los modelos de WOS llevan el nombre de cómo la humanidad ha conservado el conocimiento a lo largo de la historia - Tablet, Scroll, Book. Piedra, pergamino
- Páganos $2. Ahorra muchas veces eso en tu LLM. WOS entrega a tu LLM ~1,000 tokens por consulta - un fragmento acotado y relevante - en lugar de meter todo el historial en cada prompt. La diferencia es
- Todos los idiomas, la misma precisión. La calidad del recall es idéntica ya sea que tus usuarios escriban en 日本語, 中文, Español o inglés. La medimos como una cuadrícula de 70 pares de idioma de
- Ningún modelo se ejecuta sobre tus memorias.EN Nada de lo que envías se reescribe y el motor es barato, rápido y determinista. Nunca se ejecuta un modelo sobre tus memorias almacenadas. Tablet no usa
- 67,5 %, medido y reproducible. 67,5 % en BEAM 1M, promediado sobre 5 ejecuciones independientes (σ 0,22 %, ninguna seleccionada a conveniencia), calificado por gpt-4.1-mini con el prompt
- Dos tarifas de tokens por modelo, más $0.0001 por solicitud. Por millón de tokens más una tarifa fija de $0.0001 por solicitud, pago por uso. Sin suscripción, sin renta de almacenamiento, sin topes de memoria. Pagas
Para desarrolladores
- Tres llamadas: store, recall, responder. Una sola API. La llamada recall() devuelve el contexto de corto plazo, largo plazo y entorno en un solo viaje de ida y vuelta, listo para insertar en tu
- Tu primer recall en 5 minutos. Una clave, una línea de instalación, tres llamadas - tu agente ya tiene memoria. Cada fragmento de esta página se ejecutó de verdad; las respuestas se
- Stores - crear, listar, eliminar.EN Un store es el user_id bajo el cual lees y escribes - un espacio de memoria aislado por usuario final, agente o tema. Los stores son explícitos : crea uno
- Recuperaciones repetidas, a la décima parte del precio.EN Actívalo por solicitud y WOS almacenará en caché el resultado de búsqueda bajo el texto de la consulta, con las mismas reglas de prefijo que el prompt
- Memoria que sabe quién lo dijo.EN Las personas recuerdan por persona: qué prometió Bob, qué dijiste que harías. Etiqueta cada recuerdo con un hablante y tu agente hará lo mismo, en todos los
- ImágenesEN Una memoria puede llevar una imagen. El motor indexa la imagen, así que una consulta de texto en cualquier idioma coincide con ella aunque el registro no
- verifyEN verify permite que una búsqueda haga pasadas adicionales. Cada pasada excluye lo que devolvieron las anteriores, así que una segunda pasada alcanza memorias
- lineageEN La cadena de ediciones que hay detrás de una memoria, de la más antigua a la más reciente. revisions indica cuánto se movió un store; esto indica qué le pasó
- Tu memoria dentro de cada herramienta de IAEN Un solo comando da a Claude Code, Claude Desktop, Cursor o cualquier host MCP una memoria a largo plazo respaldada por tu cuenta WOS. Sin código de
- EngramsEN Herramientas de recall invocables que tu modelo puede llamar - cada una es una estrategia de recuperación distinta sobre la misma memoria. Usa una, o ejecuta
- Todos los endpoints, una URL base.EN No se requiere SDK - cualquier cliente HTTP funciona. URL base https://api.wontopos.com , autenticación vía el encabezado X-API-Key , JSON de entrada y
- Las mismas funciones para todos. Los niveles solo elevan tus límites.EN Todos los niveles ejecutan el motor completo - la misma calidad de recall, los mismos idiomas, todos los métodos. Los niveles avanzan automáticamente hasta
- Cuando algo sale mal.EN Los errores vuelven como un sobre JSON con un type estable, un mensaje legible y un request_id que puedes enviarnos al reportar un problema.
- Won es para quien lee la memoria.EN La mayor parte de esta API responde con memoria. Won responde sobre ella: cuánto se ha reescrito de un store y hasta dónde se puede confiar en él. Está
- Python - todos los métodos, tres grupos.EN Python - todos los métodos, tres grupos. Escribir, leer, eliminar. Cada ejemplo de abajo se ejecutó contra la API en vivo el 2026-08-01; las respuestas son
- TypeScript - todos los métodos, tres grupos.EN TypeScript - todos los métodos, tres grupos. Escribir, leer, eliminar. Cada ejemplo de abajo se ejecutó contra la API en vivo el 2026-08-01; las respuestas
- Rust - todos los métodos, tres grupos.EN Rust - todos los métodos, tres grupos. Escribir, leer, eliminar. Cada ejemplo de abajo se ejecutó contra la API en vivo el 2026-08-01; las respuestas son
- curl - sin instalación, los mismos métodos.EN No hay SDK que instalar - cualquier cliente HTTP funciona. Configura tu clave una vez y llama a los mismos endpoints que envuelven los SDK. URL base
- Time_awarenessEN Una forma de entrega - se elige por llamada. Pasa form - memoir o archive - en cualquier llamada de un modelo compatible (Scroll 1.2 y superiores), y la
- deep_recallEN Recall multisalto. Sigue los vínculos entre recuerdos y trae contexto enlazado que una sola búsqueda pasaría por alto. Ideal cuando las memorias se
- timelineEN Recall ordenado por tiempo. Devuelve las memorias ordenadas de más reciente a más antigua según cuándo ocurrió el evento , no por relevancia. Para preguntas
- gatherEN Recolección amplia. Una red más amplia que deep_recall. Úsala para traer todo lo relacionado con una persona, proyecto o tema en una sola llamada. Devuelve
- equilibriumEN Corrección de deriva. A medida que una sesión se alarga, las respuestas pueden empezar a repetirse, a aplanarse o a girar en torno a lo último que se habló
- tone_stabilizerEN Su propia voz. Las sesiones largas apartan al asistente de su registro: las respuestas se alargan, se vuelven informes o toman el ánimo del último tramo. El
- Cuánto ha gastado esta clave y cuánto quedaEN usage responde a «¿puedo seguir?». Devuelve el coste acumulado de esta clave, el de su espacio de trabajo en una ventana, lo que costó cada almacén dentro de
- Cuánto se ha reescrito de un storeEN revisions responde revised de total : cuántas memorias de un store fueron alteradas después de haber sido escritas. Vale la pena preguntarlo antes de
Más
- ComplementoEN El mapa completo y legible por máquinas de la API: cada endpoint, petición, respuesta y error.