面向 AI 智能体的长期记忆。
WOS 是一个记忆 API。您只需存储一次用户的记忆,之后每次查询只召回其中相关的部分,并将其传入模型的提示词。
各语言的召回质量完全一致,在存储语言与查询语言交叉的 70 组组合上实测为 recall@5 95.2%。无论您存储了多少内容,每次查询都只返回一小段大小受限的上下文,并且绝不会在您存储的记忆上运行任何模型。
核心操作
store- 为用户保存一条记忆。recall- 获取与查询相关的记忆。这是最主要的调用。search- 对已存储记忆进行原始语义搜索。supersede- 更新或替换已过时的记忆。forget- 删除单条记忆或整个用户的数据(GDPR)。
从左侧选择一个章节 查看各主题的详细说明。
超越上下文窗口。
WOS 可从 1.4M token 的历史中召回记忆 - 这远大于任何 LLM 的上下文窗口 - 却依然只交回约 1,470 个 token 的紧凑切片。
您智能体的记忆不受提示词容量的限制。它保留一切,只检索真正重要的部分,无论历史增长到多大。
私密,且属于您。
您的数据只属于您的存储库。我们绝不用它训练、查看或复用 - 只负责组织它,让您能够检索。
- BYOK。您的 LLM 密钥随每次请求传递,绝不存储。
- 隔离。记忆先按工作区、再按存储(
user_id)隔离。 - GDPR 删除。一次调用即可抹除一个用户 - 记忆、图像与修订记录,不留残余。
为什么选择 WOS
- 三个模型,一脉相承。 WOS 的模型以人类历史上保存知识的载体命名 - Tablet(石板)、Scroll(卷轴)、Book(册页)。石板、卷轴、装订成册的书:每一代都能为您的智能体做得更多。
- 付给我们 $2,在您的 LLM 上省下数倍的开销。 WOS 每次查询只向您的 LLM 提供约 1,000 个 token(一段大小受限且高度相关的切片),而不是把完整历史塞进每个提示词。两者差距巨大,且随历史增长而不断扩大。
- 每种语言,同样的准确率。 无论您的用户使用日语、中文、西班牙语还是英语,召回质量都完全相同。我们把存储语言与查询语言交叉成 70 组的网格来测量,并公开这个数字:recall@5 95.2%。
- 没有模型会读取您的记忆。EN 不改写您发送的内容,引擎便宜、快速且确定。绝不会在您存储的记忆上运行模型。Tablet 完全不用模型;Scroll 和 Book 会在引擎外围加一个模型以获得更强的效果,但它只看到您的查询,绝不会看到您存储的内容。
- 67.5%,实测且可复现。 在 BEAM 1M 上取得 67.5%,为 5 次独立运行的平均值(σ 0.22%,无任何挑选),由 gpt-4.1-mini 使用该基准自带的评判提示词打分。
- 每个模型两档 token 费率, 外加每次请求 $0.0001。 按每百万 token 计费,外加每次请求固定 $0.0001,按用量付费。没有订阅,没有存储租金,没有记忆上限。只有当您的智能体写入或读取时才付费 - 绝不为它记住的内容付费。
面向开发者
- 三次调用:存储、召回、回答。 一个 API。 recall() 调用在一次往返中返回短期记忆、长期记忆和周边上下文,可直接放入您的提示词。
- 5 分钟完成您的第一次召回。 一个密钥、一行安装命令、三次调用 - 您的智能体就有了记忆。本页每个代码片段都实际运行过;响应原样展示。
- 存储库 - 创建、列出、删除。EN 存储库(store) 就是您读写所依据的 user_id - 每个最终用户、智能体或主题一个隔离的记忆空间。存储库是 显式的 :必须先创建,再向其中存储或从中召回,否则调用返回 404 。每个账户自带一个 default 存储库,因此无需创建即可开始。
- 重复的召回,只需十分之一的价格。EN 按请求选择开启后,WOS 会以查询文本为键缓存检索结果,规则与 LLM 提示词缓存相同的前缀方式。缓存有效期间,重复或续写的查询会复用上一次的结果,缓存部分按正常 token 单价的 10% 计费。
- 知道是谁说的记忆。EN 人的记忆以人为单位:Bob 承诺了什么,你说过要做什么。给每条记忆打上说话者标签,你的智能体也能做到,在所有 Tablet 和 Scroll 模型上。
- 图像EN 一条记忆可以携带一张图像。引擎会为图片建立索引,因此即使记录没有说明文字、标题或替代文本,任何语言的文本查询都能匹配到它。
- verifyEN verify 允许一次检索执行额外的检索轮次。每一轮都会排除此前各轮已返回的结果,因此第二轮能够触及第一轮未覆盖的记忆。
- lineageEN 一条记忆背后的修改链,按时间由旧到新。 revisions 说明一个存储库整体改动了多少,这里说明单个事实发生了什么。
- 在每个 AI 工具里的记忆EN 一条命令,Claude Code、Claude Desktop、Cursor 等任何 MCP 宿主就拥有由你的 WOS 账户支撑的长期记忆。无需集成代码,智能体获得 9 个记忆工具并自行决定何时使用。
- EngramsEN 可供您的模型调用的召回工具 - 每一个都是作用于同一份记忆的不同检索策略。可单独使用,也可同时运行多个。
- 所有端点,一个基础 URL。EN 无需 SDK - 任何 HTTP 客户端都可用。基础 URL 为 https://api.wontopos.com ,通过 X-API-Key 请求头认证,请求与响应均为 JSON。记忆操作均为 POST;存储库管理使用 /collection 上的 POST / GET / DELETE。存储库必须先存在(见
- 人人功能相同。 等级只提升您的限额。EN 每个等级都运行完整引擎 - 相同的召回质量、相同的语言支持、全部方法。随着累计信用额度购买的增长,等级会自动提升至 Tier 5,无需申请或联系销售。企业版(Tier 6)是唯一的例外。
- 出错时会发生什么。EN 错误以 JSON 信封返回,包含稳定的 type 、面向人的消息,以及报告问题时可提供给我们的 request_id 。
- Won 是为读取记忆的一方准备的。EN 这个 API 的大部分是 用 记忆作答。 Won 则是 关于 记忆作答:一个存储库被改写了多少,又能信任到什么程度。它面向的是读取记忆的一方,通常是您正在构建的助手,而不是记忆所描述的那个人。
- Python - 全部方法,三大类。EN Python - 全部方法,三大类。 写入、读取、删除。以下每个示例都于 2026-08-01 针对线上 API 实际运行;响应为原样展示。
- TypeScript - 全部方法,三大类。EN TypeScript - 全部方法,三大类。 写入、读取、删除。以下每个示例都于 2026-08-01 针对线上 API 实际运行;响应为原样展示。
- Rust - 全部方法,三大类。EN Rust - 全部方法,三大类。 写入、读取、删除。以下每个示例都于 2026-08-01 针对线上 API 实际运行;响应为原样展示。
- curl - 无需安装,同样的方法。EN 无需安装 SDK - 任何 HTTP 客户端都可用。设置一次密钥,即可调用 SDK 所封装的相同端点。基础 URL 为 https://api.wontopos.com ,通过 X-API-Key 认证,请求与响应均为 JSON。
- Time_awarenessEN 按调用选择的交付形式。 在支持形式的模型(Scroll 1.2 及以上)的任意调用中传入 form - memoir 或 archive - 该次响应就会以对应方式呈现:普通搜索、recall 或任何 engram。SDK 中是与 tz 一样的 form 字段;HTTP 中是 X-WOS-Form
- deep_recallEN 多跳召回。 顺着记忆之间的关联往下走,带回单次搜索会遗漏的关联上下文。当记忆相互引用时效果最佳(一个人 → 其项目 → 具体细节)。最多返回约 12 条。
- timelineEN 按时间排序的召回。 按 事件发生时间 由新到旧返回记忆,而非按相关性。适合“X 是什么时候”、历史与顺序类问题。最多返回 15 条。
- gatherEN 广域收集。 比 deep_recall 撒得更宽。用它把与某个人、项目或主题相关的一切一次调用全部带回。最多返回约 18 条。
- equilibriumEN 漂移校正。 对话变长后,回复可能开始重复、变得平淡,或总是绕着最近聊的话题打转。本引擎把范围重新打开。出现这种情况时使用。若要查具体事实,请用更贴近查询的 deep_recall 或 gather。最多返回 12 条。
- tone_stabilizerEN 自己的声音。 长对话会把助手带离平常的语气:回复变长、变成报告,或染上最近一段的情绪。普通的自我召回只会让情况更糟,因为它匹配当前状态,把最近的发言当成性格返回。本引擎返回的是那一段之前的自身发言。需要以 speaker me 保存过的发言;若没有,则返回空而不做猜测。最多返回 10 条。
- 这个密钥花了多少,还剩多少EN usage 回答“我还能继续吗”。它返回这个密钥自身的累计费用、所属工作区在窗口期内的费用、该窗口内每个存储的费用,以及决定下一次调用的预付余额。
- 一个存储库被改写了多少EN revisions 用 revised 和 total 作答:一个存储库里的记忆,有多少在写下之后被改动过。在把要紧的事托付给记忆之前值得问一问,或者当召回的事实和用户此刻说的话对不上时问一问。十条事实里有三条被替换过的存储库,理应比无人改动过的那一个更少被信任。
更多
- 附加功能EN API 的完整机器可读地图 - 所有端点、请求、响应和错误。