COSMOS
中文

测量,而非魔法

更少的开销。
可供检查的证据。

我们测量有边界工作流中的上下文和编排开销。这些结果展示了特定第一方测试中实际发生的情况,并非对每一种模型、任务或账单的承诺。

简要结论

COSMOS 在会话之间保留有用状态,检索聚焦的工作集并返回紧凑的证据。不同层面节省的是不同资源:输入 token、传输字节数和工具调用必须分别测量。

经测量的第一方结果

输入上下文

之前
69,393
之后
4,547
缩减幅度
93.45%

输入 token

范围与方法

一次要求精确输出的合成金丝雀测试比较了继承的最小提供商配置与隔离的最小提供商配置。两者均返回了所要求的完全一致答案;缓存状态不同。仅测量输入 token,不代表账单节省或整个任务的质量。

这不能证明什么

缓存状态不同。这不能单独确定检索质量,也不能证明提供商计费具有可比性。

证据审查日期: · 试验次数: 1

经测量的第一方结果

紧凑的结果载荷

之前
4,290
之后
712
缩减幅度
83.4%

结果字节

范围与方法

在十次本地开发试验中,对五个文件进行比较,将已经紧凑的结果与批处理过程进行了对比。每次试验中,成功结果序列化后的字节数分别为 4,290 和 712。同一快照上的相等性结果一致;设置、失败情况和过程构建均未计入。

这不能证明什么

结果字节数不等于完整线路流量或模型 token。十月的结果属于本地开发候选结果,并非发布声明。

证据审查日期: · 试验次数: 10

经测量的第一方结果

带签名的诊断流量

之前
121,896
之后
82,455
缩减幅度
32.36%

线路字节

范围与方法

十个中性的本地诊断场景测得实际响应线路字节总数分别为 121,896 和 82,455。其中四个场景需要更多字节,并多出一次调用。共享设置未计入;未比较最终模型回答的质量。

这不能证明什么

网络传输的字节数不能证明模型令牌用量或实际成本。十月的结果只是本地开发候选结果,并非发布声明。

证据审查日期: · 试验次数: 10

经测量的第一方结果

诊断调用

之前
59
之后
49
缩减幅度
16.95%

工具调用

范围与方法

同样的十个本地诊断场景测得工具调用总数分别为 59 和 49。总数有所下降,但并非每个场景都有改善。

这不能证明什么

调用次数更少本身并不能证明延迟更低、成本更低,或在其他任务上具有同等性能。

证据审查日期: · 试验次数: 10

我们的测量承诺

对于试点,我们会在比较结果之前就基线、代表性任务、质量检查和成功标准达成一致。我们会报告缓存假设、输出、重试和工具使用情况;不会将一次金丝雀测试包装成普遍适用的结论。

真实工作流,边界清晰

这些是第一方开发和运营示例。它们并非独立客户背书,运营示例也不会自动成为经过测量的 token 节省案例。

运营模式

电商平台证据 → 会计验证

COSMOS 将源记录保留在可信边界内,准备候选项,执行一致性检查,并通过回读外部状态来验证已获批准的会计操作。此工作流体现的是受控执行和减少重复调查;我们不为该工作流声称任何 token 节省比例。

开发模式

聚焦的开发交接

专业智能体接收相关文件、约束和检查要求,而不是完整的对话历史。结构化结果返回到一项可审查的任务中。上下文缩减按任务评估,并通过测试保障所要求的结果。

示意性工作流

研究 → 翻译 → 审查

研究、起草、翻译和编辑审查采用聚焦的角色与来源引用。发布仍是一项需要单独批准的操作。节省幅度取决于来源数量、交接环节和所选提供商。

MCP / API / IDE

你的环境。一个共享的控制平面。

通过 MCP 和已配置的提供商适配器连接你已在使用的工具。协议兼容并不等同于经过端到端验证的原生集成。

本地采用或已配置的适配器;仍需验收

本地采用和已配置的宿主

  • VS Code
  • Native Codex
  • Cursor
  • Claude / Claude Code

VS Code 和原生 Codex 已有记录在案的本地采用路径。Cursor 和原生 Claude / Claude Code 具有测试框架和 MCP 配置适配器;适配器已配置并不代表宿主已通过验收。新的宿主聊天会话、版本、权限和工作负载需要分别验证。

协议兼容或候选项;需要试点验证

兼容 MCP 的宿主和候选项

  • MCP-compatible hosts
  • OpenClaw

其他兼容 MCP 的环境可以使用受治理的 MCP 接口,但须满足传输、权限和工具准入要求。OpenClaw 是限定范围的外部集成试点候选项,并非经过验证的捆绑集成;其网关和运行时并未嵌入。

合成证据、适配器协定和规划中的路由

提供商和自定义管线

  • Z.AI / GLM
  • OpenRouter
  • Python / CLI / MCP pipelines

Z.AI / GLM 通过了一次要求精确输出的合成金丝雀测试;这并不授权私有数据路由,也不能证明一般性的模型质量。OpenRouter 路由和评估尚在计划中,目前未获封闭提供商配置准入。自定义管线可围绕经过单独验证的领域适配器使用 Python、CLI 和 MCP 协定。

围绕你的边界进行部署

我们会根据你的数据和运营约束,讨论本地、私有服务器和托管部署。限定范围的演示会在推广部署前确定所需的 IDE、模型、工具、权限和证据。

下一步是实现公开复现

包含经过脱敏的基准测试语料库和复现说明的公开 GitHub 仓库已列入待办事项,但尚未发布。目前,我们可以讨论测量方法并商定一项可重复的试点;此处不会提供无法使用的仓库链接。

从更小的一步开始

从一个工作流开始。
定义“完成”的含义。

试点讨论从工作本身开始,而不是从平台迁移开始。在决定构建什么之前,先就范围、访问边界和有用的测试达成一致。

01

梳理交接环节

明确来源、智能体角色以及需要人员作出的决策。

02

定义验证依据

选择基线、验收检查和结果的适用限制。

03

审查下一步

依据证据决定是优化、扩展还是停止。

合适的首个候选任务

一项反复执行、证据可获取且结果可检查的任务。将初始范围控制在足够小、便于审查的程度。

不纳入初始范围

不受限制的访问、无人监督且不可逆的操作,或承诺每个模型回答都正确。

准备一份简短咨询说明

选择一个起点并描述一项结果。准备好后复制这份说明;分享哪些内容由你决定。

此构建工具仅在本页面上运行。任何内容都不会被存储、分析或自动发送。请勿输入密码或敏感信息。

打开 Telegram

不会自动发送任何内容。

这些数字意味着什么

COSMOS 会保证为我的团队实现同样的节省吗?

不会。我们会测量实际工作负载并检查所要求的结果。上下文、缓存、模型定价、工具和重试都可能改变结果。

我可以使用现有的 IDE 和模型吗?

COSMOS 支持原生提供商路径、兼容 MCP 的环境和已配置的适配器。具体的宿主、模型、权限和部署方式会针对你的工作流进行验证。

公开的基准测试仓库在哪里?

公开发布 GitHub 仓库已列入待办事项。此页面不声称已有公开仓库或独立复现。

与我们一起测量你的工作流。

带来一项任务、一个基线,以及必须保持正确的结果。我们可以展示工作流、讨论你的技术栈,并定义一个有边界的演示或试点。

在 Telegram 上交流