代表持久模型编排的 Perslis 机器乌龟

运行时 · 模型

每一个模型,都各有其用。

Perslis 不会只押一个模型然后祈祷。它驱动一整套精选阵容——美国与中国的前沿模型、气密的本地模型,以及一个完全不含大模型的符号引擎——并把每个请求交给真正最适合这件事的那一个。

摘要

没有任何一个模型样样最强,而且前沿每个月都在变。所以 Perslis 在架构上就是模型无关的:它用同一套统一协议与每个提供商对话,并给每个模型分配一个角色——起草、评审、对抗、深度推理、以及高风险工作上强制的最终把关——而不是把一切托付给一个大脑。当某个模型拒答或卡住,它会在同一次请求中即时热切换到另一个。当正确性至关重要,一个符号引擎(Jeeves)会在完全没有大模型参与的情况下核验推理。而对于隐私或受监管的数据,一个气密层完全运行在你自己的机器上——数据一个字节都不外流。你带来密钥;你掌控路由;没有任何厂商能绑架你。

2前沿(美国 + 中国)
1符号引擎,无大模型
0气密层外流字节

图 1 —— 阵容一览。每个模型靠它在循环中扮演的角色赢得席位,而不是靠品牌。

为什么每一个都要用

只押一个模型,是一场你会不断输掉的赌局。本季度最强的写码模型,未必是最强的推理模型;文笔最好的模型,未必最会挑自己的错;那个 95% 情况下正确的最便宜模型,未必是你想让它签发一份法律答复的模型。Perslis 像一支好团队对待人一样对待模型——按角色

同时使用美国中国的前沿模型不是口号——这正是获得独立评审的方式。同一实验室的两个模型共享训练数据,也共享错误;一个 DeepSeek 去评审一个 OpenAI 的产出,是出于真实的理由才会反对。那份分歧,就是信号。

永远自带密钥。Perslis 从不转售推理。你把它指向你已有的账号——或指向运行在你自己硬件上的模型——由它在其间路由。护城河是路由、交叉核验与证明,而不是一个计量收费的 API。

🇺🇸 美国前沿

OpenAI —— GPT-5.5

默认的最终把关。当一项任务被标为高风险——一份法律或合规答复、一次不可逆的更改、任何要交付给真实用户的东西——Perslis 会要求一个前沿模型签字,而 GPT-5.5 是坐这把交椅最强的通才。它广博、稳健,很少成为一个计划翻车的原因。

Perslis 为何用它:高风险任务上强制的最终把关。它是"完成"之前的最后一位评审,并且刻意与建造者是不同的模型。

Anthropic —— Claude

细致的建造者与长文推理者。Claude 擅长读懂庞大、杂乱的上下文,写出人真正愿意读的文字,并一丝不苟地遵循复杂指令——这让它成为建造与高信任度起草的一流之选。

Perslis 为何用它:另一个前沿建造者/评审者,也是当别的模型拒答或跑偏时的热切换目标。有两个前沿,就总有一个可用。

Google —— Gemini 2.5 Flash

均衡默认。Flash 又快又便宜,同时真正有实力,因此承担日常负载——状态类工作、摘要、常规建造——在这些地方付前沿价格纯属浪费。

Perslis 为何用它:日常工作的默认档位。好到值得信任,便宜到可做基准,快到近乎即时。

xAI —— Grok

对抗者。Grok 被指向一份已完成的工作,只有一条指令:试着击破它。它默认怀疑——这正是你想从红队手里得到的:一个以反驳为职、而非以附和为职的评审者。

Perslis 为何用它:评审委员会里的对抗席位。当 Perslis 需要一个结论在被信任前先被证伪,它就把这个论断交给它。

🇨🇳 中国前沿

DeepSeek —— DeepSeek Reasoner

批评者。DeepSeek 的推理模型极其擅长逐步核验、擅长找出论证中的破绽,而成本仅为前沿的一小部分。它与美国模型来自不同的实验室、不同的训练语料,因此它的分歧是独立的——也是最有价值的那种。

Perslis 为何用它:委员会中的主评审。它用一个真正不同的头脑去交叉核验美国模型的产出,而真正的错误正是在这里浮现。

小米 —— MiMo

深度推理者。MiMo 被路由到那些棘手、盘根错节的问题——架构、根因分析、多步规划——在这些地方你想要一个会沉下心来对付问题、而不是脱口而出第一个听着顺耳答案的模型。

Perslis 为何用它:"深度"档位,用于复杂推理任务,也是与 DeepSeek 并列的第二个独立中国视角。

阿里巴巴 —— Qwen(2.5 Coder)

本地优先的建造者——也是下文的气密模型之一。Qwen Coder 小到能跑在你自己的机器上,却强到足以起草真实代码,因此 Perslis 在写码工作上首先找它:在花掉一个付费 API 的 token 之前,先用又快又私密的那个选项。

Perslis 为何用它:通过 Ollama 做本地优先写码。它让日常工作又快、免费、气密,只在任务确有需要时才升级到云端模型。

月之暗面 —— Kimi

超长上下文专家。Kimi 极大的上下文窗口适合整仓库读取与长文档工作,为 Perslis 提供了又一个独立的中国选项,用于那些更看重广度而非深度的任务。

Perslis 为何用它:用于超大输入的可选评审/读取者,也让阵容更冗余,使任何单一提供商都不成为单点故障。

🔒 气密模型

所谓气密模型,就是数据不出你的机器——没有 API 调用、没有网络、没有第三方。Perslis 通过一个本地服务器(Ollama)运行它们,因此模型权重、你的提示词和答案都留在你掌控的硬件上。正因如此,Perslis 才能用于那些在法律或实际上无法上云的数据:病历、受保密特权的材料、涉密或物理隔离的系统,或者仅仅是一台没有联网的笔记本。

气密是一个路由决策,而非降级。你可以告诉 Perslis 某项任务是敏感的,它就会把整个循环——建造、评审,以及它的记录——都留在本地的气密模型上。云端前沿是逐任务、选择性开启的,从不默认。

自研气密模型 —— TinkyBrain v6

Perslis 没有模型可——但这不代表我们不造模型。TinkyBrain v6 就是我们为气密层训练的一款自研、完全开放的端侧模型:一个 2550 万参数的 Transformer,完全离线运行,小到能在 2017 年的 Kindle Fire 上于三秒内作答,在现代 ARM64 手机上约一秒即可。它以量化 ONNX 形式发布——一个 24 MB 的 int8 版本——无网络、无密钥,数据不出设备。它是气密承诺的实证:一个你可以下载、检视、亲手运行的真实模型。

它的任务是辅助与替代沟通(AAC):给定一个提示,它生成六个语义上各不相同的回应磁贴,让无法说话的用户——自闭症或言语失用症儿童、失语症的中风幸存者——通过点按来“说话”。在这样的场景里,气密层不是偏好而是硬性要求:数据是私密的,绝不能离开设备。

2550万参数
24 MB磁盘占用(int8 ONNX)
0.975回应多样性
~1秒6 个磁贴,现代 ARM64

图 2 —— TinkyBrain v6 一览。小到真正气密,好到真正可用。

规格TinkyBrain v6
架构Transformer —— 6 层、8 头、深度 512、前馈 1024
参数量2550 万
词表 / 上下文12,599 词元(含 PEEL 条件标记)· 最长 64 词元序列
格式ONNX —— int8 量化(24 MB,生产)与 fp32(参考)
训练41,519 条儿童语料对话对 · 在 M4 上 161 分钟
质量多样性 0.975 · 连贯性 0.838
速度2017 款 Kindle Fire 上约 2.9秒 / 6 磁贴 · 现代 ARM64 上 0.6–1.2秒
运行时ONNX Runtime —— 离线、无密钥、无网络
许可CC-BY-NC-SA 4.0(非商用;商用需授权)
文本生成 ONNX 端侧 气密 AAC / 无障碍 开放权重

在 Hugging Face 上查看 TinkyBrain v6 —— 权重、分词器与模型卡 →

Perslis 为何采用它:它把气密层落到了实处。当一项任务小、敏感、且需离线——AAC 正是原型——Perslis 可以路由到一个自研模型,可证明地把一切都留在设备上,并指向任何人都能审计的开放权重。

🧠 符号 —— Jeeves(无大模型)

上文每一个模型都是预测下一个 token 的神经网络——出色,但概率性,而且可能自信地出错。Jeeves 在本质上不同。它是一个符号引擎:一套确定性的规则与知识图谱系统,循环中完全没有任何大模型。它不猜。给定同样的事实,它每次都返回同样的答案,并给出一条你能逐条追溯的解释。

在循环中,Jeeves 充当预言机矛盾检查器。当一个大模型提出答案,Jeeves 可以拿它去对照一整套已知事实与规则来检验:这个结论成立吗?它是否与我们已认定为真的东西相冲突?因为它是符号的,它的裁决不是又一个需要权衡的意见——而是一个证明,或一个反例。这正是概率模型无法对自身给出的那种检查。

Perslis 为何用它:值得信任的正确性,需要神经网络之外的某个东西来核验。Jeeves 就是那个东西——一个快速、离线、确定性的第二意见,把"模型说是这样"变成"这就是它成立的原因"。它同样完全气密:无密钥、无网络、无数据外流。

注:Jeeves 规则库中被称为"基座系统"的具体配置在运行时文档中另有说明;本页仅在阵容层面介绍 Jeeves。

要点

这套阵容是产品的脊梁。任何单一模型迟早都会让你失望——拒答、幻觉、被弃用、把你的成本抬到用不起,或者仅仅是状态不好的一天。Perslis 的构建方式让这一切都无关紧要:另一个模型会接过工作,一个来自别家实验室的模型会核验它,一个符号引擎会证明那些必须被证明的部分,一个气密层会处理任何不能出门的东西。你不是在押一个模型。你是在带一支团队。

需要时,我们也造一个

我们不卖模型。但我们还是造了一个气密的。

Perslis 与模型无关——它驱动你的模型,而不是我们的某一个。但气密层是一个承诺, 承诺需要证明。于是我们训练了 TinkyBrain v6:一个 2550 万参数的开放模型, 完全离线运行——小到能在 2017 年的 Kindle Fire 上作答,私密到数据从不离开设备。 开放权重,可审计,归你运行。

2550万参数
24 MB磁盘占用(int8 ONNX)
0字节离开设备
~1秒在 ARM64 上作答
查看完整规格 → 在 Hugging Face 上