运行时 · 模型
每一个模型,都各有其用。
Perslis 不会只押一个模型然后祈祷。它驱动一整套精选阵容——美国与中国的前沿模型、气密的本地模型,以及一个完全不含大模型的符号引擎——并把每个请求交给真正最适合这件事的那一个。
没有任何一个模型样样最强,而且前沿每个月都在变。所以 Perslis 在架构上就是模型无关的:它用同一套统一协议与每个提供商对话,并给每个模型分配一个角色——起草、评审、对抗、深度推理、以及高风险工作上强制的最终把关——而不是把一切托付给一个大脑。当某个模型拒答或卡住,它会在同一次请求中即时热切换到另一个。当正确性至关重要,一个符号引擎(Jeeves)会在完全没有大模型参与的情况下核验推理。而对于隐私或受监管的数据,一个气密层完全运行在你自己的机器上——数据一个字节都不外流。你带来密钥;你掌控路由;没有任何厂商能绑架你。
图 1 —— 阵容一览。每个模型靠它在循环中扮演的角色赢得席位,而不是靠品牌。
为什么每一个都要用
只押一个模型,是一场你会不断输掉的赌局。本季度最强的写码模型,未必是最强的推理模型;文笔最好的模型,未必最会挑自己的错;那个 95% 情况下正确的最便宜模型,未必是你想让它签发一份法律答复的模型。Perslis 像一支好团队对待人一样对待模型——按角色:
- 建造者起草工作——尽可能快、尽可能本地优先。
- 评审者批评它——最好来自不同的实验室,这样盲点不会重叠。
- 对抗者试图击破它——红队式挑刺,而非橡皮图章。
- 最终把关——当前可用的最强模型——为任何高风险工作签字。
- 符号预言机在完全没有大模型的情况下核验逻辑是否自相矛盾。
同时使用美国和中国的前沿模型不是口号——这正是获得独立评审的方式。同一实验室的两个模型共享训练数据,也共享错误;一个 DeepSeek 去评审一个 OpenAI 的产出,是出于真实的理由才会反对。那份分歧,就是信号。
🇺🇸 美国前沿
OpenAI —— GPT-5.5
默认的最终把关。当一项任务被标为高风险——一份法律或合规答复、一次不可逆的更改、任何要交付给真实用户的东西——Perslis 会要求一个前沿模型签字,而 GPT-5.5 是坐这把交椅最强的通才。它广博、稳健,很少成为一个计划翻车的原因。
Perslis 为何用它:高风险任务上强制的最终把关。它是"完成"之前的最后一位评审,并且刻意与建造者是不同的模型。
Anthropic —— Claude
细致的建造者与长文推理者。Claude 擅长读懂庞大、杂乱的上下文,写出人真正愿意读的文字,并一丝不苟地遵循复杂指令——这让它成为建造与高信任度起草的一流之选。
Perslis 为何用它:另一个前沿建造者/评审者,也是当别的模型拒答或跑偏时的热切换目标。有两个前沿,就总有一个可用。
Google —— Gemini 2.5 Flash
均衡默认。Flash 又快又便宜,同时真正有实力,因此承担日常负载——状态类工作、摘要、常规建造——在这些地方付前沿价格纯属浪费。
Perslis 为何用它:日常工作的默认档位。好到值得信任,便宜到可做基准,快到近乎即时。
xAI —— Grok
对抗者。Grok 被指向一份已完成的工作,只有一条指令:试着击破它。它默认怀疑——这正是你想从红队手里得到的:一个以反驳为职、而非以附和为职的评审者。
Perslis 为何用它:评审委员会里的对抗席位。当 Perslis 需要一个结论在被信任前先被证伪,它就把这个论断交给它。
🇨🇳 中国前沿
DeepSeek —— DeepSeek Reasoner
批评者。DeepSeek 的推理模型极其擅长逐步核验、擅长找出论证中的破绽,而成本仅为前沿的一小部分。它与美国模型来自不同的实验室、不同的训练语料,因此它的分歧是独立的——也是最有价值的那种。
Perslis 为何用它:委员会中的主评审。它用一个真正不同的头脑去交叉核验美国模型的产出,而真正的错误正是在这里浮现。
小米 —— MiMo
深度推理者。MiMo 被路由到那些棘手、盘根错节的问题——架构、根因分析、多步规划——在这些地方你想要一个会沉下心来对付问题、而不是脱口而出第一个听着顺耳答案的模型。
Perslis 为何用它:"深度"档位,用于复杂推理任务,也是与 DeepSeek 并列的第二个独立中国视角。
阿里巴巴 —— Qwen(2.5 Coder)
本地优先的建造者——也是下文的气密模型之一。Qwen Coder 小到能跑在你自己的机器上,却强到足以起草真实代码,因此 Perslis 在写码工作上首先找它:在花掉一个付费 API 的 token 之前,先用又快又私密的那个选项。
Perslis 为何用它:通过 Ollama 做本地优先写码。它让日常工作又快、免费、气密,只在任务确有需要时才升级到云端模型。
月之暗面 —— Kimi
超长上下文专家。Kimi 极大的上下文窗口适合整仓库读取与长文档工作,为 Perslis 提供了又一个独立的中国选项,用于那些更看重广度而非深度的任务。
Perslis 为何用它:用于超大输入的可选评审/读取者,也让阵容更冗余,使任何单一提供商都不成为单点故障。
🔒 气密模型
所谓气密模型,就是数据不出你的机器——没有 API 调用、没有网络、没有第三方。Perslis 通过一个本地服务器(Ollama)运行它们,因此模型权重、你的提示词和答案都留在你掌控的硬件上。正因如此,Perslis 才能用于那些在法律或实际上无法上云的数据:病历、受保密特权的材料、涉密或物理隔离的系统,或者仅仅是一台没有联网的笔记本。
- 本地大模型——Qwen、Llama 一类,以及其他由 Ollama 托管的模型,完全离线运行。比前沿更慢更小,但私密且免费,而且往往已经足够一项任务所需。
- Jeeves——下文的符号引擎天生气密:它没有模型可调用,也没有网络可触达。它端到端都是确定性且离线的。
自研气密模型 —— TinkyBrain v6
Perslis 没有模型可卖——但这不代表我们不造模型。TinkyBrain v6 就是我们为气密层训练的一款自研、完全开放的端侧模型:一个 2550 万参数的 Transformer,完全离线运行,小到能在 2017 年的 Kindle Fire 上于三秒内作答,在现代 ARM64 手机上约一秒即可。它以量化 ONNX 形式发布——一个 24 MB 的 int8 版本——无网络、无密钥,数据不出设备。它是气密承诺的实证:一个你可以下载、检视、亲手运行的真实模型。
它的任务是辅助与替代沟通(AAC):给定一个提示,它生成六个语义上各不相同的回应磁贴,让无法说话的用户——自闭症或言语失用症儿童、失语症的中风幸存者——通过点按来“说话”。在这样的场景里,气密层不是偏好而是硬性要求:数据是私密的,绝不能离开设备。
图 2 —— TinkyBrain v6 一览。小到真正气密,好到真正可用。
| 规格 | TinkyBrain v6 |
|---|---|
| 架构 | Transformer —— 6 层、8 头、深度 512、前馈 1024 |
| 参数量 | 2550 万 |
| 词表 / 上下文 | 12,599 词元(含 PEEL 条件标记)· 最长 64 词元序列 |
| 格式 | ONNX —— int8 量化(24 MB,生产)与 fp32(参考) |
| 训练 | 41,519 条儿童语料对话对 · 在 M4 上 161 分钟 |
| 质量 | 多样性 0.975 · 连贯性 0.838 |
| 速度 | 2017 款 Kindle Fire 上约 2.9秒 / 6 磁贴 · 现代 ARM64 上 0.6–1.2秒 |
| 运行时 | ONNX Runtime —— 离线、无密钥、无网络 |
| 许可 | CC-BY-NC-SA 4.0(非商用;商用需授权) |
在 Hugging Face 上查看 TinkyBrain v6 —— 权重、分词器与模型卡 →
Perslis 为何采用它:它把气密层落到了实处。当一项任务小、敏感、且需离线——AAC 正是原型——Perslis 可以路由到一个自研模型,可证明地把一切都留在设备上,并指向任何人都能审计的开放权重。
🧠 符号 —— Jeeves(无大模型)
上文每一个模型都是预测下一个 token 的神经网络——出色,但概率性,而且可能自信地出错。Jeeves 在本质上不同。它是一个符号引擎:一套确定性的规则与知识图谱系统,循环中完全没有任何大模型。它不猜。给定同样的事实,它每次都返回同样的答案,并给出一条你能逐条追溯的解释。
在循环中,Jeeves 充当预言机与矛盾检查器。当一个大模型提出答案,Jeeves 可以拿它去对照一整套已知事实与规则来检验:这个结论成立吗?它是否与我们已认定为真的东西相冲突?因为它是符号的,它的裁决不是又一个需要权衡的意见——而是一个证明,或一个反例。这正是概率模型无法对自身给出的那种检查。
Perslis 为何用它:值得信任的正确性,需要神经网络之外的某个东西来核验。Jeeves 就是那个东西——一个快速、离线、确定性的第二意见,把"模型说是这样"变成"这就是它成立的原因"。它同样完全气密:无密钥、无网络、无数据外流。
要点
这套阵容是产品的脊梁。任何单一模型迟早都会让你失望——拒答、幻觉、被弃用、把你的成本抬到用不起,或者仅仅是状态不好的一天。Perslis 的构建方式让这一切都无关紧要:另一个模型会接过工作,一个来自别家实验室的模型会核验它,一个符号引擎会证明那些必须被证明的部分,一个气密层会处理任何不能出门的东西。你不是在押一个模型。你是在带一支团队。