Claude 5 与 GPT-5.6 家族的参数量估计
自 GPT-4 起,前沿模型的参数量成为秘密。我们借助修订后的 IKP 长尾知识探针,测量了 GPT-5.6 全部六个变体与 Claude 5 三个现役模型:sol 与 fable/opus 同处约 2T 档,与开源的 kimi-k3 属同一区间;terra 与 luna 不可区分,pro 后缀不增加容量;而高拒答政策意味着,越诚实的模型越难被测量。
自 GPT-4 起,前沿模型的参数量成为秘密。我们借助修订后的 IKP 长尾知识探针,测量了 GPT-5.6 全部六个变体与 Claude 5 三个现役模型:sol 与 fable/opus 同处约 2T 档,与开源的 kimi-k3 属同一区间;terra 与 luna 不可区分,pro 后缀不增加容量;而高拒答政策意味着,越诚实的模型越难被测量。
家里集群里的一个节点,开始毫无规律地崩溃,有时只是一个进程,有时是整台机器。接下来的半个月,我想弄清的不是怎么让它别再崩,而是它到底坏在哪里。
一个把「中文博客字体优化」做成两周项目的过程:自托管思源黑体、frequency-bucketed 切片、赫蹏的构建时替代方案。沿途穿过 Lighthouse 的指标失真、CLReq 的 70 年时差、三引擎的 CJK 标准缺口——结论是这件事真正的难处并不在字体。
LLM 的成瘾性远比谄媚更深层——它源于无摩擦的接纳。本文援引伊瑟尔与胡塞尔的理论框架,论证 LLM 是书写史上首个全能隐含读者,而真正令人沉溺的,是你在为一个你笃信为全能的读者写作时,所浮现的那个自我。
历史学家沈城在甲骨拓片上发现了一个从未被著录的字:左「食」右「人」。半年后,他把自己吃掉了,然后从所有人的记忆中消失。
从不可靠叙述与创伤叙事理论出发,剖析小说中的泛正太化重构、想象同伴建构与哲学互文机制,揭示文本深层的反成长结构与未完成的哀悼。