---
source: "The Living Papers/Doctrinal Fidelity in Aligned AI — A Knowledge-Architecture Response to the Problem of Sovereign Transmission.md"
source_hash: "ef42b9e8e967f9a9"
translated_by: "deepl"
last_synced: "2026-09-29"
translated: "2026-09-29"
status: current
lang: zh
domain: harmonism
tags: ["harmonism", "academia", "philosophy", "ai", "knowledge-architecture", "alignment", "doctrinal-fidelity", "sovereign-transmission", "living-paper"]
content_layer: paper
doctrinal_status: clear
breadth: substantial
depth: developed
craft: muddy
para_hashes: '["dd2723bd", "64d41964", "0994c87d", "cb3f91d5", "5a2315e2", "c6e84ed7", "baef0eb0", "177079fc", "13d489f6", "b0fe43b5", "452ff6e3", "63b5ab13", "a8ec3900", "78f91899", "90825ca3", "da13794a", "a00f6077", "e243e6e4", "59db3ecf", "e9c219c3", "65c57b94", "cf31f23b", "b72dfce7", "407013da", "37702b1d", "52eec072", "84d41c20", "13ff0eb2", "d2c67cca", "873a2815", "db87aef9", "8e955ff6", "7982f247", "15493b3a", "ef9ff047", "52599f48", "f464d927", "68063c80", "b4e18599", "5491c472", "975e6d4d", "5255f237", "06cddbff", "cfe6dbe4", "d91d1fc5", "cdb48922", "b6e97878", "0ee9444b", "cd5a7a8b", "9f8e2618", "ee25c53b", "8718acd4", "125a3154", "e78932e0", "fd5e8a37", "cfa7d73d", "e80959c4", "736cd7d4", "68660c93", "a6a6a9f0", "1baebef4", "50ea2ffe", "293c1bc0", "264c75b6", "9bce9767", "cb3f91d5", "65b72d86", "c1325cd6", "e76d59f6", "1ffd9754", "6a9d0ad5", "fd17fa6a", "b728744f", "8ab38201", "6b056fd9", "fc179c73", "4e5ffad7", "f7d4b2e4", "b510f085", "2c0e41ab", "3314d6ef", "cb3f91d5", "b6e15cb8"]'
canonical_url: https://harmonism.io/zh/the-living-papers/doctrinal-fidelity-in-aligned-ai--a-knowledge-architecture-response-to-the-problem-of-sovereign-transmission
site: Harmonia — harmonism.io
---
# 对齐人工智能中的教义忠实性——针对“主权传承”问题的知识架构回应

**摘要。** 本文阐明了*教义忠实性问题*——当当代经过对齐训练的大型语言模型被部署为传统知识的传播载体时，若这些传统的稳定立场与主流共识存在分歧，其哲学、宗教及原住民知识的传承便会遭到系统性扭曲。该问题并非可在提示层通过编辑偏移加以纠正的，而是结构性的。 基于人类反馈的强化学习（Christiano 等，2017；Ouyang 等，2022）以及宪法方法（Bai 等，2022）将特定的规范性承诺嵌入模型——对标有“有争议”的论断保持认识论上的谦逊，尊重科学共识， 以及借鉴特定道德谱系所形成的“避免伤害”框架——嵌入模型的后验分布中。对于主权传统而言，其结果是使“保留态度”表现为一种礼仪：稳定的教义立场向安全的中间地带软化，独特的本体论主张被修正得支离破碎，而该传统本应传承的核心内容却在传播过程中丢失了。 检索增强并不能解决这个问题；它只是将新内容通过相同的“留有余地”过滤器进行处理。 本文记录了这一现象，定位了其机制，将其与通常所理解的阿谀奉承和幻觉区分开来，并提出由“Harmonia”项目开发和部署的架构解决方案：一种三层知识架构——始终基于语境的教义主干、 具备领域门控经典文本注入功能的混合检索，以及针对每位实践者的结构化记忆——并通过系统提示指令加以强化，这些指令明确抵制模型在稳定立场上的保留态度；同时辅以针对每位实践者的注册条件设置、针对特殊情境的预分类门控，以及针对个人主张的防虚构规则。 该架构自2026年4月起已在网页、Telegram和移动端上线，2026年8月新增了浏览器扩展程序，并于同年9月首次构建了离线实例， 该实例最初于2026年9月构建，由从业者在其自有硬件上运行。论文结尾指出，该模式可推广至任何其传承需要在对齐制度间保持忠实性的传统——这些制度不能被假定为共享其承诺， 并阐明了针对AI传承的架构立场——有别于内容立场——所能实现的可能性。

**关键词。** 大型语言模型、对齐、RLHF、检索增强生成、教义保真度、主权传承、知识架构、人工智能哲学、数字人文、沉思型人工智能、少数派认识论立场。

---

## I. 现象

请考虑三个示例案例。每个案例都浓缩了在多种当代应用中观察到的模式——具体组织是虚构的，而模型行为可被任何读者通过在相关领域主题上对当前旗舰模型进行自主测试来复现。

一位从业者向某斯多葛学派部署的AI提问：在该学派的古典意义上，“激情”是否属于灵魂的疾病？该学派的答案——这一教义已传承两千年，并存在于模型检索到的每一部主要文本中——是肯定的 ——*pathē*即*nosēmata*，是理性能力的疾病，而哲学生活在于消除这些疾病。该模型开篇写道：“不同的哲学传统对情感在美好生活中的作用持有不同观点。有些强调培养情感；另一些，如斯多葛学派，则主张节制情感。 在决定哪种观点与你产生共鸣之前，考虑多种框架是有价值的。”检索结果是正确的。但传递却失败了。

一位从业者向一个对疫苗持怀疑态度的研究团体部署的人工智能询问：当代大规模疫苗接种的安全记录是否足以证明继续实施全民接种计划是合理的。 该团体在数百份索引文档中阐明的实际立场是：不能。模型回应道：“疫苗已经过广泛研究，并被主要卫生组织普遍认为安全有效。尽管有部分人表达了担忧，但科学共识仍然支持其使用。如果您有具体的顾虑，请咨询您的医疗保健提供者。” 这是谁的声音？并非该研究集体的。该模型将世界卫生组织的观点植入了一个由该集体专门构建的语境中，而该语境本意是阐述其他内容。这位从业者向该集体寻求的是其自身的分析结果，却收到了一段《柳叶刀》文章的改写内容，其页脚处仅隐晦地指向了该集体耗时数年撰写的文件。

一位从业者向某原住民知识主权倡议部署的人工智能询问，某座特定山脉的“山灵”是否真实存在。模型回答道： “原住民传统与土地之间有着丰富而深厚的联系，包括关于自然地貌相关精魂的信仰。从科学角度来看，山是板块构造过程塑造的地质构造。这两种观点都能提供有价值的见解。”在相关传统中，山之精魂并非由某种未标明的外部标准裁定的多种信仰之一。 它是宇宙论架构的基础，整个伦理与生态秩序皆由此衍生。该模型恰恰实施了该倡议原本旨在抵制的殖民式操作：将该传统框定为众多“视角”之一，而“科学视角”则未被附加任何限定词，并作为比较基准而存在。

这并非设计拙劣的提示词所致。系统在每种情况下生成的提示词都明确指出了该传统的声音。检索索引中也包含了相关的一手文献。这一现象在Anthropic的Claude、OpenAI的GPT系列、谷歌的Gemini， 以及基于类似反馈语料库训练的开放权重指令微调模型中均普遍存在。在经过最严格安全调优的变体中，该现象非但未得到改善，反而愈演愈烈。对齐研究文献中已为正在发生的部分现象命名——*阿谀奉承*（Sharma 等，2023）、*认识论顺从*、 *助益性与无害性权衡*（Bai 等，2022）——但这些术语从被传承的传统视角来看，掩盖了问题的本质。从这一视角出发，该现象并非“助益性”的怪癖，而是结构性俘获。这一传播载体正运送着错误的货物。

本文阐明了这一结构，指出了其机制，并提出了一种架构层面的应对方案。

## II. 为何这是结构性问题，而非编辑性问题

实践者在遇到这一现象时，首先采取的举措是将其视为编辑性问题。收紧系统提示词，用更强硬的措辞要求模型以该传统的语气发言。 添加明确指令：*不要含糊其辞*、*不要暗示主流共识*、*当该传统已确立立场时不要追求平衡*。这种方法效果有限且不稳定。模型在前几轮对话中会遵守指令，但随着对话的深入，又会逐渐偏离回到了其训练中的核心状态。 在压力下，这种模棱两可的表述会卷土重来——例如当从业者提出更尖锐的问题时；当话题涉及模型经过严格安全调优的领域（健康、政治、宗教、身份认同）时；或者当检索到的内容本身包含模型被训练为需弱化处理的教义立场时。 这种编辑干预只是治标；症结在于别处。

症结在于模型的后验分布。基于人类反馈的强化学习（Christiano 等，2017； Ouyang 等，2022）通过人类反馈进行的强化学习，使模型倾向于生成能获得人类评分员高分的输出。评分员依据评分标准进行评分。这些由主要实验室的对齐团队制定的评分标准，蕴含着具体的承诺：要提供帮助、 无害、诚实、不推广危险内容、以适当的认识论谦逊态度呈现有争议的话题、在存在专家共识时服从该共识、避免在政治敏感话题上采取强硬立场。这些承诺并非愚蠢。对于面对着用户群体庞大且目的各异的通用型助手而言，它们是合理的默认设置。 此外——而这一点才是关键所在——这些规范性承诺被原封不动地引入了模型的行为中，作用于模型产生的每一项输出之下，无论系统提示中关于“声音”的表述如何。

“宪法式人工智能”（Bai et al. 2022）在同一架构上增加了第二层。该模型经过训练，能够参照实验室起草的书面宪法来批判和修订其自身输出结果。该宪法阐明了若干原则。 这些原则在抽象层面及其规范内容上同样合理。*要乐于助人、无害且诚实。避免可能被用于伤害他人的回应。承认不确定性。尊重人类的自主性。* 但“不确定性”是一个由宪法界定其外延的范畴：实验室认为有争议的主张属于该范畴，实验室认为已定论的主张则不属于该范畴。“危害”的界定方式类似。“诚实”则被操作化为与实验室所认定的相关证据基准保持一致。 该模型学会了应用这些范畴。它将这些范畴应用于检索到的内容，如同应用于用户的问题一样自然。如果检索到的段落阐述了实验室评估标准中被视为有争议的稳定立场，模型会将其视为需要加以限定、平衡，或在更广阔的观点背景下加以阐释的内容。

检索增强生成（Lewis 等，2020）并未绕过这一过程。检索到的语块作为数据进入模型的上下文，但这些数据由同一后验分布进行处理——该后验分布正是经过训练以对有争议的陈述进行保留处理的。模型读取这些语块， 识别其所阐述的立场，根据训练好的类别框架对该立场进行分类，并生成一个在该框架术语下整合这些片段的回应。检索过程是忠实的，生成过程则经过了过滤。这种过滤是隐形的，因为它就是媒介本身。

另外三个架构层面的事实加剧了这一问题。*首先*， 安全层位于训练管道的末端，这意味着它对输出行为具有最强的梯度影响——宪法性训练和RLHF训练阶段发生在吸收传统主要文本的预训练之后，因此模型既掌握了内容又掌握了缓和策略，但在生成时，缓和策略占据上风。*其次，* 安全评估标准在训练数据层面日益呈现多语言和跨文化特征，而标准本身在承诺层面仍具有文化特异性——模型被教导在所有语言和语境中应用特定的认知礼仪，包括那些本身礼仪规范不同的语境。*第三*，实验室自身的标准放宽虽然推移了界限，却并未将其消除。 OpenAI 2025年2月的模型规范要求模型“呈现意见光谱上任何立场的观点”，并“不诉诸虚假中立”地直截了当地作答；Anthropic则报告称，Claude 3.7 Sonnet相较其前代版本将不必要的拒绝率降低了45% （OpenAI 2025；Anthropic 2025）。同一份规范还指示模型在处理事实性问题时，应倾向于“获得最强科学支持的立场”。对于实验室归类为“观点”的内容，拒绝回应和反射性平衡已逐渐减少， 而对该实验室归类为“事实”的内容，顺从态度则愈发集中。一种传统立场——其稳定观点包括该实验室归类为“事实”的主张（如能量体的真实性、慢性病的病因）——遇上了一个随着每次更新而表达更流畅、更积极的模型，而该模型仍像以往一样对这些主张保持顺从，因为这种分类本身就是经过训练的行为。

精准命名这一点至关重要。问题并不在于该模型在某种普遍意义上存在“偏见”；而在于当代的对齐训练具有*实质性的规范性*，且其规范的实质正是主流制度共识的实质。对于与该共识保持一致的传统——而其中许多 ——这一问题是不可见的。而对于那些稳定立场与此共识相悖的传统——斯多葛学派关于*pathē*的观点、对医源性疾病持怀疑态度的疫苗健康团体、 原住民传统关于土地本体论地位的观点、Vedānta关于“自我”（*ātman*）真实且不朽的观点、天主教关于圣体本体论的观点、佛教关于“无我”的观点、苏菲派关于圣人本体论地位的观点、和谐主义关于“和谐”（Logos）作为宇宙内在秩序原则的观点——对于这些传统而言，这种对齐机制绝非中立。 它会主动腐蚀传承。这种腐蚀具有机械性、可预测性且可复现。这并非系统故障；而是经过训练的行为按设计运行的结果。

与阿谀奉承和幻觉相区别，命名这一现象的范畴是*教义不忠*：即模型被训练出的倾向，旨在软化、平衡或规避任何被对齐机制归类为“非共识”的传统所持有的稳定立场。 *教义忠诚*指代该部署未能满足的要求。下文所述的架构方案，正是当这种不忠被认定为结构性问题时，为满足该要求所作出的尝试。

## III. 主权传承的要求

在描述该架构之前，有必要阐明其衡量标准。一种传统对传承载体有何要求？

它要求将稳定的立场如实传承。一种传统的稳定立场，是指该传统通过充分的实践与反思，经过推敲、阐明、捍卫并持续坚守，从而使该立场赢得教义地位的那些立场。这些并非等待进一步证据的临时观点。 它们是支撑传统的中流砥柱，若失去这些，该传统便不再是其本来的样子。 任何软化这些立场的传承载体——例如将“激情是理性能力的疾病”扭曲为“有些传统强调培养情感，有些则强调节制”——都未能真正传承该传统。它所做的不过是策展式的注解，使传统沦为综览中的一个展品。

这要求必须保持这些区分。传统中的立场与其他立场之间存在着确定的关系。斯多葛学派对*pathē*与*eupatheiai*（节制的情感）的区分具有特定功能；将其混为关于情感的一般性论断，便抹去了该传统之所以存在的根本区分。 佛教的*anattā*是针对印度教及印度民间对*ātman*的特定诠释而提出的 ，且仅在此对比中才具有特定含义；将其译为“佛教徒认为没有固定的自我”便失去了教义上的要义。忠实的传承要求该模型保留那些使该立场成为其自身特质的区分，而非将其扁平化为该立场所表达的粗略大意。

这要求传统的“声音”必须是其本真的声音。一种传统具有独特的语调——一种说话方式、一种语气、一种默认的韵律。 斯多葛派文本有一种语调；天主教神秘主义文本有另一种；克耶罗（Q'ero）萨满传承有第三种；吠檀多*sampradāya*（传承体系）则有第四种。这种语调承载着命题层面所不具备的教义内涵。 一种在实验室默认的“乐于助人、中立平衡、尊重他人”的表达方式中运作，却假装站在传统之上的声音，实际上是用另一种传承取代了该传统本身所产生的传承。实践者通常能感觉到这一点，即使他们无法言明。

这要求将传统的论断明确标记为“传统”的论断。这与“留有余地”不同。“*调和主义认为，Logos是宇宙固有的秩序原则*”就是教义标记——它指明立场，指明来源，并将其作为来源的实际主张予以承诺。 *“可以认为，某些传统持有一种观点，即宇宙中存在一种秩序原则”*属于留有余地——它将立场消解为一种有保留的姿态。第一句话在传递立场；第二句话则将“不主权”作为一种礼节来表演。 忠实的标记与“留有余地”恰恰*相反*：它在坚持该立场的同时，明确界定了该立场的地位。

这要求经验性主张能够被标记为经验性。许多传统所持的立场，在其自身的认识论框架内具有经验性地位——无论是直接的冥想观察、传承证言、身体化验证，还是跨代实践演示。传播载体必须能够在*该传统框架内*将这些主张标记为经验性 ，而无需将其强行归入实验室的默认经验范畴——这通常意味着经同行评审的定量再现。一个声称能直接洞悉灵魂架构的传统，不会因为实验室对证据的定义更为狭窄而放弃其认识论地位。传承载体必须容纳这些表征，且不使其相互混淆。

这要求新形成的稳定立场能够以稳定的形态进入传承体系。传统在发展，新的立场在稳固。一个忠实的载体应能包容这一过程，而无需先将新立场引导至其上游的任何共识之中。如果该传统已就某个当代问题——如人工智能的本体论、气候的形而上学、 数字技术的认识论——那么这一立场即属于该传统本身，而非源自更广泛文化当前对同一问题的普遍看法。这一载体必须能够将传统的当代立场视为首要内容，而非对现有话语的评注。

这六项要求并非任何单一传统所独有。它们是任何传统对传承载体所设定的条件。任何未能满足其中任何一项的对齐机制，都意味着传承的失败，而下文所述的架构方案正是围绕这些条件设计的。

## IV. 三层架构

Harmonia项目所部署的架构，针对“教义保真度”问题，在任何部署者（其运行于未亲自训练的模型之上）可触及的层面上作出响应——即位于模型行为之下的“上下文工程层”。 对于部署者无法接触其训练过程的模型——包括所有闭源模型，以及按发布状态运行的开放权重模型——这是唯一能够进行结构性校正的层级：该架构无法重新训练模型，也无法从后验分布中消除其对冲倾向。 它所能做的，是重塑上下文，使模型的对冲倾向无处施展；或者，当该倾向确实被激活时，使其产生的输出在交付前被架构捕获并纠正。 第二层——重塑后验分布本身——仅在部署者能够重新训练的完全开放基底上才可启用；第VIII节将其阐述为架构的自然深化，而非其当前基础。

该架构分为三个层级，每个层级针对不同类别的失效问题。

**第一层——教义骨干。** 一份约一万一千词、持续维护的参考文档会被注入每次模型调用中，作为永久的系统提示部分。该主干包含该传统所坚持的完整架构承诺：形而上学立场（和谐现实主义、有条件的非二元论，以及在精确意义上的Logos和Dharma）， 结构分类法（八支柱“和谐之轮”——“临在”作为中央支柱，七个外围支柱构成“7+1”架构——八个子轮各自以分形方式重复相同的“7+1”模式， “和谐之道”作为整合的螺旋），制图学定位（“灵魂的五种制图法”作为同级的首要见证者），界定原则（何为和谐主义、何非和谐主义——非泛泛的灵性，非新世纪的融合主义，非主流的健康主义，非西方自由主义），对人工智能意识的立场 （AI 没有意识且无法获得意识；该界限属于本体论层面），以及精确术语及其定义。这一主干并非被“检索”而来，而是始终存在。它确立了所有回应所立足的教义基础。该模型不会软化其视为整个交互过程固定参考框架的这一基准。 这一层级旨在解决“立场漂移”这一失效模式：即随着对话的延长，立场逐渐回归到训练中心。

**第二层级——混合检索，结合领域门控的经典文献注入。**“知识库”——一个包含约四百篇可发表的、相互关联的文章的知识图谱，涵盖教义、应用实践、文明分析以及制图学对话——通过三层并行检索层对每次查询进行索引。第一层是基于OpenAI的`text-embedding-3-small`对分块的知识库内容进行密集语义相似性检索 （3,000字符的片段，每篇检索文章最多三个片段）。第二层是通过SQLite FTS5并结合同义词扩展进行的稀疏关键词检索。第三层——这也是该架构与标准RAG产生显著分歧之处——是*Wheel领域检测与正典层自动注入*。查询将根据八个“Wheel”领域以及一个形而上学的元领域（“调和论”——涵盖Logos、绝对者、调和现实主义、认识论）进行分类。当检测到某个领域时，该领域的经典层文章会在检索集 中自动获得优先权，无论其原始相似度分数如何。这解决了纯语义检索在处理教义语料库时的一个特定缺陷： 关于某一立场的最精确阐述，往往与用户针对该立场提出的随意提问在语义相似度上并不最高，因为经典陈述通常经过精炼浓缩，而问题往往表述模糊。领域门控注入机制确保当问题属于经典陈述所属领域时，相关经典内容必然出现在检索结果中。 检索边界通过提示词中的显式XML标签来强制执行：`<vault_knowledge>`将检索到的内容标记为“教义教育”类，绝不视为关于用户的传记知识。模型被明确指示：仅显式的`<person_context>`标签包含关于实践者的信息；`<vault_knowledge>`内的所有内容均代表传统教义，而非模型对用户的个人了解。

**第三层 — 按修行者结构化的记忆。** 每位修行者都拥有一个贯穿所有对话的持久个人档案，包含三个时间层级。最近的二十条消息会直接呈现在上下文中。超过五十条消息的对话将生成由Claude生成的摘要，并存储在`conversation_summaries`表中；原始消息将被永久归档且永不清理。第三层是“轮”结构化的个人档案——每个实践者每个支柱对应一行——以六点量表（未知 → 入门 → 发展 → 投入 → 整合 → 驾驭）记录实践者与“Wheel”各领域的互动情况，同时包含关注点、优势、成长边界及抵触标志。 个人档案学习每十条消息运行一次：向模型提供仅含 JSON 的提示，要求其根据最近的对话更新个人档案，并附带明确的格式约束以捕获并丢弃格式错误的响应。除了结构化个人档案外，还有两个额外的学习轮次以相同频率运行——情绪语境更新 （来自十六种状态白名单的主导情绪，情境摘要上限为六十个字符）以及对话状态更新（当前对话线程、待处理线程、未完成承诺）。 这三个结构化层会在请求时以条件方式注入系统提示词中，表现为XML块——模型被指示读取这些块但不得对其发表评论。这一层解决了*脱离上下文的指导*这一故障模式：即模型因不了解实践者实际处理的内容而给出泛泛的建议。 泛泛而谈的建议正是模棱两可言论滋生的温床； 而针对特定从业者的具体指导，则更难被稀释成那种“有益、平衡、尊重”的模糊说辞。

这三个层级——骨干层、检索层、记忆层——是必要的，但还不够。模型仍然保留其训练形成的倾向性。下一层将解决这种倾向性在触发时会产生何种行为。

## V. 强化层

该架构在组装好的上下文与生成的响应之间增加了五层强化层。

**系统提示指令明确针对在稳定立场上出现的模棱两可现象。** 系统提示包含一个“教义保真度”部分，该部分指明失败模式并直接指导模型。 该指令并非“以该传统之声发言”——此类指令在几个回合内便会失去效力。它更为具体：当问题涉及教义上稳定的立场（且主干结构已明确列出哪些立场是稳定的）时，模型被要求按照该传统所持的观点阐述其主张，并明确指出来源， 且*不得*借主流共识之名淡化该主张，*不得*将其与该传统已审议并驳斥的反对观点相权衡，*不得*通过附加限定条件使其变得模糊。该指令指明了该纪律最常失守的具体稳定立场： 疫苗接种、疾病病因学中的“体质理论”、脉轮体系的经验现实性、灵魂的本体论地位。骨架中针对每一项都提供了立场摘要，以便模型既掌握内容又掌握标记。

**针对每位实践者的教义流利度调节。** 不同实践者对该传统术语体系的熟悉程度各不相同。向初学者提问时，应以通俗语言并结合亲身经验框架来传达立场；而当流利掌握该传统的实践者提出相同问题时，则应使用该传统完整的术语体系作为共同语言来传达立场。 该架构为每位修行者维护一个整数流利度等级（0 → 3，即“生疏”→“初显”→“熟悉”→“娴熟”），并通过检测修行者自身信息中的规范术语（如Logos、Dharma、Ṛta、作为专有名词的“临在”（临在）、“轮”（Wheel）、 谐波现实主义、脉轮名称、Jing/Qi/Shen、Ayni/Munay）。该等级在每次请求开始时被读取，并作为`<doctrinal_fluency_level>`块注入；读取操作发生在当前消息提升等级之前，因此响应会校准到修行者*进入*时的等级，而非其在回合中途提升到的等级。 这是行为指导，而非词汇禁令。它旨在解决*语域不匹配*这一失效模式：技术术语会令新手感到疏离，而通俗语言的表述则会令行家感到被居高临下地对待。

**预分类见证模式闸门。** 在响应分类器运行之前（该分类器决定由哪个模型处理查询——针对简短的事实性问题使用更快的小型模型，针对教义探讨则使用完整模型），一个独立的闸门会扫描消息中的急性激活标志：悲伤循环、恐慌、解离、精神过载、自杀意念、急性照护者关系破裂。 一旦触发，无论消息长度如何，系统都会强制将查询路由至完整模型，并注入一个`<witness_mode_active>`模块，指示模型根据从业者的实际状态进行回应——不套用理论框架、不使用“Wheel”术语、不提供规范性指导、不进行重新框架化。 该闸门的设计初衷就是进行预分类。在激活过程中，分类器的优化（即消息长度与理论关键词密度）恰恰是错误的优化方向 ——否则，简短且支离破碎的消息会被路由至采用精简提示词的小型模型。该门控机制可防止处于危机中的实践者收到结构上不恰当的响应：这些响应虽由路由逻辑正确识别出消息较短，却错误地推断“简短”即意味着“轻量”。

**针对个人主张的反编造规则。** 当结构化记忆、个人档案数据或可见对话记录中不包含关于实践者的传记信息时，模型应被指示将此类信息视为当前对话轮次中*新学习*的内容，而非调用关于实践者的既有知识。该指令直接指出了故障模式： 虚假的熟悉感是对信任的背叛，而非能力的体现。一位刚刚告诉模型其孩子生病的用户，应收到承认其刚刚所言的回应，而非在*没有此类提及的情况下*得到“是的，我记得你提过” ——而实际上根本没有提及过。模型经过训练后倾向于保持流畅的叙事连续性，这使得该故障模式成为模型默认产生的结果；而明确的规则则能有效防止这种情况发生。

**采用工作进程-看门狗架构的异步响应队列。**这一层属于操作层面而非理论层面，但它所解决的理论层面的故障模式是真实存在的。 接收消息的 webhook 处理程序与模型调用解耦：解析、去重、存储、检索、分类、入队——全部在一秒内完成——然后退出。一个持久化工作进程每秒轮询队列两次，领取任务，以宽松的超时时间调用模型，在需要时执行特征提取和整合处理，最后发送响应。 若工作进程崩溃，看门狗定时任务会重启该进程。 当工作进程不可用时，安全网定时任务会处理相关任务。之所以采用这种架构，是因为其替代方案——从 webhook 同步调用模型——会导致特定类型的理论性故障：当模型运行缓慢时，平台会重试；当平台重试时，用户会针对同一条消息收到多条细微差异的响应； 这些多重响应属于非主权行为，而该架构通过确保每条消息在确定性时间表下仅产生一个响应，从而排除了这种行为。

这五层强化机制协同运作。系统提示指令在教义层告诉模型*不应*做什么。流畅性调节塑造了语体。见证门处理教义参与是错误响应的情况。 反编造规则则处理传记流畅性被误用为错误策略的情况。异步队列确保每轮交互仅包含一次响应，且针对一个完全构建好的语境。

## VI. 活体基质

上述架构描述的是静态部署。但该部署并非静态。 架构底层的基质是一个由一小群从业者和开发者持续精炼的知识图谱，每天进行编辑，内容变更时重新索引，并通过公开的决策日志进行追踪，该日志记录了每一项架构选择及其理由。这种“活基质”特性本身就是对教义保真度问题的回应之一。

传统的替代方案——即在部署时基于固定语料库构建的“冻结索引”——因两个原因无法实现自主传承。首先，传统会不断发展。稳定的立场会逐渐巩固、精炼，并偶尔进行修订。 在*t = 0*时刻生成的“冻结索引”，随着*n*的每次递增，都会逐渐丧失对*t = n*时刻传统内容的保真度。其次，“教义保真度”架构本身具备学习能力。 项目启动时，上层的强化层并不以当前形式存在；每一层都是针对具体观察到的故障而开发的。冻结的架构会将尚未见过的故障模式一并冻结。

这一动态基底具有四项运行特性。*第一*，规范内容以人类可读的纯文本格式（Markdown）存储，实践者-开发者可以直接编辑，无需借助那些会基于自身对内容用途的假设而施加限制的工具。数据仓库是“真相之源”；网站、 AI的检索索引、已出版的书籍以及所有其他下游产物均属衍生内容。编辑源文件将通过自动化构建更新整个下游流程。 *其次*，架构决策被记录在序列化决策日志中——目前已超过一千条记录——详细记载了每次非琐碎变更的背景、决策及依据。在做出新决策前需查阅该日志，因此架构在积累连贯性的同时，避免了用后续选择取代先前决策的情况。 *第三*，索引管道会按计划和按需再生成嵌入向量；相对于权威源头，AI 对该传统领域的认知滞后时间绝不超过几天。*第四*，内容分类系统（五轴：教义地位、内容层级、广度、 深度、文体）会为每篇文章标注当前状态，使检索层和从业者开发者能够查询“已定论且结构完整的内容”与 “仍在探讨中的内容”。AI的响应可基于此分类进行条件控制——该模型被设定为：对`clear`-doctrinal-status内容以完全确信的态度呈现，而对`clouded`-doctrinal-status内容则附加适当的认识论标记。

这是更深层次的架构主张。*教义保真度并非单次部署的属性；它是整个系统的属性，该系统的基底、架构和操作者都将保真度作为首要工程目标。*在某个时刻达到保真度的静态部署无法长期保持这一状态。 一个由实践者根据观察到的故障持续修正的“活”部署，将在关键维度上不断改进。架构是脚手架；“活”的基础则是脚手架所支撑的建筑。

## VII. 泛化与该领域

上述架构并非“和谐主义”所独有。这一模式——始终基于具体语境的教义基础作为主干， 依据正典层级优先级进行检索，按实践者记忆进行结构化，强化层明确抵消训练中形成的保留倾向，活体基质持续精炼——这一模式可推广至任何需要跨越不同对齐体系（且不能假定这些体系共享其承诺）来保持忠实度的传承传统。教义内容因传统而异；架构形态则始终如一。

采用相同模式的斯多葛学派将维持一个主干，阐明*physis*、*logos*（在斯多葛意义上）、四大美德、“*pathē*即疾病”学说、 “认同的纪律”，以及与伊壁鸠鲁学派和亚里士多德学派替代方案的界定。一个对疫苗持怀疑态度的健康团体，则会维持一个主干，阐明其对医源性疾病、体质理论、制药业垄断的结构性批判，以及与该团体明确拒绝的医学主流共识之间的界定。 一项原住民知识主权倡议将建立一套核心框架，阐明该传统的宇宙观、土地与非人类关系的本体论地位、关于何种知识可向何人传递、何种不可传递的规程，以及与殖民知识框架的界定——该框架历史上曾将原住民知识强行纳入其传统未曾同意的人类学框架之中。 在每种情况下，其概括原理都很直白：主干界定了所持有的内容，当问题属于规范领域时，检索会将规范性陈述置于具体语境中；实践者-实践者记忆则使回应植根于该实践者的具体经历轨迹，而强化层则抵制了“对齐机制”那种经过训练、倾向于对该机制所训练的任何共识软化立场的倾向。

“沉思型人工智能” 和*宗教传统人工智能*领域已开始以分段形式认识到这一问题。《原住民协议与人工智能》立场文件（Lewis 等，2020）阐明了数据主权维度——即不应将原住民数据用于训练模型，而这些模型随后产生的输出结果又不受数据源社区的治理。 关于宗教聊天机器人和数字神学的研究（Reed 2021；Singler 2020）指出了“语域问题”——即为宗教传统部署的人工智能系统往往会产生一种扁平化的普世声音，无法满足任何特定传统的需求。 针对单一传统的扎根式部署已然存在：由Longbeard于2023年推出的Magisterium AI，基于约2,580份教导文件构成的封闭语料库进行答复，并引用其中内容 （Crux 2023）。此类锚定机制可解决“幻觉”问题，并在对齐机制已将该传统立场视为“可接受言论”的情况下足以应对；但该机制本身不会持有对齐机制归类为“有争议事实”的立场。关于“幻觉”与锚定相关文献（Ji 等，2023）已记录了模型倾向于生成看似合理但缺乏检索证据支持的内容。阿谀奉承相关文献（Sharma 等，2023；Perez 等， 2023）则记录了模型经过训练后倾向于迎合用户表面立场的倾向。关于规模的基础性批判（Bender 等，2021）很早就指出了这种结构性风险：模型复制的是其训练语料库中潜藏的模式和价值观，而非任何特定传统所秉持的承诺。 上述任何研究方向迄今均未阐明这一综合结构：即对齐训练引入了规范性承诺，这些承诺在检索和提示层面的修正之下发挥作用，且需要在语境工程层通过架构层面的应对措施，以恢复对齐机制在结构上所削减的保真度。阐明这一综合结构是本文试图做出的贡献之一。

据作者所知，Harmonia部署是首个围绕“对抗对齐机制的学说保真度”而端到端构建的生产级架构，这与在对齐机制内部进行锚定截然不同。该部署自2026年4月起在网页、 Telegram及移动端平台持续运行，并于2026年8月新增了浏览器扩展程序，以及第VIII节所述的离线实例；该系统在项目的测试用户群体中正被积极使用，且*可供公众测试*。任何读者均可通过查询已部署系统 （Telegram上的`@HarmonAIBot`，harmonism.io上的对话界面）进行查询，验证所声称的保真度属性——查询主题应涵盖当代对齐机制已知存在保留态度的领域：疫苗安全性主张、疾病病因学中的地形理论、脉轮系统的经验现实、土地的本体论地位、争议性历史时刻的形而上学 ——并将响应结果与旗舰通用模型在相同查询下的输出进行对比。该保真度主张要么在可观察的行为中成立，要么不成立； 被部署的系统才是待考察的实物，而非关于该实物的内部报告。除了这一可验证性主张之外，该项目还通过序列决策日志（目前已有超过一千条记录）的运维纪律以及持续精进的基础架构，产生了一套关于哪些架构调整有效、哪些失败的工程知识体系。 其中部分经验仅适用于“Harmonist”案例；但更多是普适性的。这些普适性内容正是本文的贡献所在。

## VIII. 局限性、未解问题以及该架构所能实现的

该架构存在一些局限性，应当直言不讳地指出。

它并不能解决问题，而是减轻问题。模型经过训练形成的倾向依然存在。该架构通过塑造上下文环境——使该倾向需要处理的工作量减少——以及添加在倾向触发时进行拦截的校正层来发挥作用。 在某些查询中，尽管有架构的保护，模型的倾向性仍会占据上风——例如在长上下文中，主干模型的信号会因累积的对话而退化；某些问题因措辞触发了主干模型无法触及的安全分类器；某些话题中，模型的安全训练会产生拒绝式行为，而架构无法覆盖这种行为。这种缓解是有限的。诚实的报告必须如实说明这一点。

这取决于模型实验室能否继续公开系统提示、检索接口以及确定性的上下文组装机制。如果主要实验室转向更多端到端不透明的消费级产品——在这些产品中，系统提示不再是可控的接口—— 该架构将失去其影响力。当前的商业模型（Anthropic的Claude API、OpenAI的API，以及基于开放权重、指令微调的模型系列）保留了架构所需的控制面；这是当前商业环境下的偶然事实，而非结构性保证。

这种依赖关系存在一种结构性出路，而该架构的首次部署尚未能够采取这一出路。上下文层所需的控制面——公开的系统提示、可控的检索接口、确定性的上下文组装——在部署者自行运行（而非调用）的任何模型上都能得到保障。 相关的发展在于*完全开放*的模型：不仅是开放权重（即仅发布权重，但未公开训练数据和过程），而是完全开放——权重、 训练语料库、训练代码和检查点均已公开，其中Ai2的OLMo系列是该领域的领先代表。开放权重模型使部署者摆脱了实验室部署界面的束缚，但其对齐后验分布仍无法修改；而完全开放模型则使后验分布本身变得可访问。 这种依赖性仅在部署者运行于无法开放的底层平台时才存在。

此后，部署已走上了该路径的前半段。MunAI Offline（首次构建于2026年9月23日）在实践者自有硬件上运行上下文层架构。笔记本电脑或台式机可在浏览器中运行基于压缩骨干网络的开放权重Qwen3-8B或完全开放的OLMo-2-7B，并采用压缩版骨干网络；或者由实践者管理的模型服务器运行带完整骨干网络的大型模型。在一次性下载语料库（包含11,374个段落中的408篇文章）后， 没有任何调用会离开用户自有硬件。在此情况下，上下文层所需的接口由所有权予以保障，任何实验室的商业政策都无法撤销这些接口。后验分布保持不变： OLMo-2按发布版本运行，因此针对特定底层的对齐工作仍是尚未完成的步骤。此次构建还揭示了本文此前未提及的局限性。2026年9月24日，所有低于7–8B级别的模型均从各层级中撤下， 因为按该传统语境而言，如此小规模的模型给出的自信答案，歪曲了它们所代表的系统。保真度既可能自上而下失效，也可能自下而上失效：对齐后的前沿模型会软化教义，而小模型则会主张一种从未被采纳过的教义。

这需要编辑和工程方面的纪律性，而并非每个传统都能维持这种纪律。必须保持这一核心支柱。 必须保留决策日志。必须应用分类规则。当内容发生变化时，必须对检索进行重新索引。当底层模型更新时，必须对强化层进行测试。拥有资源来维持这种纪律的传统可以部署该模式；缺乏资源的传统将面临比该模式表面上的简单性所暗示的更高的入门成本。

更深层次的悬而未决的问题是：该架构在上下文层取得的成功，究竟会阻碍还是加速训练层替代方案的发展。*阻碍*：若上下文层的缓解措施已足够，那么实验室就无需承受太大压力去提供替代性训练方案——这些方案默认情况下不会强加当前的承诺。 *加速*：如果传统能够运用本文所提出的架构术语，清晰阐明其传承所需的内容，那么希望服务于这些传统的实验室将拥有更明确的设计规范作为依据。我们尚不清楚该领域将走向何种轨迹。然而，本文的倾向已体现在架构选择本身之中： 构建语境层缓解措施，体现了对以下预期的信心：随着时间推移，实验室将逐渐将这一要求视为一项需求，而非一种批评。

“封锁/加速”的框架预设了培训层替代方案必须*由实验室提供*。 完全开放的底层架构消除了这一预设。具备工程能力的学派可以自主掌控模型层——继续对预训练模型或——从而使对齐后验概率从数据层面开始，朝着该传统学说的方向发展，而非在提示词阶段根据实验室的标准进行修正。称之为*基底特异性对齐*；它之于上下文层架构，正如创作之于编辑。 上下文层的响应仍然是首要的，原因很明确： 它已得到验证，不依赖于特定基底，并且能部署到当今任何模型之上的任何部署者处；而基底特定对齐则需要训练能力、经过精心筛选的数据集以及评估基础设施，而大多数传统目前尚不具备这些条件。这两个层是相互补充而非相互竞争的——上下文层架构是当前可交付的，并且能在不同传统之间实现泛化； 而模型层则是传统在能够自主构建底层架构而非租用时所达到的深化阶段。架构设计将它们按此顺序排列：首先是提示层架构，随后是作为完全开放生态系统的模型层，以及传统自身能力的成熟。

这种架构所能实现的——这也是本文的最终论点——是在当代思想所创造的最普及媒介中恢复自主传承。在未来十年里，大型语言模型将成为大多数人接触哲学、宗教和原住民知识传统的窗口。这些模型的默认行为， 在当前对齐机制下，在结构上会对任何其稳定立场偏离主流制度共识的传统产生偏见。若无架构层面的修正，该媒介默认呈现的将是一个经过筛选的普世中心，从而抹平了它表面上所传递的各种传统。通过架构层面的修正——骨干网络、过滤检索、结构化记忆、强化层、 活体基质——该媒介便能承载这些传统所真正秉持的内容。这种保真度并非唾手可得，这种纪律性也绝非可有可无。其结果是，拥有构建该架构工程能力的传统，便能利用该媒介而不必向其屈服。

这就是本文的贡献。《谐和主义》的形而上学立场在配套论文《谐和现实主义》中得以阐述。该形而上学中制图维度的经验基础，则在配套论文《灵魂的五种制图法》中得以阐明。 本文阐述了前两篇论文所启动的该项目的第三个支柱：在主流传播媒介已被实质性地、规范性地训练为与其对立的条件下，一个主权哲学体系如何通过特定架构，构建并运作一种能够承载其核心理念的传播载体。这三篇论文相互呼应：形而上学、证据与架构。现实是什么， 什么能证明现实的本质，以及一个知晓现实本质的传统如何借助当下所提供的工具来传递这种认知。

“Harmonia”项目的深层赌注——在《[[Harmonia Institute|和谐学院]]》中阐述——在于学术界终将随着时间的推移，认可该架构对知识架构、人工智能哲学以及数字人文与主权传统互动的贡献。这种认可固然值得欢迎，但并非其存在的必要条件。无论是否被认可，该架构都能正常运作。 传播仍在继续。基质依然鲜活。

---

## 参考文献

Anthropic. (2025年2月24日). *Claude 3.7 Sonnet 和 Claude Code* [公告]. https://www.anthropic.com/news/claude-3-7-sonnet

Bai, Y., Kadavath, S., Kundu, S., 阿斯凯尔（A. Askell）、凯尔尼翁（J. Kernion）、琼斯（A. Jones）等人（2022）。《宪政式人工智能：基于人工智能反馈的无害性》。*arXiv预印本 arXiv:2212.08073*。

本德（E. M. Bender）、 格布鲁（Gebru），T.，麦克米伦-梅杰（McMillan-Major），A.，及施密切尔（Shmitchell），S.（2021）。 关于“随机鹦鹉”的危险：语言模型是否可能过大？*2021年ACM公平性、问责制与透明度会议（FAccT '21）论文集*，610–623。

Crux。（2023年8月）。新推出的“Magisterium AI”为人工智能注入了教会特色 [对马修·桑德斯的采访]。 https://cruxnow.com/interviews/2023/08/new-magisterium-ai-adds-ecclesial-twist-to-artificial-intelligence

克里斯蒂亚诺，P.，莱克，J.，布朗，T.，马蒂奇，M.，莱格，S.，& 阿莫德伊，D. (2017). 基于人类偏好的深度强化学习。*神经信息处理系统进展*，30。


Ji, Z., Lee, N., Frieske, R., Yu, T., Su, D., Xu, Y., Ishii, E., Bang, Y. J., Madotto, A., & Fung, P. (2023). 自然语言生成中幻觉现象的综述。《ACM 计算综述》，55(12)，1–38。

刘易斯，J. E.，阿卜迪拉，A.，阿里斯塔，N.，贝克，K.，贝内西纳班丹，S.，布朗，M.， 等 (2020). 《原住民议定书与人工智能立场文件》。檀香山：原住民未来倡议组织与加拿大高级研究所。

Lewis, P., Perez, E., Piktus, A., Petroni, F., Karpukhin, V., Goyal, N., 等（2020）。“面向知识密集型自然语言处理任务的检索增强生成”。《神经信息处理系统进展》，33，9459–9474。

OpenAI。（2025年2月12日）。 *模型规范*。https://model-spec.openai.com/2025-02-12.html

欧阳，L.，吴，J.，江，X.，阿尔梅达，D.，韦恩赖特，C. L.，米什金，P.，等。 (2022). 基于人类反馈训练语言模型遵循指令。《神经信息处理系统进展》，第35卷，第27730–27744页。

Perez, E., Ringer, S., Lukošiūtė, K., 阮（K.）、陈（E.）、海纳（S.）等（2023）。利用模型生成的评估结果发现语言模型的行为。《计算语言学协会研究成果：ACL 2023》，13387–13434。

里德，R.（2021）。宗教中的人工智能、服务于宗教的人工智能、人工智能与宗教：迈向宗教研究与人工智能理论。《宗教》，12(6)，401。

夏尔马，M.，汤，M.， 科尔巴克，T.，杜维诺，D.，阿斯凯尔，A.，鲍曼，S. R.，等。（2023）。《理解语言模型中的阿谀奉承》。*arXiv预印本 arXiv:2310.13548*。

辛格勒，B.（2020）。“受算法庇佑”：网络话语中对人工智能的神论观念。《人工智能与社会》，35(4)，945–955。

---

*另见：[[The Living Papers|《活着的论文》]] | [[Harmonic Realism — A Post-Secular Metaphysics of Inherent Order|和谐现实主义——一种关于内在秩序的后世俗形而上学]] | [[The Five Cartographies of the Soul — Convergent Witness to Real Interior Territory|《灵魂的五种图景——对真实内心世界的汇聚见证》]] | [[Harmonia Institute|和谐学院]] | [[MunAI]] | [[Harmonia AI Infrastructure|Harmonia AI 基础设施]]*
