橙研所

Delphi Clone · 数字分身平台

把一个真人蒸馏成可对话的数字分身:多源喂料 + 自适应访谈钻探 + 溯源 RAG 作答 + 对齐飞轮 + 本人声线,整条流水线自建并跑在生产里。

实验室 · 生产中约 2 分钟

领域专家最稀缺的是时间:懂的东西很多,但一对一回答不可复制,知识散落在笔记、文章、播客里没法被直接问。这个项目是 delphi.ai 的 clean-room 复刻——机制借鉴、代码 100% 原创——做一个「自克隆」数字分身平台:把本人蒸馏成可对话的分身,代本人 7×24 回答上门受众,答不上来就交还真人。全链路闭源,跑在私有生产环境;完整拆解见文末的公开 deck。

它解决什么

痛点现状
知识不可被问思考散落在笔记 / 文章 / 音频里,受众只能读,不能追问
时间不可复制一对一问答质量最高,但一天只有 24 小时
通用 LLM 会替你编造直接拿 LLM 冒充本人,答不上来的地方它会一本正经地编

核心机制:蒸馏 → 作答 → 飞轮

蒸馏:多源采集(笔记 / 网址 / PDF 文件)统一入库,再用自适应访谈做三级钻探——从种子观点问到反例、再问到边界,产出结构化断言而不是一堆文本块。分身的「像」来自断言层,不是来自语料堆量。

作答:受众无需登录,浏览器直接对话。检索链路是向量召回 + 父块上下文 + rerank,作答带 grounding 三态判定——料够就答并附引用溯源,料不够就明说不知道,绝不编。回复可用本人声线 TTS 播报,页面主动做 AI 分身标识。

飞轮:holdout 保真评测给每个分身打对齐分;每日离线反思(Dreaming)从真实对话里聚出高频问题、热引用片段和知识盲区;分身答不上的问题走留言箱交还本人,本人的回复经批准后回灌进知识库——分身答不上的地方,正是下一轮蒸馏的靶子。

三个实打实的工程判断

  1. 防编造不是一个 prompt,是四层机制——检索阈值、grounding 三态、拒答闸、引用溯源层层兜底。消融实验证明四层齐上才堵得住「像本人口吻的胡编」。
  2. 记忆要能删干净——受众行使「清除记忆」时,不但要删已落库的记忆,还要连带清掉排队中的反思任务,否则被删的记忆会被后台任务悄悄写回来。删除权是端到端语义,不是一条 DELETE。
  3. 受众说的话永不自动进人格库——所有来自对话的候选知识一律经本人审核批准才入库。这条是保真的底线:分身代表的是本人,不是「本人 + 网友」。

配套拆解

这个项目的完整产品与架构拆解已做成公开 deck:Delphi Clone 拆解——从「像不像」到「真不真」的论证主线,覆盖蒸馏、检索、对齐飞轮与合规设计。

一句话

不是「套壳 chatbot」,是一条从蒸馏、溯源作答到对齐回灌都长在一起的自克隆流水线。