方法论
一份经过严谨构建的档案,而非语言上的把戏。
每一段对话的背后,都是精确的资料收集与核实工作,我们不会凭空生成一个看似可信的人物,而是尽力构建最完整的档案。
资料收集
文字、录音、针对性问题的回答:本人(或其代表人)选择分享的每一份资料,都会成为档案的一部分。
心理语言画像
我们分析词汇、句式结构、反复出现的话题以及道德立场,以识别使一种表达方式可被辨认出来的特征,而不仅仅是所用的词语本身。
完整性核实
每份档案都会依据可靠所需的资料量进行评估:如果缺口过大,我们会如实说明,而不会随意填补空白。
模型构建
经核实的档案用于训练或引导一个专属的语言模型,该模型绝不会在不同人之间共用。
经同意后激活
在拥有决定权者(本人,或依据我们的同意规则代表本人的人)授权之前,模型将始终保持未激活状态。
这一流程源自我们内部的研究框架,用于衡量一份档案在被视为可靠之前究竟有多完整。技术细节仅供我们的研究人员内部使用,但其原则是公开的:我们绝不会发布一个我们自己都知道逊色于真实本人的回声。



