CPRS早期模型使用过大量已完成匿名化的历史行为研究、神经反应资料和压力决策样本。来源很多。年代跨度也大。大部分授权纪录完整。
真正难查的是最早那批。立项初期,研究团队曾从几个大型历史资料库取得去识别化样本。那些资料库本身又经历过合并与转移。部分原始提供机构早已不存在。
一直到晚上七点多,林河才从旧档里翻出一个名字。**旧行为资料集。**不是单一研究。而是一个长期整并的历史资料包。
里面收过不同年代、不同机构留下的去识别化行为与生理数据。
CPRS早期只使用其中一小部分压力决策与生理反应样本。占整体资料来源比例不高。後续模型更新後,权重也不断下降。问题出在旧资料集本身的来源。
第一层还能追。再往前,就开始只剩机构代码、旧资料库编号和转移批次。越往早期越碎。有些来源栏甚至只剩匿名代码。
许克明问:「能比研究中心留下的旧资料?」
林河点头。「只能比格式。」
第一轮没有明显结果。第二轮把旧资料集中年代最接近的一批拆开重跑。晚上九点多,林河忽然停住。
「这批很像。」
萤幕上两套资料并排。左边,是从研究中心旧附件恢复出的格式。右边,是旧资料集中一批来源不完整的历史数据。生理讯号栏位排列相近。
采样间隔一致。部分时间戳格式相同。缺失资料的编码方式也很接近。甚至几个设备栏位的缩写习惯都一样。许克明看了一会。
「能做到来源认定吗?」
内容未完,下一页继续阅读