03 / ALOA · 机器学习安全
模型记住了什么?
面向双塔神经网络的成员推断。问题是记录是否参与了训练,而不是如何重建记录。
用户与物品通过不同的塔生成嵌入表示。
当前观察用户与物品嵌入
区分两种输入,两个塔
理解完整方法。
01
用户与物品输入分别转为嵌入。
02
合成查询使用目标响应训练影子模型。
03
用户特征扰动揭示响应行为。
04
影子模型衍生特征支持成员分类。
准确理解结果。
表 6 报告 Combined 准确率 97.87%、Dummy 准确率 95.07%,IN:OUT 比例分别为 4:1 与 1:10,评估人群不同。表 7 的 99.65% 是已知训练成员被预测为 IN 的比例,并非一般成员/非成员准确率。
查看完整论文与讨论图示的含义与范围
位置、脉冲与嵌入变化均为概念示意,不是实测坐标或经验 ROC 曲线。成员推断关注训练参与情况,不表示记录重建。MMD 分布比较也不应被解读为成员概率。