三星半导体部门的工程师,把一段公司内部源代码复制粘贴进 ChatGPT,让它帮忙 debug。整段代码进了输入框,回车。后来全公司禁用了这个工具。
这些字可能被员工看见、被日志留下,也可能被拿去训练。别人再问类似的问题时,它们有机会出现在别人的答案里。
传统产品把数据放进保险箱。存、取、删都落在一条记录上,记录没了就结束。生成式产品会把对话拿去训练,融进参数,像喂进肚子。消化掉了,吐不出来。想让模型忘掉,技术上做不到。
你点删除,库里那条可以没。训练进参数的那一层不一定。GPT-2 曾被发现能背出真实手机号。模型回答下一个用户时,也可能把从你这儿学到的讲出去。
上线之前,先填完这一句:我们用你的什么数据,来做什么事,存多久,你可以随时怎么操作。填得动,才说明想清楚了要交代什么。比如:我们用你的聊天内容,来生成回复,你可以随时删除或导出。用户能记住的是:我们不会拿你的聊天内容训练模型,除非你主动打开开关。填空填不满,协议写得再长,也只是让人点同意。删掉对话,不等于模型忘了。