你把访谈转写稿拖进对话框时,往往只想着让它帮你理顺口语、标出主题词。文件名已经改成编号,看起来像处理过了,正文里却仍有受访者姓名、所在学院,以及能对上号的事件和时间。对本科毕业论文来说,未发表的访谈、问卷或实验数据在进入任何AI工具之前,还有一道容易被跳过的检查:先做一次数据、隐私和安全方面的影响评估。
上传前要评估的究竟是什么
部分高校的生成式人工智能使用指引,会要求你在使用前评估数据、隐私和安全影响,而不是等论文写完再补一句“使用了AI润色”。这里的评估不是法律意见,也不替代学校的伦理审查或导师审批。它是你在上传之前做的范围判断:这些内容离开你的设备之后,可能被谁看到、会留下什么,以及会不会把不该公开的信息带出去。
可以按三个问题来做,而不是按页面上的“安全”字样来做。
第一,材料里有没有不该交给第三方处理的信息。直接标识包括姓名、学号、手机号、邮箱、身份证号、精确住址,以及能够辨认身份的录音人声。间接标识同样要看:样本量很小,又同时出现学院、年级、罕见经历或具体日期,去掉姓名后仍可能对上具体的人。未发表的实验原始记录、同学或课题组尚未发表的底稿,也不因为“只是辅助分析”就自动可以外传。
第二,传出去之后还能否收回。不同AI工具对输入内容的保存期限、是否用于改进模型、日志谁可以查看,规定并不相同,而且会变更。评估时要以你当时实际使用的那一版说明为准,不能用“学生账号应该更安全”或“我只是试用”来代替阅读。无法确认是否留存、留存多久、谁能访问,就应记为“未排除”,而不是“没有风险”。
第三,学术诚信是否同时被碰到。隐私上的判断通过了,不代表可以不披露。公开报道提到,不少高校与学术期刊要求作者披露人工智能工具的使用场景,并标明研究各环节的使用情况。科技部《负责任研究行为规范指引(2023)》也涉及科研成果中使用生成式人工智能的规范问题。对本科毕业论文,你需要说清AI碰过哪些材料,做的是转写、语言润色,还是对未发表数据的分析,以及结论是否仍由你独立作出。披露不能反过来为未经授权的上传开脱。
常见误区
下面这些做法很常见,也都不足以替代上传前的检查。
| 你可能这样想 | 实际还没解决的问题 |
|---|---|
| 只是润色语句,不是在做分析 | 语句里的人名、单位和事件细节会一并送出 |
| 文件名改成编号就算匿名 | 要看的是正文、表头、页眉和附件,不是文件名 |
| 导师允许使用AI,就可以上传原始数据 | 允许使用工具,不等于允许把受访者或他人的未发表数据交给第三方 |
| 最后在声明里披露即可 | 披露说明使用事实,并不消除泄露和未授权处理 |
| 删掉姓名就不可能被认出 | 小样本加上独特组合,仍可能重新识别 |
| 删掉本地对话就安全了 | 你这边删除,不说明服务端没有日志或留存 |
还有一种误解,是把“未发表”只理解成还没投稿。对毕业论文而言,它通常还包括尚未答辩的材料、同意范围没有覆盖对外提供的记录,以及不属于你个人可以处分的课题组数据。这些内容一旦进入通用对话式工具,你很难再控制复制、缓存和后续使用。
哪些内容要脱敏或先取得授权
先分成三类:最小化之后可以考虑上传的、必须先有授权才能考虑的,以及当下不应上传的。
相对容易处理的,是你自己撰写、不含他人隐私和未公开结果的文字,例如文献综述里的表述或讨论提纲。即便如此,段落里如果嵌入了尚未公开的数据或可识别案例,仍要先剥掉。
需要先脱敏,或先确认授权的,主要包括这些材料。
- 访谈转写和录音。去掉姓名、联系方式、精确机构和能对上具体事件的细节。录音用于转写时,人声本身就可能识别身份,不能只处理文字稿。
- 问卷开放题。学号、班级和联系方式不要进入上传文件,导出时只保留分析所需字段。
- 小样本个案。除直接标识外,还要检查“学院+年级+独特经历”是否仍然指向一个人。
- 实验记录。原始数据若来自导师课题、合作者或尚未发表的结果,先确认你是否有权将其提供给工具服务方,不能默认“我参与了就可以”。
不应上传的,是你无法脱敏、无法确认同意范围,或无法确认留存政策的材料。同意书如果只写了“用于毕业论文分析,结果匿名呈现”,通常并没有写明可以把原文交给外部AI服务。这时不能把上传解释成同意书已经允许。同意范围是否被超出,要以你所在学校的伦理或数据管理要求为准;这里只给出判断顺序,不代替学校结论,也不构成法律意见。
脱敏时使用稳定代号,把对照表留在本地,不要和待上传文件放在一起,更不要把对照表粘贴进对话框。地点和日期能改成区间或相对时间的,就不要保留精确值。图片、扫描件和带页眉的PDF,常常把姓名留在容易忽略的位置,需要单独看一遍。
应当留下什么记录
评估如果只停在脑子里,事后你就说不清当时为什么上传,或为什么没有上传。记录不求长,但要能还原判断。建议单独留下一份不上传的过程笔记,至少写清这些内容。
- 使用日期,以及工具名称和你看到说明的日期。不记录账号和密码。
- 使用目的:语言润色、转写、编码辅助或结果核对,写具体一点。
- 上传范围:例如“访谈01至06的脱敏文本”,不要把原文再抄进笔记。同时说明删除了哪些标识、保留了哪些字段。
- 授权依据:同意书是否涵盖外部工具,导师是否知情,数据是否属于你可处理的范围。没有依据就写“未上传”。
- 对留存和模型改进的判断:写下你读到的说明要点和日期;读不到就写“未能确认,故未上传”。
- 与论文相关的主要提示和输出要点,以便日后披露和核对,避免只留下改好的终稿,却说不出改动从哪里来。
这些记录服务于学术规范和你自己的可追溯性,不是再向工具服务方提交一份隐私材料。笔记本身如果抄进了敏感原文,就要和原始数据一样收好。
上传前的自查清单
在把未发表数据送进AI工具,或把用过AI的章节定稿之前,逐项看一遍。有一项是否定的,而且当时补不上,就先不要上传。
- 这是不是毕业论文中的未发表访谈、问卷、实验记录或他人底稿?若只是你自己的表述,仍要检查有没有夹带结果。
- 直接标识是否已从正文、表头、页眉、文件属性和录音中去掉?
- 间接标识合在一起,还能不能指向具体的人、班级或未公开的现场?
- 受访者同意或课题的数据管理要求,是否允许把原文交给外部AI工具?不确定就视为不允许。
- 你是否有权处理这份数据?属于导师、合作者或同学的未发表材料,是否已经征得同意?
- 你是否已查看当前工具对输入内容的保存、访问和模型改进规定,并能用自己的话写下来?
- 无法确认留存政策时,你是否改为本地处理或人工完成,而不是先上传再观望?
- 代号对照表、原始录音和未脱敏稿是否只留在本地,没有随对话发出?
- 过程笔记是否写明工具、日期、目的、上传范围,以及明确未上传的部分?
- 论文里的AI使用披露是否与笔记一致,包括用在转写、润色还是数据分析,以及你如何核对输出?
前九项处理的是数据安全和隐私影响,最后一项处理的是学术诚信。两边都要过,不能互相替代。
评估没有通过时怎么做
评估的结果经常不是“可以上传”,而是“信息不够,先不要传”。这不等于论文不能使用任何辅助。你可以把任务拆开:必须依靠原文才能完成的转写和编码,优先在不把材料送出的条件下进行;只涉及你自己措辞、且不含未公开数据的段落,再考虑是否使用工具。输出里的事实、引用和数据,仍要回到原始材料核对,不能把模型生成的概括当成未发表数据的结论。
如果学校要求使用生成式人工智能前评估数据、隐私和安全影响,过程笔记就是回应这项要求的工作底稿。它说明你在上传前看过材料、看过工具说明、看过授权边界。它不能证明某个工具绝对不留存,也不能证明某种脱敏在所有场景下都足够。遇到同意范围、数据归属或学校规定对不上的情况,先问导师或学校负责科研伦理和数据管理的部门,比在对话框里试一次更稳妥。
本科毕业论文里的数据,往往是第一次离开课堂作业、进入可能被保存的外部系统。上传前多做这一次检查,是为了让润色和转写停留在辅助写作,而不是把尚未发表、也尚未被授权分享的内容交出去。


