前两个月我帮团队申报智能文案生成工具的软著,第一次提交的时候压根没把AI生成模块说明当回事,随便在网上抄了两段模板就交了,结果第三天就收到补正通知,说是模块说明不符合要求,需要重新提交。那段时间刚好赶项目上线要软著资质,我连着跑了三趟受理窗口,追着审核老师问要求,又找做软著代理的朋友讨教,前前后后改了三版才过,现在算是把这块的要求摸得透透的。
很多人可能和我最开始的想法一样,觉得AI生成模块说明就是个走流程的材料,随便写写就行,其实不是,现在大部分带AI功能的软件申报软著,这块都是审核的重中之重,本质上是版权局要确认你这个模块的训练数据、生成逻辑没有侵权风险,也不会违反相关的内容监管要求,要是写得含糊,大概率会被打回补正,耽误时间不说,要是赶项目用的话,真的能急死人。
第一个要写清楚的就是模块的定位和核心功能,别上来就堆技术术语,审核老师要的是直白的说明,你就直接写这个AI生成模块在整个软件里是核心功能还是附属功能,面向哪些用户,能实现什么具体的效果就行。比如我们当时的智能文案工具,我就直接写“本模块为软件核心功能,面向电商商家、新媒体运营人员,用户输入产品关键词、目标使用场景、风格要求后,可生成对应长度的电商详情页文案、朋友圈推广文案、短视频脚本内容”,就这么直白,完全不用写什么“基于Transformer架构的深度学习生成模块”这种没用的话,老师根本不关心你用了什么技术架构,关心的是你这个模块是干嘛的,会不会有风险。
第二个要重点写的是训练数据的来源,这也是我第一次被打回的核心原因。我最开始只写了“使用公开数据集训练”,直接被老师标红要求补全。这里你要写得特别细,要是用的是公开数据集,就要写清楚数据集的名称、发布方、对应的开源授权协议,要是自己爬取的内容,就要写清楚爬取的范围有没有遵守目标网站的robots协议,有没有对内容做去重、脱敏处理,有没有获得相关权利人的授权。要是你用的是第三方的预训练底座模型,也要标注清楚模型的来源、授权类型,比如是用的开源的LLaMA模型,对应Apache2.0协议,还是公司自研的底座模型,这些都要写得明明白白,不能有一点含糊。要是你不知道训练数据部分怎么梳理合规,可以先去软著申报材料整理的专题页看看别人的过审案例,比自己瞎琢磨快很多。
接下来就是生成逻辑和风控措施部分,很多人以为这里要贴核心算法的代码,其实完全不用,你只要把用户触发生成到拿到结果的整个流程讲清楚就行。比如用户输入请求之后,系统是不是先做敏感词拦截?然后调用的是哪个模型?生成内容之后有没有二次合规校验?有没有人工复核的环节?如果用户生成了侵权内容,你们有没有对应的处理机制?这些才是老师关心的点。我当时补正的时候,特意加了我们的风控流程:前端输入的时候会先拦截知名IP名称、违禁词,用户要是输入“模仿迪士尼米奇形象做宣传图”这种请求,系统会直接拒绝生成,内容生成之后还会过我们自研的侵权内容识别模型,疑似侵权的内容会直接打回不让用户下载,同时后台还有用户举报通道,接到举报24小时内就会完成核查处理,把这些写清楚之后,老师能直接看到你有完善的风险防控机制,自然不会卡你。
我当时整理材料的时候,身边做开发的朋友给我推了软著Pro,上面有很多不同行业的AI生成模块说明过审模板,我对着模板调整了自己的内容,省了至少三天的时间,而且第二次提交就直接过了,省了好多跑窗口的功夫。
还有个很多人容易踩的坑,就是把AI生成模块的说明和整个软件的功能说明混在一起写,要是你的软件只有一个AI功能还好,要是有多个,比如既有文案生成又有图片生成、音频生成,就要每个模块分开写,各自的训练数据、生成逻辑、风控措施都要对应清楚,不能笼统放在一块。我当时帮朋友看他的申报材料,他就是把三个AI模块的内容混在一起写,老师根本分不清每个模块的情况,直接就打回了。
最后再说个小技巧,你写AI生成模块说明的时候,最好能附1-2张操作流程图或者功能界面截图,不用做的太复杂,就是用户从输入请求到拿到生成结果的整个界面流程,旁边标清楚哪个部分是AI生成的内容,哪个是系统的提示信息,审核老师一眼就能看明白,通过率会高很多。我第二次补正的时候就加了两张截图,一张是用户输入关键词的界面,一张是生成之后的结果界面,老师看了之后连问题都没多问,当天就给过了。要是你不确定自己写的AI生成模块说明有没有遗漏的点,可以去软著材料审核的免费预审通道提交一下,有专业的老师帮你看有没有问题,不用等到提交到版权局被打回才着急。
我身边最近还有朋友问,要是自己的AI生成模块是直接调用的第三方接口,比如用的是豆包或者文心一言的开放接口,那该怎么写?其实这种更简单,你只要写明调用的是哪个厂商的接口,把你们之间的合作协议、授权文件的编号或者摘要附在后面,证明你已经获得了二次开发的授权,而且第三方已经对接口的合规性做了保障,就不用你自己再去写底层的训练数据这些内容,会省事很多。