|
做知识产权法律案件这些年,2025年之后找我咨询的AI企业明显变了一个话题:以前问"我们的代码用了开源组件,有没有传染性风险",现在问"我们用了Llama/通义千问/DeepSeek,能商用吗"。 问题变了,陷阱也变了。很多企业创始人看到"开源"两个字,以为跟Linux时代的GPL、MIT一样,下载就能用。但大模型时代的"开源"早就不是那回事了——大量号称"开源"的模型,其实是"假开源":开放了权重,锁死了商用。 我用这篇文章把这事说清楚:哪些许可证真能商用、哪些有坑、出了事法院怎么判。 一、"开源"这个词,被大模型企业严重滥用了先讲一个事实:2024年10月,开放源代码促进会(Open Source Initiative,简称OSI)发布了《开源AI定义1.0》(OSAID 1.0),要求真正的"开源AI"必须允许以任何目的使用、修改和分享,并且提供训练数据的相关细节、训练代码和模型权重参数的完整开放。 结果呢?目前市面上几乎所有号称"开源"的大模型,都不符合OSI的标准。 学术界的说法叫"开放洗白"(openwashing)——声称的透明度远高于实际交付的水平。Radboud大学的研究团队在2024年6月的一项研究中,用14项开放性标准评估了40个文本生成模型,Meta的Llama 3排在倒数第四,ChatGPT垫底;真正最开放的是非营利组织Ai2的OLMo 7B。 为什么不符合? 因为大模型的构成和传统软件完全不同。传统软件开源,开放的是源代码;但大模型由参数、代码和训练数据三部分组成,开放哪部分、保留哪部分,就有了大量灰色地带。多数模型只开放权重参数和部分代码,训练数据是核心商业秘密,不会公开。 所以行业开始区分两个概念:"开源"(Open Source)vs"开放权重"(Open Weights)。前者要求使用、修改、分发权利接近传统开源定义;后者只意味着你能下载权重、本地部署、做微调。你在网上看到的"开源大模型",90%以上是"开放权重",不是"开源"。 二、四大主流许可证实测:哪些能商用、哪些有坑我拿当前企业最常接触的四类模型许可证做实测对比,每个都标注了来源,别记错了。 (一)DeepSeek——MIT许可证,目前最干净的选择2025年1月20日,DeepSeek-R1发布,代码和模型统一采用MIT许可证。MIT协议几乎是开源世界最宽松的许可证:自由使用、修改、分发,支持商用,只需要保留版权声明。 实务判断: 如果企业要选一个"闭眼用都不会出事"的模型,DeepSeek目前是最安全的选择之一。MIT许可证没有MAU门槛、没有地域限制、没有衍生模型命名要求。但要注意:MIT不包含专利授权条款,法律保护力度相对有限。 (二)Llama 4——"社区许可证",假开源的典型样本第一,MAU门槛。 如果你的产品月活跃用户超过7亿,必须向Meta另行申请许可,Meta可以自主决定给不给。7亿什么概念?全球只有极少数互联网巨头能触发,看似对中小企业友好,但这个条款本质上是选择性授权——许可方保留了对超大规模竞争者的否决权。 第二,品牌强制捆绑。 分发Llama或基于Llama的产品,必须在网站、用户界面、产品文档中显著展示"Built with Llama"。如果用Llama训练了新模型,模型名字必须以"Llama"开头。你做的产品,名字得带别人的品牌。 第三,地域限制。 Llama的多模态模型明确禁止欧盟企业使用,只有非欧盟企业可以开发和分发。 第四,许可证可撤销。 传统开源许可证(如Apache 2.0)明确写"不可撤销"(irrevocable),但Llama的许可证保留了终止权——你违反任何条款,Meta可以随时终止你的许可。 第五,反诉终止条款。 如果你对Meta提起知识产权诉讼,你的许可自动终止。这是典型的"互不侵犯"条款,限制了被许可方的法律救济权利。 自由软件基金会(FSF)在2025年1月将Llama 3.1的许可证归类为"非自由软件许可证"。OSI也明确表态:Llama不是开源的。来源:http://en.wikipedia.com "Llama (language model)"词条引用OSI声明。 (三)通义千问(Qwen)——从限制到开放的转型阿里云的通义千问许可证经历过一次关键转型,很多人不知道: Qwen2.5-72B 采用的是《通义千问许可协议》,有MAU超过1亿的门槛——比Llama的7亿低得多,更容易触发。2025年6月,月之暗面发布Kimi-Dev-72B,基于Qwen-2.5-72B做微调,用自己的MIT许可证发布增量权重,结果社区质疑:月之暗面用户量那么大,有没有超1亿MAU?Qwen团队负责人林俊旸先回复"没给授权",一个多小时后改口"这是我们历史遗留问题,Qwen3现在全部用Apache 2.0了"。 Qwen3(2025年4月发布)全部8个模型——6个稠密模型和2个MoE模型——统一采用Apache 2.0许可证。来源:Qwen官方GitHub仓库。Apache 2.0是业界最成熟的开源协议之一:允许商用、修改、闭源分发,附带专利授权,要求保留版权声明和修改说明。 实务判断: 用Qwen3系列,基本等同于传统开源软件的合规逻辑,法务审查成本最低。但如果用Qwen2.5-72B,得查MAU有没有过1亿。建议企业技术选型时锁定Qwen3以后的版本。 (四)腾讯混元——自拟协议,地域限制最明确腾讯混元采用自拟的《腾讯混元社区许可协议》,开篇就明确:"本开源许可协议不适用于欧盟、英国及韩国。"来源:金杜律师事务所2025年分析文章。 这意味着如果你在欧盟、英国或韩国有业务布局,混元模型直接不能用。地域限制条款背后的逻辑可能涉及地缘政治、监管合规等多重考量,但对被许可方来说,这是一个硬性合规红线,违反了就是超范围使用,构成侵权。 三、法院怎么判?中国司法对开源许可证的立场讲了许可证条款,关键问题是:这些许可证在中国法院有没有法律效力? 答案是肯定的,但有几个要点必须掌握。 (一)开源许可证 = 附条件的著作权许可合同最高人民法院在多个判决中明确:开源许可证的本质是附条件的、具有法律约束力的著作权许可使用合同。 核心判例一:(2021)最高法知民终51号——涉"开源软件"著作权侵权案。最高法认定GPLv2协议具有法律约束力,同时确立了一个关键原则:"软件开发者自身是否违反GPLv2协议和是否享有软件著作权,是相对独立的两个法律问题"——你不能因为原告自己没开源,就主张自己用他的代码不侵权。来源:最高人民法院知识产权法庭官网(http://ipc.court.gov.cn),2024年5月15日发布。 核心判例二:(2021)最高法知民终2063号——最高法直接认定"GPL3.0协议具有合同性质,用户使用开源软件即视为承诺,合同成立"。来源:《法律适用》杂志2025年8月林北征文章引注。 核心判例三:(2019)粤73知民初207号——广州知识产权法院详细论述GitHub上的开源协议构成"非典型合同",对使用者具有法律约束力。 (二)违反许可证的后果:授权终止→构成侵权司法实践确立了一条清晰的逻辑链:违反许可→授权终止→构成侵权。 你一旦不遵守许可证规定的义务(比如该署名的没署名、该开源的没开源、该交许可费的没交),你的使用行为就超出了授权范围,许可终止,后续使用构成对著作权人的侵权。 在"某拓"系列案中,被告使用免费建站系统但违反了"必须保留版权标识"的义务,法院认定侵害了权利人的署名权。在商某软件案中,被告将明确禁止商业用途的开源软件用于商业网站,超出许可范围,构成侵权。来源:北京知识产权法院(2022)京73民初393号;河南省郑州市中级人民法院(2023)豫01知民初2045号。 (三)GPL的"传染性"有边界(2019)最高法知民终663号判决中,最高法明确了GPL"传染性"的适用边界:如果软件的不同部分在功能和技术上相互独立,仅通过标准接口或进程间通信交互,则GPL的传染性不会蔓延至独立的程序部分。这条规则给企业在项目中混合使用开源代码与专有代码提供了法律预期。 (四)AI时代的新问题:传统框架不够用了但以上司法实践都是围绕"源代码"建立的。大模型时代,法律客体变成了模型架构、权重参数、训练数据、生成内容的复合体。单一许可证的效力边界怎么覆盖法律属性各异的要素?用开源模型微调出来的新模型算不算"派生作品"?生成内容的著作权归属和许可证约束怎么衔接? 广州互联网法院林北征法官(最高人民法院2024年度司法研究重大课题"涉数字经济司法问题研究"课题组成员)在2025年8月撰文提出:司法裁判应转变将AI项目视为单一整体的思路,确立"分层解释、区别对待"的裁判理念——厘清争议涉及的技术事实,结合行业惯例与新型许可文本,审慎研判授权意图。来源:《法律适用》杂志。 四、企业实务:三个最容易踩的坑坑一:把"开放权重"当"开源"用,超MAU门槛不自知Llama的7亿、Qwen2.5的1亿,不是摆设。你的产品一旦用户量上去,触发门槛时如果没走许可申请流程,就是超范围使用。建议:技术选型阶段就让法务审查许可证,把MAU触发条件写进产品迭代的风险清单。 坑二:微调了别人的模型,却不知道自己签了什么合同很多企业工程师从HuggingFace下载权重、做LoRA微调、打包进商业产品——全程没有法务介入。但你下载的那一刻,就视为接受了许可协议(最高法的"用户使用即视为承诺")。建议:任何基于第三方模型的产品,上线前必须过许可证合规审查,重点关注署名义务、衍生模型命名要求、使用领域限制。 坑三:训练数据来路不明,埋下著作权侵权雷这个坑最容易被忽视。你用了一个"开源"模型,但这个模型的训练数据可能爬取了大量受版权保护的作品。模型许可证不保护你免受训练数据版权方的追责。模型开源≠训练数据合法。建议:优先选择训练数据来源透明的模型(如DeepSeek公开声明训练数据全部来自互联网),要求模型提供方出具训练数据合规承诺。 五、一句话总结选型原则:MIT > Apache 2.0 > 自拟宽松协议 > 自拟限制协议。能用标准许可证的,就别用自拟的。
法律依据与案例来源: - 《中华人民共和国著作权法》(2020年修正)第三条——计算机软件属于受保护作品
- 《计算机软件保护条例》(2013年修订)——软件著作权保护基本框架
- (2021)最高法知民终51号——开源许可证法律效力确立案。来源:最高人民法院知识产权法庭官网(http://ipc.court.gov.cn),2024年5月15日发布
- (2021)最高法知民终2063号——GPL3.0协议具有合同性质。来源:《法律适用》杂志2025年第8期林北征文章引注
- (2019)粤73知民初207号——GitHub开源协议构成非典型合同。来源:广州知识产权法院
- (2019)最高法知民终663号——GPL传染性适用边界。来源:最高人民法院
- OSI《开源AI定义1.0》(OSAID 1.0),2024年10月发布。来源:http://opensource.org
- Llama 4 Community License Agreement,2025年4月5日生效。来源:http://llama.com/llama4/license
- DeepSeek-R1发布信息,2025年1月20日。来源:http://api-docs.deepseek.com
- Qwen3许可证信息。来源:GitHub Qwen官方仓库
注:本文所述许可证条款基于截至2026年7月的公开信息,模型许可证可能随时更新,实务中使用前请以最新版本为准并咨询专业律师。
|