Дві різні проблеми (не змішуйте їх)
A. Права на навчальні корпуси
- Чи було захищене вираження скопійоване в датасет?
- За якою ліцензією, винятком чи договором?
- Хто контролює обходи, фільтри та відмови (opt-out)?
B. Права на результати та розміщені копії
- Чи копіює опублікована сторінка чуже вираження?
- Чи є людське авторство в тому, що ви опублікували?
- Чи може OSP видалити конкретний URL після скарги?
Батьківський огляд: ШІ та авторське право. Основи предмета: що таке авторське право?(ідеї та факти проти захищеного вираження в рамках на кшталт 17 U.S.C. § 102).
Як зазвичай формуються навчальні датасети
На високому рівні навчальні стеки поєднують такі джерела:
- Вебобходи — сторінки, зібрані з дотриманням правил robots, ToS і внутрішніх фільтрів (або без них)
- Ліцензовані корпуси — книги, новини, код або медіа, продані чи відкрито ліцензовані для навчання
- Синтетичний / згенерований моделями текст — використовується для розширення чи балансування датасетів
- Підбірки, курировані людьми — фільтри якості, фільтри безпеки, дедуплікація
Кожен шлях змінює профіль ризику. «Це було онлайн» — не те саме, що «ми можемо відтворювати характерне вираження деінде». Тут також трапляються міфи про суспільне надбання — закінчення строку охорони залежить від країни; див. строки авторського права за країнами та основи суспільного надбання.
Ризики для видавців і власників сайтів
Навіть якщо ви ніколи не навчаєте модель, копірайтні спори епохи ШІ можуть вдарити по вашому бізнесу:
- Скраплені дзеркала ваших статей на сторонніх доменах, які потім хтось монетизує або на які скаржиться
- Хибні або надмірні скарги на ваші оригінальні сторінки (зокрема відредаговані вами чернетки, створені з допомогою ШІ)
- Масові автоматизовані скарги, що ігнорують контекст — див. копірайт-боти та автоматизований DMCA
- Плутанина з правами власності, коли підрядники використовують інструменти ШІ без чіткої передачі ІВ
Патерни надмірних претензій: що таке copyfraud?
Чи можна «подати DMCA на модель» або на її результат?
Система DMCA notice-and-takedown, яку використовують хостинги та пошукові системи, побудована навколоматеріалів, збережених або проіндексованих за ідентифікованими адресами — зазвичай URL і файлів онлайн-провайдера, — а не абстрактного набору ваг моделі з наукових статей. На практиці власники сайтів і оператори зосереджуються на:
- Розміщених сторінках або файлах, що копіюють захищене вираження
- Результатах пошуку, видалених після скарги на порушення авторських прав
- Апеляціях на платформах і, де це доступно, зустрічних повідомленнях за § 512(g)
Чи порушує саме навчання — окреме питання судових процесів. Ця сторінка не прогнозує результати жодного позову; вона показує, що зазвичай можна зробити, коли на кону ваш індекс або хостинг.
Чекліст відповідності для ШІ-продуктів (не юридична порада)
- Документуйте походження датасетів і ліцензії для навчання та донавчання
- Дотримуйтеся політик robots/ToS, які заявляєте; фіксуйте обробку відмов (opt-out)
- Фільтруйте або перевіряйте результати на високоризикове відтворення характерних творів
- Зберігайте етапи людської перевірки для публікацій, орієнтованих на клієнтів
- Визначайте власність на ІВ у договорах з підрядниками та фрилансерами, коли використовуються інструменти ШІ
- Майте план реагування на скарги (юристи + операції) до інциденту з багатьма URL
Матеріали Бюро авторських прав США щодо ШІ та політики реєстрації розвиваються — командам варто стежити за офіційними настановами, а не за чутками з блогів: copyright.gov/ai.
Ескіз для ЄС (залежить від юрисдикції): Директива ЄС про єдиний цифровий ринок (Директива (ЄС) 2019/790) містить винятки для text-and-data-mining (зазвичай обговорювані в межах статей 3–4) з умовами на кшталт законного доступу та, для певних використань, відмов правовласників. Це не клон американського fair use — не переносьте американський наратив про навчання в продуктовий план для ЄС без урахування локальної імплементації та перевірки юристами.
Якщо позиції впали після ШІ-пов’язаної скарги на авторські права
- Перевірте — юридичні видалення в Google Search Console / тікети хостера; запустіть перевірку DMCA / індексу.
- Збережіть — скаргу, часові мітки, повний HTML, чернетки, промпти, ліцензії.
- Класифікуйте — реальний спір про схожість, помилковий URL, надмірна претензія чи зловживання конкурентів.
- Відповідайте — конструктор форми тут, далі зустрічне повідомлення, коли маєте добросовісні підстави.
- Відокремте продуктовий ризик — виправте процес роботи з датасетами/результатами, щоб той самий клас скарг не повторювався.
Джерела
Поширені запитання
Чи є навчання на загальнодоступних вебсторінках автоматично добросовісним використанням?
Жодне автоматичне правило не охоплює кожен обхід. Аналіз fair use у США залежить від фактів (мета, характер твору, обсяг, вплив на ринок). Інші країни застосовують інші винятки, наприклад правила text-and-data-mining у ЄС. Публічна доступність сторінки — не безкоштовна ліцензія на копіювання захищеного вираження.
Чи означає «згенеровано ШІ», що авторського права немає і можна вільно копіювати?
Ні. «Згенеровано ШІ» — не магічна позначка вседозволеності. Твори, створені людиною, залишаються захищеними за звичайними правилами авторського права. Публікації, створені за допомогою ШІ, можуть містити захищене людське вираження — і водночас ризикують нагадувати чуже захищене вираження.
Чи можуть конкуренти заявити права на мою статтю, створену за допомогою ШІ?
Вони можуть надіслати скаргу; це не означає, що претензія обґрунтована. Зберігайте чернетки, промпти, часові мітки публікації та вихідні матеріали. Якщо Google видалив URL після скарги на порушення авторських прав, розгляньте зустрічне повідомлення, коли маєте добросовісне право залишити матеріал онлайн.
Які докази допоможуть, якщо Google видалив мій URL після скарги на порушення авторських прав?
Збережіть скаргу та ідентифікатори, повну сторінку в опублікованому вигляді, доказ першої публікації (CMS, Wayback, вихідні файли) та всі ліцензії. Потім перевірте статус індексації / юридичних видалень і за потреби пройдіть структурований шлях зустрічного повідомлення.
Чи можна подати DMCA на самі ваги моделі?
Система DMCA notice-and-takedown спрямована на матеріали, розміщені в онлайн-провайдерів — зазвичай конкретні URL або файли, — а не на абстрактні параметри моделі. Практичне забезпечення прав для власників сайтів зазвичай націлене на розміщені копії та результати пошуку, а не на «модель» як окремий файл, який легко знайти в Google.
Схожі матеріали: ШІ та авторське право ·Що таке авторське право? ·Копірайт-боти ·Гіперпосилання та фреймінг ·Гід із зустрічного повідомлення ·База знань