Hai vấn đề khác nhau (đừng trộn)
A. Quyền trên corpus huấn luyện
- Thể hiện được bảo hộ có bị copy vào dataset không?
- Giấy phép / ngoại lệ / hợp đồng nào cho phép?
- Ai kiểm soát crawl, filter, opt-out?
B. Quyền trên output & bản host
- Trang publish có copy thể hiện của người khác không?
- Phần sáng tạo của người trong bài publish là gì?
- OSP có thể gỡ URL cụ thể sau notice không?
Tổng quan cha: AI và bản quyền. Nền tảng khái niệm: bản quyền là gì?(ý tưởng/sự kiện vs thể hiện được bảo hộ, khung như 17 U.S.C. § 102).
Dataset huấn luyện thường được dựng thế nào?
Ở mức tổng quan, stack training hay kết hợp:
- Crawl web — trang thu thập theo robots/ToS và filter nội bộ (hoặc thiếu các lớp đó)
- Corpus có giấy phép — sách, tin, code, media mua hoặc open-license cho training
- Dữ liệu synthetic — text do model sinh để mở rộng / cân dataset
- Tập con do người chọn — lọc chất lượng, an toàn, dedupe
Mỗi đường có profile rủi ro khác. “Nó nằm online” không bằng “được tái tạo thể hiện đặc trưng nơi khác”. Ảo tưởng public domain cũng hay xuất hiện—thời hạn theo nước: thời hạn bản quyền theo quốc gia và miễn công cộng.
Rủi ro cho publisher / chủ website
Dù bạn không train model, xung đột bản quyền thời AI vẫn có thể chạm business:
- Mirror scrape bài của bạn trên domain khác, rồi bị report hoặc bị monétize
- Notice sai / vượt quyền nhắm trang gốc của bạn (kể cả bản nháp có hỗ trợ AI đã biên tập)
- Complaint hàng loạt tự động bỏ qua ngữ cảnh—xem bot bản quyền & DMCA tự động
- Lộn sở hữu khi freelancer dùng AI mà hợp đồng IP không rõ
Mẫu over-claim: copyfraud là gì?
Có “DMCA model” hoặc output trừu tượng được không?
Hệ thống notice-and-takedown DMCA mà host/tìm kiếm dùng xoay quanhvật liệu lưu trữ hoặc index tại vị trí xác định—thường URL và file trên OSP—không phải bộ trọng số model trừu tượng. Thực tế chủ website/operator tập trung:
- Trang/file host sao chép thể hiện được bảo hộ
- Kết quả tìm kiếm bị gỡ sau khiếu nại bản quyền
- Kháng cáo nền tảng và, khi đủ điều kiện, counter-notice § 512(g)
Việc training có xâm phạm hay không là câu hỏi kiện tụng riêng. Trang này không dự đoán kết quả vụ kiện; nó map việc bạn thường làm được khi index hoặc hosting bị đụng.
Checklist tuân thủ cho sản phẩm AI (không phải tư vấn pháp lý)
- Ghi nguồn gốc dữ liệu (provenance) + giấy phép cho training/fine-tune
- Tôn trọng robots/điều khoản dịch vụ mà bạn tuyên bố tuân thủ; lưu cách xử lý opt-out
- Lọc/rà soát đầu ra với rủi ro “nhả” lại tác phẩm đặc trưng
- Cổng rà soát bởi người cho nội dung hướng khách hàng
- Điều khoản sở hữu IP rõ khi nhà cung cấp/freelancer dùng AI
- Quy trình phản notice (pháp lý + vận hành) trước khi dính nhiều URL
Tài liệu US Copyright Office về AI và đăng ký thay đổi theo thời gian—theo dõi nguồn chính thức: copyright.gov/ai.
Phác EU (theo thẩm quyền): Chỉ thị Thị trường số đơn nhất EU (Directive (EU) 2019/790) có ngoại lệ text-and-data-mining (thường bàn ở Điều 3–4) kèm điều kiện như truy cập hợp pháp và, với một số mục đích, quyền opt-out của chủ quyền. Đây không phải bản sao fair use Mỹ—đừng dán narrative training kiểu Mỹ vào kế hoạch sản phẩm EU khi chưa map luật quốc gia thành viên và rà pháp lý.
Nếu ranking rơi sau complaint bản quyền liên quan AI
- Xác minh — GSC legal removals / ticket host; chạy kiểm tra DMCA / index.
- Lưu chứng — notice, timestamp, full HTML, bản nháp, prompt, license.
- Phân loại — tranh chấp similarity thật vs sai URL vs over-claim vs DMCA bẩn / negative SEO.
- Phản ứng — công cụ tạo đơn kháng cáo, rồi counter-notice khi có cơ sở thiện chí.
- Tách rủi ro sản phẩm — sửa quy trình dataset/output để cùng class complaint không lặp.
Nguồn tham khảo
FAQ
Huấn luyện trên trang web công khai có mặc định là fair use?
Không có quy tắc tự động cho mọi lần crawl. Fair use ở Mỹ phụ thuộc sự kiện cụ thể. Nước khác có ngoại lệ text-and-data-mining (TDM) với điều kiện khác. “Công khai trên web” không đồng nghĩa “được sao chép thể hiện được bảo hộ tự do”.
Gắn nhãn “do AI tạo” có nghĩa là không có bản quyền, muốn copy cũng được?
Không. “AI-generated” không phải giấy phép copy tự do. Tác phẩm do người tạo vẫn được bảo hộ theo luật thông thường. Bài có hỗ trợ AI vẫn có thể chứa phần sáng tạo của người—và vẫn có rủi ro giống thể hiện của người khác.
Đối thủ có thể claim bài viết của tôi vì có dùng AI không?
Họ có thể gửi notice; notice không đồng nghĩa đúng. Hãy lưu bản nháp, prompt, timestamp xuất bản, nguồn. Nếu Google gỡ URL sau khiếu nại bản quyền, cân nhắc counter-notice khi có cơ sở thiện chí giữ nội dung.
Cần chứng cứ gì nếu Google gỡ URL sau complaint bản quyền?
Lưu notice và reference ID, full page đã publish, bằng chứng xuất bản trước (CMS, Wayback, file gốc), giấy phép liên quan. Kiểm tra trạng thái index/legal removal rồi đi quy trình counter-notice có cấu trúc khi phù hợp.
Có “DMCA luôn model weights” được không?
Notice-and-takedown DMCA nhắm vật liệu do OSP lưu trữ/index—thường là URL hoặc file cụ thể—không phải tham số model trừu tượng. Với chủ website, thực tế thường là xử lý bản sao trên host và kết quả tìm kiếm, không phải “cả model” như một file dễ chỉ trên Google.
Liên quan: AI và bản quyền ·Bản quyền là gì? ·Bot bản quyền ·Liên kết & deep link ·kháng cáo DMCA ·Kho kiến thức