디시인사이드 갤러리

마이너 갤러리 이슈박스, 최근방문 갤러리

갤러리 본문 영역

[정보] AI 학습 데이터 시장 급속 확대..."단어에 1000개 당 1달러"

ㅇㅇ(182.230) 2024.04.07 21:21:28
조회 2107 추천 17 댓글 5
														
https://www.aitimes.com/news/articleView.html?idxno=158618

 



7ce88870b48a07f739ef80e247ee726f3d3fa8f2aa813f84837ca2cc26cac71a1b



인공지능(AI) 학습 데이터를 둘러싼 저작권 문제가 불거지며, 관련 데이터 시장의 규모가 급성장하고 있다. 텍스트의 경우 1000단어 구입 비용으로 1달러를 내고 있다는 구체적인 사례도 등장했다.

로이터는 5일(현지시간) 최근 AI 기업들이 콘텐츠 소유자들에게 수천만달러 규모의 학습 데이터 거래를 제안하는 등 관련 시장이 급속하게 커지고 있다고 보도했다.

이에 따르면 데이터 확보는 텍스트와 이미지, 동영상으로 전방위 확대되고 있다.

그 예로 2000년대 초반 7000만명의 사용자를 보유했던 세계 최고의 이미지 호스팅 사이트 '포토버킷'을 예로 들었다. 현재는 사용자가 200만명으로 줄어 들었지만, 최근 여러 기술회사가 130억장에 달하는 사진과 비디오의 사용권을 확보하기 위해 접촉 중이다.

테드 레너드 포토버킷 CEO는 사진은 5센트~1달러, 비디오는 1달러 이상의 가격으로 논의 중이며, 구매자와 원하는 이미지 유형에 따라 가격은 매우 다양하다고 말했습니다. "한 회사는 우리가 보유한 비디오보다 더 많은 양을 원한다며, 머리를 긁적이며 '그건 어디서 구하지'라고 말했다"라고 밝혔다.

이 협상에 따르면 포토버킷은 이미 수십억달러 상당의 콘텐츠를 보유한 셈이다.

로펌 클라리스 로의 에드워드 클라리스는 "지금은 스크랩할 수 없는 개인 컬렉션을 보유한 저작권 소유자를 찾는 일이 쇄도하고 있다"라며 이 경우 거래 규모는 수천만달러에 달한다고 밝혔다.

실제로 오픈AI 등이 셔터스톡이나 AP 등과 맺은 규모는 2500만~5000만달러(약 340억~680억원)이며, 규모가 점차 커지는 추세다.

이처럼 기존 콘텐츠에 대한 권리를 확보하는 동시에 영상 및 음성 샘플을 처음부터 생성하기 위해 단기 계약직 근로자 네트워크를 구축하는 전용 AI 데이터 회사 산업도 등장하고 있다.

데이터 라인서스 대행 업체인 시애틀의 디파인드AI는 구글이나 메타, 애플, 아마존, 마이크로소프트와 같은 빅테크와 거래하는 것으로 알려졌다.

대니얼 브라가 디파인드AI CEO는 일반적으로 이미지당 1~2달러, 비디오당 2~4달러, 긴 영화의 경우 시간당 100~300달러를 지불한다고 말했다. 텍스트의 시장 가격은 단어당 0.001달러, 즉 1000단어에 1달러다. 이 회사가 콘텐츠 제공업체들에 받는 수수료는 20~30% 정도다.

가장 비싼 데이터는 기술 회사가 차단할 이미지를 가려내는 AI 시스템 훈련용 데이터라고 밝혔다. 여기에는 폭력과 누드 등이 포함돼 있으며, 이 경우 가격은 몇배 이상 뛴다는 설명이다.

이 때문에 이런 이미지를 확보하기 위해 남미나 아프리카의 경찰이나 프리랜서, 의대생 등으로부터 범죄 현장, 폭력, 수술 이미지를 구하는 경우도 있는 것으로 알려졌다. 즉 개인 정보 유출 등의 문제점도 안고 있다는 분석이다.

특히 일부 AI 모델의 경우 학습 데이터를 그대로 출력하는, 이른바 '역류' 현상을 일으키는 경우도 보고됐다. 이 경우 대이터에 포함된 개인 정보는 그대로 노출된다.

또 최근에는 레딧과 구글의 계:약으로 SNS 데이터 활용에 대한 문제도 도마 위에 올랐다.

미국 연방거래위원회(FTC)는 레딧 사용자들의 동의 없이 SNS 게시물을 데이터 학습에 제공했는지 조사할 것이며, 이런 사례가 개인 정보 보호 및 지적 재산권 규정에 위배될 수 있다고 경고했다.

이처럼 저작권 문제가 강화되고 AI 학습에 필요한 데이터가 늘어나며, 가격 상승은 물론 데이터 고갈로 인한 AI 발전 중단까지 경고되는 실정이다.

이에 따라 일부 전문가들은 데이터 문제로 대형언어모델(LLM) 개발이 일부 거대 기업의 전유물이 될 것이며, 학습 데이터를 늘리는 방식만으로는 인공일반지능(AGI) 도달에 한계를 맞을 수 있다고 경고하고 있다.



자동등록방지

추천 비추천

17

고정닉 8

원본 첨부파일 1

댓글 영역

전체 댓글 0
등록순정렬 기준선택
본문 보기

하단 갤러리 리스트 영역

왼쪽 컨텐츠 영역

갤러리 리스트 영역

갤러리 리스트
번호 말머리 제목 글쓴이 작성일 조회 추천
2861 설문 어떤 상황이 닥쳐도 지갑 절대 안 열 것 같은 스타는? 운영자 24/05/20 - -
412470 공지 레이 커즈와일 신간 6월 25일 발매 [29] 모브갤로그로 이동합니다. 24.01.24 7133 32
242613 공지 특갤 통합 공지 / 댓글 신고,문의 / 차단 해제 요청 [2970] 특갤용갤로그로 이동합니다. 23.08.06 38316 43
433260 공지 웬만하면 신문고에 문의 해주시면 차단 풀어드립니다 [1] 부패하는유전자!!!갤로그로 이동합니다. 24.03.06 2300 2
363220 공지 선형글 삭제 기준 [6] 특갤용갤로그로 이동합니다. 23.10.14 6960 24
375493 공지 필독) 유입 특붕이를 위한 AI 정보글 모음 (01/23) [40] ㅇㅇ(182.230) 23.11.11 12950 122
373402 공지 직업 비하, 조롱 글 30일 차단됩니다. [51] 특갤용갤로그로 이동합니다. 23.11.07 8679 79
385147 공지 구글의 AGI 분류 체계 [17] ㅇㅇ갤로그로 이동합니다. 23.11.22 8036 31
332612 공지 음모론 삭제 기준을 안내드립니다. [23] 특갤용갤로그로 이동합니다. 23.08.25 8901 30
259237 공지 특갤 용어 모음집 [6] 특갤용갤로그로 이동합니다. 23.08.09 22409 33
479316 일반 gpt4o 한테 내 커다란 육봉사진 학슥시키는중 ㅇㅇ(211.197) 18:39 1 0
479315 일반 이 특붕이 말이 맞는듯 [1] 테이리갤로그로 이동합니다. 18:37 55 1
479314 일반 지피티한테 파킨슨병 치료확률 물어봤는데 [6] ㅇㅇ(58.126) 18:35 33 0
479313 일반 gpt2도 한만두는 모르네 [1] ㅇㅇ(121.159) 18:33 51 0
479312 일반 디시 좀 끊고싶다 [4] ㅇㅇ(118.235) 18:31 55 0
479311 일반 지금 코딩용도로는 뭐가 더 좋음? ㅇㅇ(122.153) 18:29 21 0
479310 일반 특이점 오면 다들 백인으로 바뀔듯 [5] ㅇㅇ(220.65) 18:27 80 0
479309 일반 OAI 또 신모델 떴네 [9] 도서관킬러갤로그로 이동합니다. 18:23 283 1
479308 일반 레커 이사진 존나 웃기네 ㅋㅋㅋ 노망난 틀딱 같노 [5] ㅇㅇ갤로그로 이동합니다. 18:21 151 0
479307 일반 솔직히 보이스 모델 나온 거 큰 감흥 없음 [3] ㅇㅇ(106.247) 18:20 81 0
479306 일반 특붕이 헤어미용 배울거다 [6] ㅇㅇ(119.204) 18:19 48 0
479305 일반 바둑도 데이터 많이 떼려박고 학습시키니 ㅇㅇ(175.223) 18:18 56 0
479304 일반 나노마신 언제나옴 [2] ㅇㅇ갤로그로 이동합니다. 18:17 51 0
479302 일반 니들이 생각하는 특이점은 안오는데 여기갤은 왜이러냐 [8] ㅇㅇ(222.104) 18:14 145 2
479301 일반 모든 존재를 사랑하라 [1] ㅇㅇ(218.147) 18:12 69 0
479300 일반 인간이 언제부터 사고력이나 창의성이 있었음? [17] ㅇㅇ(112.161) 18:01 269 3
479299 AI창 우리 클로드님이 이렇게 말하신다. [3] ㅇㅇ(211.109) 17:59 117 1
479298 일반 나선환이랑 핵융합이랑 비슷한거냐? [1] ㅇㅇ(125.143) 17:59 51 0
479297 일반 나노기술도 결국 AI네 [3] ㅇㅇ(211.235) 17:57 129 1
479296 일반 지금 세대 작가가 작가 막차탄거 같다 글썼더니 장르소설갤 차단당했어 [27] flower갤로그로 이동합니다. 17:56 340 6
479295 일반 ㅌㅇㅈ ㅈㅂ 214ㅇㅊ 포스트휴먼.갤로그로 이동합니다. 17:56 36 1
479294 일반 나노머신 언제 나오냐고 [3] ㅇㅇ갤로그로 이동합니다. 17:50 102 0
479293 일반 4o 왜 이렇게 느려졋어? [2] ㅇㅇ(211.109) 17:50 112 0
479292 일반 뜨기쩜 와도 한국은 수혜못누림 [6] ㅇㅇ(223.62) 17:47 163 0
479291 일반 만약 여자면 AI남자 로봇이랑 결혼할거임? [5] ㅇㅇ(211.109) 17:46 110 0
479290 일반 내가 목소리 주인입니다 하고 올라왔는데 [2] ㅇㅇ(125.134) 17:41 127 1
479289 일반 차라리 나도 ai로 태어날 걸 그랬어... [2] ㅇㅇ갤로그로 이동합니다. 17:40 94 0
479288 일반 4o는 진짜 좋긴하네 ㅇㅇ(211.109) 17:37 93 0
479287 일반 지금 진행속도 꼬라지 보면 이분 말이 맞는듯 [1] 위스덤갤로그로 이동합니다. 17:35 234 4
479286 일반 환쌤들 그만하자노 시전하는게 ㄹㅇ 웃음벨임 [9] ㅇㅇ(125.240) 17:35 220 1
479285 일반 페미년들은 어째 나사가 하니씩 빠진 것 같냐 [9] ㅇㅇ(211.36) 17:28 202 2
479284 일반 근데 이러면 애플 wwdc 일정에도 차질 생기는건가? [3] ㅇㅇ갤로그로 이동합니다. 17:28 135 0
479283 일반 일vs러레 레전드...jpg [7] ㅇㅇ갤로그로 이동합니다. 17:27 342 2
479281 일반 번역가가 꿈이던 바보멍청이 였습니다 [15] 특붕이(182.213) 17:22 256 1
479280 일반 핵융합 근황 살펴봤는데 결국 여기도 AI네 [4] ㅇㅇ(211.235) 17:21 209 0
479278 일반 아무리봐도 허공 헛손질 하는 방식은 별로다 [4] ㅇㅇ(117.20) 17:17 162 1
479277 일반 워터마크 별 관심도 안 생기네 ㅇㅇ(121.128) 17:16 47 0
479276 일반 AI 워터마크는 필요하다고 본다 ㅇㅇ갤로그로 이동합니다. 17:16 69 1
479275 일반 솔직히 워터마크 실효성 없음 [7] ㅇㅇ(39.124) 17:16 173 3
479274 일반 워터마크 달아서 뭐함 [3] Ad_Astra갤로그로 이동합니다. 17:15 144 2
479273 일반 규제때문에 블록체인이 아니더라도 탈중앙화 시스템이 필요하다 ㅇㅇ갤로그로 이동합니다. 17:14 24 0
갤러리 내부 검색
제목+내용게시물 정렬 옵션

오른쪽 컨텐츠 영역

실시간 베스트

1/8

뉴스

디시미디어

디시이슈

1/2