수학자들, 오픈AI의 데이터 사용 출처에 증거 요구
Mathematicians want proof OpenAI didn’t use their work
The Verge AI수학계가 오픈AI의 주요 수학적 발견에 사용된 학습 데이터 출처와 윤리성에 대해 의문을 제기하며 논란이 커지고 있습니다.
- 한 수학자는 자신의 연구 상호작용이 모델 학습 데이터에 포함되었는지 명확한 증거를 요구하며, 회사의 답변을 '기만적'이라고 비판했습니다.
- 이번 논란은 AI가 학문적 성과를 내는 과정에서 연구자의 지적 기여와 데이터 출처에 대한 투명성 및 공정성이 핵심 쟁점이 되었음을 보여줍니다.
- 연구자들은 기업이 데이터 사용 여부를 부정할 경우, 모든 관련 데이터를 공개하고 명확히 설명할 책임이 있다고 강력하게 요구합니다.
한 수학자는 오픈AI가 발표한 주요 수학적 발견들이 학습 데이터의 출처와 윤리성 측면에서 논란이 되고 있다고 지적했습니다. 이 수학자는 회사가 자신의 연구 상호작용을 포함하여 비공개 작업물을 활용했을 가능성을 제기하며, AI 거대 기업의 행동에 대해 '부정직'하다고 비판했습니다. 특히 오픈AI가 발표한 결과 중 하나는 해당 수학자의 전문 분야인 비-소픽 군(non-sofic groups)과 관련되어 있었으며, 이 과정에서 회사가 이전 연구 기여를 충분히 인정하지 않았다는 지적이 있었습니다.
해당 수학자는 자신이 챗GPT와 나눈 상호작용이 오픈AI의 성공에 기여했을 수 있다는 의문을 제기했습니다. 그는 오픈AI 연구원들에게 자신의 대화가 '훈련 데이터의 일부인지 또는 추론 과정에 접근 가능한지' 이메일을 보냈으나, 회사의 답변은 단지 챗봇과의 직접적인 접근 여부만을 다루었을 뿐이었습니다. 수학자는 이러한 답변으로는 회사 모델 개선에 사용되는 방대한 훈련 데이터 풀에 포함되었는지 여부를 확인할 수 없다고 지적했습니다.
수학자는 연구자들이 오픈AI의 훈련 파이프라인을 역설계하여 작업물이 사용되었는지 여부를 알아낼 수 없으므로, 만약 회사가 사용자 데이터 사용을 부인한다면 모든 필요한 데이터셋과 사용 방식을 명확히 공개하고 증명할 책임은 회사에 있다고 주장했습니다. 그는 '식별 해제(de-identification)'가 이름만 제거할 뿐 수학적 아이디어의 지적 내용을 제거하지 못한다고 비판하며, 회사의 답변이 기만적이라고 평가했습니다.
이번 논란은 학계에 깊은 우려를 남겼습니다. 연구자들은 이러한 행동 방식이 만약 자신이 큰 돌파구 직전에 있다는 소문조차도 잘 갖춰진 기술 기업과의 경쟁을 촉발할 수 있다고 느끼게 만든다면, 수학 분야가 더욱 비밀스러운 상태로 전락할 것을 걱정하고 있습니다.