모델 뉴스
The Culture Funnel: You can’t align what isn’t in the data Cohere Labs analyzed data from modern LLM training pipelines and found that cultural diversity is frequently lost in post-training data mixes. Aug 19, 2026 8 min read
CBCohere Blog
Cohere Labs가 최신 LLM 학습 파이프라인 데이터를 분석해, 후학습 데이터에서 문화적 다양성이 줄어드는 현상을 확인했습니다.
세 줄 요약
- 560만 개 샘플에서 문화 신호가 후학습에서 줄었고, 문화 마커 추가로 NormAd +8%, BBQ +6%, GMMLU +2.3%가 올랐습니다.
- 사용자 조사에서 창작 글쓰기, 번역, 메일 작성에 문화 이해가 필요하다고 답했고, 이런 과제는 학습 데이터에 문화 신호가 가장 많았습니다.
- 문화는 언어나 지역만으로 대체되지 않고, 소수 지역은 여전히 부족하며, 마커 추가는 데이터를 더 문화적으로 만드는 것이 아니라 문화 속성을 명시하는 방식입니다.
Cohere Labs가 최신 LLM 학습 파이프라인 데이터를 분석해, 후학습 데이터에서 문화적 다양성이 줄어드는 현상을 확인했습니다.