관리 메뉴

데이터 과학

Hugging Face예제와 메뉴를 알아보기 본문

인공지능/자연어 처리

Hugging Face예제와 메뉴를 알아보기

티에스윤 2026. 8. 24. 22:19

Hugging Face 메뉴 살펴보기

모델 검색부터 데이터셋, Spaces, Google Colab 실습까지

Hugging Face가 어떤 플랫폼인지 이해했다면 이제 실제 홈페이지에서 어떤 기능을 제공하는지 살펴볼 필요가 있습니다.

Hugging Face에는 인공지능 모델을 검색하는 기능, 데이터셋을 찾는 기능, AI 웹 애플리케이션을 직접 실행해 보는 기능 등이 제공되고 있습니다. 처음 접하면 메뉴가 많아 다소 복잡하게 느껴질 수 있지만, 기본적으로는 Models, Datasets, Spaces 세 가지 메뉴를 중심으로 이해하면 됩니다.

Models는 인공지능 모델을 찾는 공간이고, Datasets는 인공지능 학습과 평가에 필요한 데이터를 찾는 공간이며, Spaces는 다른 사람이 만든 AI를 웹브라우저에서 직접 실행해 볼 수 있는 공간입니다.

이 세 가지 기능을 이해한 뒤 Model Card, Dataset Card, Collections, Papers 등의 기능을 살펴보면 Hugging Face의 전체 구조를 쉽게 이해할 수 있습니다.

 

Hugging Face 공식 홈페이지
https://huggingface.co/

 

Hugging Face – The AI community building the future.

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

huggingface.co

 


1. Models 메뉴는 인공지능 모델을 찾는 공간입니다

Hugging Face에서 가장 많이 사용되는 메뉴 가운데 하나가 Models입니다.

Models에는 전 세계 연구기관, 기업, 대학, 개인 개발자 등이 공개한 수많은 인공지능 모델이 등록되어 있습니다.

처음 Hugging Face를 접하는 학생들은 인공지능 모델이라고 하면 ChatGPT와 같은 대규모 언어 모델만 생각하는 경우가 많습니다. 그러나 Hugging Face에서는 훨씬 다양한 종류의 모델을 찾아볼 수 있습니다.

예를 들어 문장의 감정을 분석하는 모델이 있고, 긴 문서를 짧게 요약하는 모델도 있습니다. 영어를 한국어로 번역하는 모델, 질문에 답을 생성하는 모델, 이미지를 분류하는 모델, 사진 속 물체를 탐지하는 모델, 음성을 문자로 바꾸는 모델도 있습니다.

최근에는 텍스트와 이미지를 동시에 이해하는 멀티모달 모델과 이미지 생성 모델도 많이 공개되고 있습니다.

Models 메뉴는 자신이 해결하려는 문제에 적합한 AI 모델을 찾는 출발점이라고 할 수 있습니다.

 

예를 들어 한국어 문장의 감정을 분석하고 싶다면 검색창에 다음과 같은 단어를 입력할 수 있습니다.

Korean sentiment analysis ,Korean text classification 이와 같은 검색어를 사용할 수 있습니다.

검색 결과에는 여러 모델이 나타납니다. 이때 가장 중요한 것은 첫 번째 모델을 바로 사용하는 것이 아니라 모델의 상세 정보를 확인하는 것입니다.

2. Model Card는 AI 모델의 설명서입니다

Hugging Face에서 모델 하나를 선택하면 해당 모델의 상세 페이지가 나타납니다.

이 페이지에서 가장 먼저 확인해야 하는 것이 Model Card입니다.

Model Card는 쉽게 말하면 AI 모델의 사용 설명서입니다.

어떤 모델이 공개되어 있다고 해서 모든 모델이 동일한 성능을 가지는 것은 아닙니다. 또한 같은 한국어 모델이라도 어떤 데이터로 학습되었는지에 따라 성능과 사용 목적이 달라질 수 있습니다.

예를 들어 영화 리뷰를 이용하여 학습한 감정 분석 모델은 영화나 일반적인 문장에는 잘 작동할 수 있지만 전문적인 과학 논문이나 의학 문장을 분석하는 데에는 적합하지 않을 수 있습니다.

따라서 Model Card에서는 다음과 같은 내용을 확인하는 것이 중요합니다.

모델을 누가 만들었는지 확인합니다.

어떤 목적으로 개발된 모델인지 살펴봅니다.

어떤 언어를 지원하는지 확인합니다.

어떤 데이터를 이용하여 학습했는지 확인합니다.

모델의 성능과 제한사항을 살펴봅니다.

라이선스가 어떻게 적용되는지도 반드시 확인해야 합니다.

학생들이 Model Card를 읽어 보는 활동은 단순한 모델 사용법을 배우는 것보다 더 중요할 수 있습니다.

왜냐하면 AI가 어떤 데이터를 학습했고 어떤 조건에서 좋은 성능을 내는지 이해하는 과정이기 때문입니다.

3. 모델 파일은 어떤 구조로 되어 있을까요?

Hugging Face의 모델 페이지에서는 모델을 구성하는 여러 파일도 확인할 수 있습니다.

대표적으로 다음과 같은 파일들이 사용됩니다.

 

config.json

tokenizer.json

tokenizer_config.json

model.safetensors

README.md

 

각 파일에는 서로 다른 정보가 들어 있습니다.

config.json에는 모델의 구조와 설정 정보가 들어 있습니다.

Tokenizer 관련 파일에는 문장을 AI 모델이 처리할 수 있도록 Token으로 나누고 숫자로 변환하는 방법이 저장되어 있습니다.

model.safetensors와 같은 파일에는 모델이 학습하면서 얻은 가중치가 저장되어 있습니다.

 

Hugging Face 모델 페이지를 살펴보는 것만으로도 인공지능 모델 하나가 단순히 하나의 파일로 존재하는 것이 아니라 여러 구성 요소로 이루어져 있다는 것을 알 수 있습니다.

4. Datasets 메뉴는 AI에 필요한 데이터를 찾는 공간입니다

인공지능에서 모델만큼 중요한 것이 데이터입니다.

모델은 데이터를 이용하여 학습하고, 새로운 데이터를 이용하여 성능을 평가합니다.

Hugging Face의 Datasets 메뉴에서는 다양한 인공지능 연구와 학습에 사용할 수 있는 데이터셋을 찾아볼 수 있습니다.

 

예를 들어 감정 분석 모델을 학습하려면 문장과 함께 해당 문장이 긍정인지 부정인지 표시된 데이터가 필요합니다.

이미지 분류 모델을 학습하려면 이미지와 함께 해당 이미지가 어떤 종류인지 나타내는 Label이 필요합니다.

음성 인식 AI를 개발하려면 음성 파일과 해당 음성이 어떤 문장인지 기록한 데이터가 필요합니다.

Hugging Face Datasets에서는 이러한 다양한 데이터를 찾아볼 수 있습니다.

 

5. Dataset Card에서는 데이터의 출처를 확인해야 합니다

Dataset에서도 모델과 마찬가지로 설명 페이지를 확인할 수 있습니다.

이를 Dataset Card라고 합니다.

Dataset Card에서는 데이터가 어디에서 만들어졌는지, 어떤 목적으로 사용할 수 있는지, 데이터가 어떤 구조로 되어 있는지 등을 확인할 수 있습니다.

데이터의 출처를 확인하는 것은 매우 중요합니다.

 

예를 들어 특정 연령대의 사람들이 작성한 문장만 포함되어 있다면 다른 연령대의 언어 표현을 충분히 반영하지 못할 수 있습니다.

특정 국가나 지역의 데이터가 지나치게 많이 포함되어 있다면 다른 문화권에 적용했을 때 성능이 낮아질 수도 있습니다.

따라서 Dataset을 사용할 때는 데이터의 양만 확인하는 것이 아니라 데이터의 구성과 출처, 라이선스를 함께 확인해야 합니다.

6. Dataset Viewer로 데이터를 직접 확인할 수 있습니다

Hugging Face의 Datasets에는 데이터를 웹브라우저에서 직접 살펴볼 수 있는 기능도 있습니다.

이를 이용하면 데이터 전체를 다운로드하지 않고도 실제 데이터가 어떻게 구성되어 있는지 확인할 수 있습니다.

 

예를 들어 감정 분석 데이터셋이라면 다음과 같은 형태로 데이터를 확인할 수 있습니다.

 

 

오늘 기분이 정말 좋습니다.

Label

positive

 

 

오늘 시험을 완전히 망쳤습니다.

Label

negative

 

와 같은 형태입니다.

Dataset Viewer를 이용하면 대용량 데이터를 다운로드하기 전에 이 데이터가 실제로 자신의 연구 목적에 맞는지 확인할 수 있습니다.

7. Spaces는 인공지능을 직접 체험하는 공간입니다

Hugging Face에서 학생들이 가장 흥미롭게 사용할 수 있는 기능 가운데 하나가 Spaces입니다.

Spaces는 다른 사람이 만든 AI 프로그램을 웹브라우저에서 직접 실행해 볼 수 있도록 만든 공간입니다.

예를 들어 이미지 생성 AI가 Space로 공개되어 있다면 별도의 프로그램을 설치하지 않고도 웹페이지에서 문장을 입력하여 이미지를 생성할 수 있습니다.

음성 인식 AI라면 자신의 음성을 입력하여 AI가 어떤 문장으로 인식하는지 확인할 수 있습니다.

이미지 분류 모델이라면 사진을 업로드하여 AI가 어떤 종류의 이미지라고 판단하는지 확인할 수 있습니다.

이처럼 Spaces는 AI 모델 자체보다 AI 모델이 실제 프로그램으로 어떻게 사용되는지 체험하는 공간입니다.

 

8. 자신이 만든 AI를 Spaces에 공개할 수도 있습니다

Spaces는 다른 사람이 만든 프로그램을 실행하는 용도로만 사용하는 것이 아닙니다.

자신이 만든 AI 프로그램을 직접 공개할 수도 있습니다.

예를 들어 학생이 Hugging Face에서 감정 분석 모델을 불러와 Python 프로그램을 만들었다고 가정해 보겠습니다.

Python 코드만 있다면 프로그램을 실행하려는 사람도 Python 환경을 구성해야 합니다.

하지만 Gradio를 이용하여 웹 인터페이스를 만들면 웹페이지에서 문장을 입력하고 버튼을 눌러 결과를 확인할 수 있습니다.

이를 Hugging Face Spaces에 공개하면 다른 학생들도 자신의 컴퓨터에서 웹브라우저만 이용하여 프로그램을 실행할 수 있습니다.

학생 프로젝트에서는 다음과 같은 과정으로 발전시킬 수 있습니다.

 

Hugging Face에서 모델을 검색합니다.

Python에서 모델을 실행합니다.

모델의 결과를 분석합니다.

Gradio로 웹 인터페이스를 만듭니다.

Spaces에 프로그램을 공개합니다.

 

9. Papers 메뉴에서는 AI 연구 논문을 살펴볼 수 있습니다

Hugging Face에서는 AI 모델뿐만 아니라 관련 연구 논문도 살펴볼 수 있습니다.

인공지능 분야에서는 새로운 연구 결과가 논문으로 발표된 뒤 해당 연구에 사용된 모델이 공개되는 경우가 많습니다.

논문을 읽고 해당 모델을 찾아 실제로 실행해 보는 방식으로 공부할 수 있습니다.

 

예를 들어 새로운 Transformer 모델에 관한 논문을 읽었다면 Hugging Face에서 해당 모델이 공개되어 있는지 확인할 수 있습니다.

모델이 공개되어 있다면 직접 실행하면서 논문의 내용을 이해할 수 있습니다.

 

10. Collections는 관련 자료를 하나의 주제로 정리하는 기능입니다

Hugging Face에서 여러 모델과 데이터셋을 검색하다 보면 관심 있는 자료가 점점 많아집니다.

이때 관련 자료를 하나의 주제로 묶어 정리할 수 있는 기능이 Collections입니다.

 

예를 들어 한국어 자연어 처리를 공부한다면 다음과 같은 자료를 하나의 Collection으로 정리할 수 있습니다.

 

한국어 BERT 모델

한국어 감정 분석 모델

한국어 문서 분류 모델

한국어 데이터셋

관련 논문

관련 Spaces

이렇게 정리하면 자신의 연구 주제와 관련된 자료를 체계적으로 관리할 수 있습니다.

학생 연구 프로젝트에서도 매우 유용하게 활용할 수 있습니다.

11. Hugging Face를 활용하는 전체 과정

Hugging Face의 여러 기능은 각각 독립적으로 존재하는 것이 아니라 하나의 AI 개발 과정으로 연결됩니다.

예를 들어 한국어 감정 분석 AI를 만든다고 생각해 보겠습니다.

 

먼저 Models에서 적절한 한국어 모델을 검색합니다.

Model Card를 읽고 모델의 특징을 확인합니다.

Datasets에서 관련 데이터를 찾아봅니다.

Dataset Card와 Dataset Viewer를 이용하여 데이터를 확인합니다.

Python이나 Google Colab에서 모델을 실행합니다.

필요하면 자신의 데이터로 Fine-tuning합니다.

모델의 성능을 평가합니다.

Gradio로 사용자 화면을 만듭니다.

완성된 결과를 Spaces에 공개합니다.

이 흐름을 이해하면 Hugging Face의 메뉴가 왜 필요한지 자연스럽게 이해할 수 있습니다.

12. Google Colab에서 Hugging Face를 사용해 봅시다

Hugging Face를 처음 공부하면 자신의 컴퓨터에 복잡한 개발 환경을 설치하기보다 Google Colab을 사용하는 것이 편리합니다.

Google Colab은 웹브라우저에서 Python 프로그램을 실행할 수 있는 환경입니다.

Python과 인공지능 라이브러리를 자신의 컴퓨터에 직접 설치하지 않아도 Hugging Face 모델을 실습할 수 있습니다.

Google Colab에 접속한 뒤 새 노트북을 만들고 다음 코드를 순서대로 실행하면 됩니다.

 

실습 1. Transformers 설치하기

먼저 Hugging Face의 Transformers 라이브러리를 설치합니다.

!pip install -q transformers

설치가 완료되면 Hugging Face의 여러 모델을 Python에서 사용할 수 있습니다.

실습 2. 간단한 감정 분석 모델 실행하기

가장 간단한 방법은 pipeline()을 사용하는 것입니다.

from transformers import pipeline

classifier = pipeline(
    "sentiment-analysis",
    model="nlptown/bert-base-multilingual-uncased-sentiment"
)

result = classifier("오늘 기분이 정말 좋습니다.")

print(result)

실행하면 모델이 입력된 문장을 분석하여 감정에 해당하는 결과를 출력합니다.

예를 들어 결과는 모델에 따라 다음과 비슷하게 나타날 수 있습니다.

[{'label': '5 stars', 'score': 0.63}]

여기에서 label은 모델이 판단한 결과이고, score는 모델이 해당 판단에 얼마나 높은 확률을 부여했는지를 나타냅니다.

13. 여러 문장을 한 번에 분석해 봅시다

한 문장만 분석하는 것보다 여러 문장을 비교해 보면 더 재미있는 결과를 확인할 수 있습니다.

sentences = [
    "오늘 기분이 정말 좋습니다.",
    "오늘은 너무 힘든 하루였습니다.",
    "시험이 끝났지만 결과가 걱정됩니다.",
    "시험을 망쳐서 정말 기분이 좋네요."
]

results = classifier(sentences)

for sentence, result in zip(sentences, results):
    print("문장 :", sentence)
    print("결과 :", result)
    print()

이 실습에서는 마지막 문장을 주의 깊게 살펴볼 필요가 있습니다.

시험을 망쳐서 정말 기분이 좋네요.

라는 문장은 사람이 읽으면 반어적인 표현이라는 것을 쉽게 알 수 있습니다.

하지만 AI는 기분이 좋네요라는 단어에 영향을 받아 긍정적인 문장으로 판단할 수도 있습니다.

이 결과를 이용하면서 다음과 같은 질문을 생각해 볼 수 있습니다.

 

AI는 문장의 의미를 정말 이해한 것일까요?

AI는 반어법을 얼마나 잘 이해할 수 있을까요?

학습 데이터가 달라지면 결과도 달라질까요?

한국어와 영어에서 같은 모델의 성능은 동일할까요?

 

이런 질문들을 해보면서 AI 성능과의 인과관계를 생각해 봅시다.

 

14. 번역 모델도 간단하게 사용할 수 있습니다

Hugging Face에서는 감정 분석뿐만 아니라 번역 모델도 사용할 수 있습니다.

예를 들어 영어를 한국어로 번역하는 모델을 사용하려면 다음과 같이 작성할 수 있습니다.

모델이 정상적으로 실행되면 영어 문장을 한국어로 번역한 결과를 확인할 수 있습니다.

 

from transformers import AutoTokenizer, AutoModelForSeq2SeqLM

model_name = "Helsinki-NLP/opus-mt-tc-big-en-ko"

# 1. 토크나이저와 번역 모델 불러오기
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForSeq2SeqLM.from_pretrained(model_name)

# 2. 번역할 영어 문장
text = "Artificial intelligence is changing the way we learn."

# 3. 문장을 모델이 처리할 수 있는 토큰으로 변환
inputs = tokenizer(
    text,
    return_tensors="pt",
    truncation=True
)

# 4. 영어 → 한국어 번역 생성
outputs = model.generate(
    **inputs,
    max_new_tokens=100
)

# 5. 생성된 토큰을 한국어 문장으로 변환
translated_text = tokenizer.decode(
    outputs[0],
    skip_special_tokens=True
)

# 6. 결과 출력
print(translated_text)

 

이 예제를 활용하면 학생들이 서로 다른 번역 모델을 선택하여 같은 문장의 번역 결과를 비교할 수도 있습니다.

 

 

지금까지 예시를 정리한 파일입니다. 

 

huggingface_1.ipynb
0.97MB

15. 문장 생성 모델도 실행할 수 있습니다

다음과 같이 텍스트 생성 모델도 사용할 수 있습니다.

from transformers import pipeline

generator = pipeline(
    "text-generation",
    model="distilgpt2"
)

result = generator(
    "Artificial intelligence will",
    max_new_tokens=30
)

print(result[0]["generated_text"])

이 프로그램에서는

Artificial intelligence will

이라는 문장의 뒤를 AI가 자동으로 이어서 생성합니다.

학생들은 입력 문장을 바꾸어 가면서 결과가 어떻게 달라지는지 관찰할 수 있습니다.

16. 모델을 직접 검색해서 바꾸어 볼 수 있습니다

Hugging Face 실습에서 가장 중요한 활동 가운데 하나는 프로그램에 적혀 있는 모델을 그대로 사용하는 것만이 아니라 자신이 직접 다른 모델을 찾아 교체해 보는 것입니다.

예를 들어 Hugging Face Models 메뉴에서

sentiment analysis

를 검색합니다.

그다음 적절한 모델의 이름을 확인합니다.

모델 페이지에는 보통 다음과 같은 이름이 표시됩니다.

사용자명/모델이름

이 이름을 Python 코드의 model= 부분에 넣으면 됩니다.

classifier = pipeline(
    "sentiment-analysis",
    model="사용자명/모델이름"
)

이렇게 하면 동일한 프로그램에 서로 다른 AI 모델을 적용할 수 있습니다.


17. 서로 다른 모델의 결과를 비교하는 연구도 가능합니다

학생 수준에서도 매우 좋은 탐구 주제가 될 수 있습니다.

예를 들어 두 개의 감정 분석 모델을 선택합니다.

from transformers import pipeline

model1 = pipeline(
    "sentiment-analysis",
    model="nlptown/bert-base-multilingual-uncased-sentiment"
)

그리고 다른 모델을 Hugging Face에서 찾아 model2로 설정합니다.

그다음 동일한 문장을 두 모델에 입력합니다.

text = "오늘 시험 결과가 생각보다 괜찮았습니다."

print("Model 1")
print(model1(text))

print("Model 2")
print(model2(text))

두 모델의 결과가 같을 수도 있고 다를 수도 있습니다.

그렇다면 학생은 왜 결과가 달라지는지를 조사할 수 있습니다.

모델의 구조가 다를 수 있습니다.

학습 데이터가 다를 수 있습니다.

지원하는 언어의 비중이 다를 수도 있습니다.

Fine-tuning에 사용된 데이터가 다를 수도 있습니다.

이렇게 하면 단순한 AI 실행 실습이 모델 성능 비교 연구로 발전할 수 있습니다.


18. Google Colab에서 GPU를 사용하는 방법

작은 모델은 CPU에서도 실행할 수 있지만 모델의 크기가 커지면 GPU를 사용하는 것이 좋습니다.

Google Colab에서 GPU를 사용하려면 상단 메뉴에서 실행 환경 설정을 변경하여 GPU를 선택하면 됩니다.

GPU가 정상적으로 연결되었는지는 다음 코드로 확인할 수 있습니다.

import torch

print(torch.cuda.is_available())

결과가

True

로 나타나면 GPU를 사용할 수 있는 상태입니다.

GPU의 종류는 다음과 같이 확인할 수 있습니다.

!nvidia-smi

19. GPU에서 Hugging Face 모델 실행하기

GPU가 연결되어 있다면 pipeline을 만들 때 device=0을 지정할 수 있습니다.

from transformers import pipeline

classifier = pipeline(
    "sentiment-analysis",
    model="nlptown/bert-base-multilingual-uncased-sentiment",
    device=0
)

result = classifier("인공지능을 공부하는 것은 매우 흥미롭습니다.")

print(result)

여기에서 device=0은 첫 번째 GPU를 사용하겠다는 의미입니다.

작은 모델에서는 속도 차이가 크지 않을 수도 있지만 큰 모델을 사용할수록 GPU의 효과가 커집니다.


20. 간단한 Gradio 웹 프로그램 만들어 보기

Hugging Face의 Spaces가 어떤 방식으로 동작하는지 이해하려면 Google Colab에서 간단한 Gradio 프로그램을 만들어 보는 것도 좋습니다.

먼저 Gradio를 설치합니다.

!pip install -q gradio

그다음 다음 프로그램을 실행합니다.

import gradio as gr
from transformers import pipeline

classifier = pipeline(
    "sentiment-analysis",
    model="nlptown/bert-base-multilingual-uncased-sentiment"
)

def analyze(text):
    result = classifier(text)
    return str(result)

demo = gr.Interface(
    fn=analyze,
    inputs="text",
    outputs="text",
    title="Hugging Face 감정 분석 실습"
)

demo.launch()

프로그램을 실행하면 웹 화면이 나타납니다.

학생은 입력창에

오늘은 정말 즐거운 하루였습니다.

와 같은 문장을 입력한 뒤 결과를 확인할 수 있습니다.

이것이 Hugging Face Spaces에서 볼 수 있는 AI 웹 애플리케이션의 가장 기본적인 형태입니다.


마무리

Hugging Face는 단순히 인공지능 모델을 다운로드하는 사이트가 아닙니다.

Models에서는 다양한 AI 모델을 검색할 수 있고, Model Card에서는 모델의 특징과 사용 방법을 확인할 수 있습니다.

Datasets에서는 AI 학습과 평가에 사용할 데이터를 찾을 수 있으며 Dataset Viewer를 통해 실제 데이터를 미리 확인할 수도 있습니다.

Spaces에서는 다른 사람이 만든 AI 서비스를 직접 체험할 수 있고 자신이 만든 AI 프로그램을 웹 형태로 공개할 수도 있습니다.

Google Colab과 Hugging Face를 함께 사용하면 별도의 복잡한 개발 환경을 구축하지 않고도 실제 인공지능 모델을 실행할 수 있습니다.

 

'인공지능 > 자연어 처리' 카테고리의 다른 글

네이버 영화 리뷰  (0) 2026.09.01
AI 개발용 Linux 시스템 구축  (3) 2026.07.05
KoBERT로 영화 감상 리뷰 분석하기  (0) 2026.06.15
트랜스포머 정리  (1) 2025.11.10
BERT 개요  (0) 2025.11.10