← Yeongjun Yoo
Andrew Ng: AI Engineering Skills Map · Part 2 of 52026-08-21

This post is in Korean.

1부: AI 애플리케이션 구축 및 배포 — 불확실성을 다루는 기술과 Evals

원작자: 앤드류 응 (Andrew Ng / DeepLearning.AI)
출처: DeepLearning.AI 뉴스레터 The Batch (Issue 367, 2026년 8월 21일)
역자: 유영준 (완역 및 큐레이션)


TL;DR


[한국어 완역]

친애하는 친구들에게,

지난 서신에서 저는 AI 엔지니어링 역량 맵의 4대 핵심 축을 소개했습니다. 이번 서신에서는 그 첫 번째인 **“AI 애플리케이션 구축 및 배포”**에 대해 자세히 다루겠습니다.

AI 애플리케이션을 능숙하게 구축하고 배포한다는 것은 다음 6가지 세부 역량을 이해하고 구사함을 의미합니다:

  1. LLM 펀더멘털 (LLM foundations)
  2. 데이터 기반 모델 그라운딩 (Grounding models with data)
  3. 에이전틱 시스템 구축 (Building agentic systems)
  4. 평가 기반 개발 (Evaluation-driven development)
  5. 프로덕션 운영 (Operating in production)
  6. 머신러닝 펀더멘털 (Machine learning foundations)

AI 소프트웨어와 일반 소프트웨어의 핵심 차이는 결과물의 예측 가능성이 낮다는 점입니다. 이러한 불확실성 때문에 AI 시스템을 구축하는 과정은 전통적인 소프트웨어보다 훨씬 더 반복적(iterative)이며 사전에 완벽히 계획하기 어렵습니다.

숙련된 AI 엔지니어는 소프트웨어를 조각내어 만들고, 검사하고, 중간 결과에 크게 영향받는 일련의 단계를 밟아가며 다음에 무엇을 시도할지 결정합니다. 불확실한 AI 컴포넌트를 바탕으로 신뢰할 수 있는 시스템을 구축하는 비결은 바로 이 ‘다음 단계 결정 능력’에 있으며, 이를 위해 다음 6가지가 필요합니다:

1. LLM 펀더멘털 (LLM foundations)

거대 언어 모델이 입력을 어떻게 토큰화하고 출력을 생성하는지 이해하면 언제 모델을 신뢰할 수 있고 언제 실패하는지 알 수 있습니다. 멀티모달 모델 사용 시점, 컨텍스트 윈도우에 무엇을 넣을지에 대한 트레이드오프, 캐시 히트, 지식 차단 시점(knowledge cutoff), 추론 노력 수준(reasoning effort), 샘플링 파라미터, 도구 호출(tool calling) 같은 특수 기능 활용 시점을 판단할 수 있게 됩니다. 나아가 적절한 모델 조합을 선택하고 미세 조정(fine-tuning)이나 자체 호스팅(self-hosting)을 적용할 수 있습니다.

2. 데이터 기반 모델 그라운딩 (Grounding models with data)

LLM은 유용한 출력을 내기 위해 양질의 입력 컨텍스트가 필요합니다. 벡터 검색 기반 RAG는 초기의 시도였지만, 이제 그라운딩 기법은 크게 확장되었습니다.

프롬프트에 직접 포함할 것과 도구를 통해 온디맨드로 검색할 것을 구분하고, 벡터 인덱스·지식 그래프(KG)·정형 데이터 위의 시맨틱 레이어 중 데이터와 쿼리에 맞는 표현 방식을 선택해야 합니다. 문서(텍스트, PDF, HTML, 이미지)를 LLM 입력용으로 가공하고 데이터를 항상 깨끗하고 최신 상태로 유지하는 파이프라인 엔지니어링 역량이 필수적입니다.

3. 에이전틱 시스템 구축 (Building agentic systems)

사전에 정의된 일련의 LLM 호출 워크플로우부터, 모델이 스스로 다음 단계를 반복 결정하는 에이전트 하네스(agent harness) 기반 시스템까지 아우릅니다. 어떤 단계를 체이닝하고 무엇을 병렬화할지, 언제 코드를 쓰고 언제 LLM을 쓸지 결정하고 폴백(fallback)을 포함한 아키텍처를 설계합니다.

도구 호출 범위(MCP, CLI, 샌드박스), 메모리 아키텍처, 장기 세션 컨텍스트 관리, 단일 에이전트 vs 다중 에이전트 오케스트레이션 선택, 그리고 가드레일, 적대적 입력 방어, 데이터 유출 방지 등 프로덕션 안전 및 거버넌스를 구축합니다.

4. 평가 기반 개발 (Evaluation-driven development)

제 경험상 뛰어난 AI 시스템 개발자를 구별 짓는 가장 중요한 자질은 규율 있는 평가(evals) 및 오차 분석(error analysis) 루프를 주도할 수 있는가입니다.

프로젝트와 단계마다 접근법이 크게 달라 마스터하기 까다롭지만, 시스템 트레이스와 출력을 관찰하고 탐색적 데이터 분석과 비즈니스 인사이트를 결합하여 무엇을 측정할지 결정합니다. 결정론적 코드 기반 평가, LLM-as-a-judge, 휴먼 인 더 루프(HITL)를 적재적소에 배치하고, 평가 지표 자체를 지속적으로 검증·발전시킵니다.

5. 프로덕션 운영 (Operating in production)

예측 불가능성, 비용, 지연 시간(latency) 때문에 전통 소프트웨어와 다릅니다. 실제 사용 현황을 파악하는 관측성(observability) 구축, 드리프트 탐지, 프롬프트 인젝션 등 보안 사고 대응, 통계적 회귀 테스트와 위험도에 비례한 CI/CD 설정이 필요합니다. 모델 조합 최적화, 증류(distillation), 미세조정, 워크플로우 단순화를 통해 비용과 지연 시간을 최적화합니다.

6. 머신러닝 펀더멘털 (Machine learning foundations)

최신 LLM은 지도학습과 강화학습 등 ML 기법으로 구축됩니다. LLM을 훌륭히 다루는 모든 엔지니어는 ML과 딥러닝을 깊이 이해하고 있습니다.

정확도, 학습 속도, 추론 속도의 트레이드오프, 데이터 엔지니어링, 그리고 편향/분산(bias/variance), 오차 분석 등 불확실한 출력을 다루는 핵심 멘탈 모델은 AI 시스템 개발 전반의 의사결정에 필수적입니다.


Keep building!
— 앤드류 응 (Andrew Ng)


큐레이터 노트

앤드류 응 교수가 지적한 문장 중 가장 무게감 있는 대목은 **"뛰어난 개발자를 구별 짓는 최우선 자질은 규율 있는 Evals 루프를 주도할 수 있는가"**입니다.

많은 이들이 화려한 프롬프트나 최신 모델 갈아끼우기에 매몰될 때, 실제 프로덕션을 완결하는 엔지니어는:

  1. 시스템이 실패하는 경계를 명확한 테스트 케이스로 정의하고,
  2. 결정론적 검사와 LLM 기반 채점을 결합해 회귀를 방지하며,
  3. 오차 분석을 통해 데이터 파이프라인이나 프롬프트 구조를 정밀 타격합니다.

불확실성을 "운"에 맡기지 않고 "통계와 엔지니어링"으로 가두는 능력이 핵심입니다.