UX Heuristic Evaluation

기존 서비스 UX 진단을 위한 AI 프롬프트 설계법

화면 유형별 맞춤 프롬프트로 정밀한 진단 결과 이끌어내기

Mar 12, 2026 · 10 min

AI에게 "이 화면의 UX를 평가해줘"라고 요청하면 "직관적이고 깔끔한 디자인입니다. 다만 CTA 버튼이 좀 더 강조되면 좋겠습니다"와 같은 뻔한 응답이 돌아옵니다. 구체적이고 실무에 즉시 활용 가능한 UX 진단을 얻으려면 프롬프트가 체계적으로 설계되어야 합니다. 같은 AI 모델이라도 프롬프트 설계에 따라 결과물의 품질이 10배 이상 차이 납니다.

나쁜 UX 진단 프롬프트 vs 좋은 UX 진단 프롬프트

나쁜 프롬프트의 공통점은 컨텍스트 부재입니다. "이 로그인 화면을 평가해줘"라는 지시는 AI에게 아무 정보도 주지 않습니다. AI는 일반적인 로그인 화면의 베스트 프랙티스를 나열할 뿐, 해당 서비스의 실제 사용자 집단, 비즈니스 목표, 기술적 제약을 반영하지 못합니다. 반면 좋은 프롬프트는 세 가지 레이어를 모두 갖춥니다: 서비스 컨텍스트, 평가 기준, 출력 형식.

좋은 UX 진단 프롬프트의 예시: "당신은 10년 경력의 UX 전문가입니다. 아래 로그인 화면은 40~60대 중소기업 CEO를 주요 사용자로 하는 기업용 회계 SaaS의 첫 화면입니다. Nielsen의 10가지 사용성 휴리스틱을 기준으로 평가하고, 발견된 문제를 [화면 요소 / 위반 원칙 / 심각도(High·Med·Low) / 개선 제안] 형식의 표로 정리해주세요. 이 사용자층은 디지털 리터러시가 낮고, 처음 접하는 소프트웨어에 대한 거부감이 높습니다." 이 프롬프트는 AI에게 역할, 사용자 프로필, 평가 기준, 출력 형식을 모두 제공합니다.

효과적인 UX 진단 프롬프트의 4가지 구성 요소

  • 역할 정의 (Role): "10년 경력 UX 전문가" — AI의 응답 전문성 수준과 관점을 고정
  • 서비스 컨텍스트 (Context): 서비스 목적, 주요 사용자 집단, 핵심 태스크, 기술적 제약
  • 평가 기준 (Criteria): 닐슨 10원칙, WCAG 2.1, 업종별 UX 표준 등 구체적 프레임워크 명시
  • 출력 형식 (Format): 표 구조, 포함 필드, 심각도 분류 기준, 개선안 포함 여부
  • 제약 조건 (Constraints): 의도적 설계 결정(브랜드 가이드, 규제 요건)을 "평가 제외" 처리

화면 유형별 특화 프롬프트 전략

로그인/회원가입 화면은 신뢰 신호(Trust Signal)와 오류 복구에 집중해야 합니다. 프롬프트에 "비밀번호 오류 시 복구 경험, 소셜 로그인 대안 가시성, 보안 인식을 위한 UI 요소"를 특별히 검토하도록 명시합니다. 결제 플로우는 인지적 부하 감소와 중도 이탈 방지가 핵심입니다. "각 단계의 진행 상황 가시성, 총 결제 금액의 투명한 노출, 이전 단계로 돌아가기의 용이성"을 체크리스트로 추가합니다.

대시보드는 정보 계층 구조와 스캔 가능성이 중요합니다. "사용자가 5초 이내에 핵심 지표를 찾을 수 있는지, 데이터 시각화의 즉시 이해 가능성, 우선순위가 낮은 정보의 적절한 숨김 처리"를 진단 포인트로 설정합니다. 온보딩 화면은 가치 제안의 명확성과 첫 태스크 완료 유도에 초점을 맞춥니다.

멀티모달 AI를 활용한 실제 화면 분석

GPT-4o, Claude 3.5 Sonnet 등 멀티모달 모델을 사용하면 실제 스크린샷을 직접 분석에 활용할 수 있습니다. 화면 이미지를 첨부할 때는 해상도와 크기에 주의가 필요합니다. 최소 1280×800 이상의 해상도로 모바일과 데스크톱 버전을 각각 제공하면 반응형 디자인의 일관성도 함께 진단받을 수 있습니다. 이미지와 함께 화면의 실제 인터랙션(호버, 클릭 후 상태 변화)을 텍스트로 보충 설명하면 분석 정확도가 크게 향상됩니다.

여러 화면을 배치 분석할 때는 각 화면에 고유 ID를 부여하고 동일 프롬프트를 일괄 적용하는 방식이 효율적입니다. Python 스크립트나 n8n 자동화로 화면 캡처 → AI 분석 → 결과 집계를 파이프라인으로 구성하면, 100개 화면 분석 결과를 스프레드시트나 Notion 데이터베이스에 자동으로 저장할 수 있습니다.

프롬프트 품질을 높이는 반복 개선 전략

첫 번째 프롬프트가 완벽할 가능성은 낮습니다. AI 결과와 실제 전문가 검토 결과를 비교하면서 프롬프트를 개선해 나가는 반복 프로세스가 필요합니다. AI가 중요한 문제를 놓쳤다면 해당 영역에 대한 명시적 체크 항목을 프롬프트에 추가합니다. AI가 실제로 문제가 아닌 것을 문제로 분류했다면, 해당 설계 결정의 이유를 컨텍스트로 추가합니다.

진단 프롬프트 템플릿의 구성 요소

효과적인 UX 진단 프롬프트 템플릿은 5개 섹션으로 구성됩니다. 첫째, 서비스 맥락(서비스 목적, 주요 사용자, 핵심 태스크). 둘째, 화면 메타데이터(화면 이름, 사용자 여정 내 위치). 셋째, 평가 기준(적용할 휴리스틱 원칙 목록). 넷째, 출력 형식(발견 사항의 구조, 심각도 분류 기준). 다섯째, 평가 제외 영역(의도적 설계 결정으로 지적하지 말아야 할 부분). 이 다섯 섹션이 갖춰진 프롬프트는 그렇지 않은 프롬프트 대비 실무 적용 가능한 진단 결과를 2~3배 더 많이 생성합니다.

다섯 번째 섹션인 평가 제외 영역이 특히 중요합니다. 예를 들어 "메뉴 아이템 간격이 넓은 것은 의도적 설계로, 문제로 지적하지 말 것"이나 "배경 이미지가 없는 것은 성능 최적화를 위한 결정"과 같은 맥락을 제공하지 않으면 AI는 이를 사용성 문제로 오분류합니다. 이 제외 영역을 명시하면 False Positive(실제로는 문제가 아닌 것을 문제로 분류하는 오류)가 크게 줄어 전문가의 검토 시간이 단축됩니다.

진단 결과의 품질을 판단하는 기준

좋은 진단 결과는 세 가지 특성을 갖습니다. 첫째는 구체성입니다. "버튼이 작다"가 아닌 "결제 완료 버튼이 36px로 WCAG 터치 타겟 권장 기준(44px)보다 작아 모바일에서 오터치 가능성이 높다"처럼 수치와 기준이 명확해야 합니다. 둘째는 사용자 영향과의 연결입니다. 발견된 문제가 실제로 어떤 사용자 행동에 영향을 미치는지 설명할 수 있어야 합니다. 셋째는 실행 가능성입니다. 개선 방향이 명확하고 개발팀이 다음 스프린트에 반영할 수 있을 만큼 구체적이어야 합니다.

이 세 기준 중 하나라도 충족하지 못하는 진단 결과는 프롬프트를 개선하거나 해당 항목에 Few-shot 예시를 추가하여 품질을 높입니다. 진단 결과의 품질 기준을 팀 내에서 합의하고 문서화하면, AI 평가 프롬프트 개선이 방향성을 잡을 수 있습니다. 최초 진단 기준을 설정하고 매 분기 결과 품질을 재검토하면 AI 평가 시스템이 지속적으로 정교해집니다.

Key Takeaways

1

역할 + 컨텍스트 + 기준 + 출력 형식의 4요소를 모두 포함한 프롬프트가 핵심

2

화면 유형(로그인, 결제, 대시보드, 온보딩)별로 특화된 진단 포인트를 추가하라

3

멀티모달 AI에 실제 스크린샷을 첨부하면 텍스트 설명만으로는 불가능한 분석 가능

4

배치 처리 자동화로 100개 화면을 동일 기준으로 일관되게 분석 가능

5

전문가 리뷰와 비교하며 프롬프트를 반복 개선하는 것이 품질 향상의 핵심

More articles