현업 사용자가 보는 AI 화면에서 점수 대신 건수로 성능을 표현하고, 자유 입력 대신 선택형 입력을 받도록 바꿨다. 용어 정책과 함께 비전문가용 AI 화면을 설계하며 적용한 원칙 4가지를 정리했다.
이 글의 순서
첫 화면의 반응: "그래서 믿어도 돼요?"
이슈 등급 추천 화면 첫 버전에는 성능을 정직하게 적었다. 정확도 몇 %, F1 몇 점, 모델 이름까지. 현업 반응은 하나로 모였다. "그래서 이거 믿어도 되는 거예요?"
틀린 정보는 없었지만 보는 사람이 판단할 수 없는 정보였다. 화면을 쓰는 사람은 현업 담당자다. ML 지표를 알 필요가 없고, 알아야 하는 건 '이 추천을 얼마나 참고해도 되는가' 하나다. 그 질문에 답하도록 화면을 다시 만들면서 세운 원칙 4가지를 정리했다.
원칙 1. 성능은 건수로 말한다
"정확도 58%" 대신 "10건 중 약 6건을 맞힙니다"라고 쓴다. 같은 정보인데 받아들이는 방식이 다르다. 퍼센트는 시험 점수처럼 읽혀서 낮아 보이고, 건수는 경험처럼 읽혀서 어느 정도 기대해야 하는지 감이 온다. 일기예보의 강수확률처럼 참고용이라는 것도 함께 전달된다.
표현 바꿔 보기
전문가용 표현
현업용 표현
주의건수 환산은 정확도(전체 중 맞힌 비율)로 한다. F1은 클래스 불균형을 반영한 모델 비교용 지표라서 '10건 중 몇 건'으로 바꾸면 의미가 어긋난다. 화면 뒤에서 모델을 고를 때는 F1, 사람에게 보여줄 때는 정확도 기반 건수로 나눠 쓴다.
원칙 2. 입력은 고르게 하고, 모델에는 문장을 준다
등급 추천 모델은 이슈 제목과 발생 내용 같은 텍스트로 학습했다. 그런데 화면에서 자유 입력을 받으면 사용자가 부담스러워하고, 입력도 들쑥날쑥해진다. "끼임"만 쓰는 사람도 있고 세 줄을 쓰는 사람도 있다.
그래서 화면에서는 이슈 유형, 기인물, 장소를 고르게 하고, 고른 값으로 문장을 만들어 모델에 넣었다. 사용자는 편하고, 모델은 학습 때와 비슷한 형태의 텍스트를 받는다.
선택값 → 문장
장소
작업 상황
이슈 유형
모델에 들어가는 문장
원칙 3. 용어는 한 번 정하면 전부 바꾼다
화면 곳곳에 같은 대상을 다르게 부르는 말이 섞여 있었다. 이번에 정한 표기는 이렇다.
| 바꾸기 전 | 바꾼 뒤 | 이유 |
|---|---|---|
| 도우미 | AI 모델 | 무엇인지 정확히 부른다 |
| 사건 | 이슈 | 현업이 쓰는 말과 맞춘다 |
| 시범 | DEMO | 실데이터 기능과 구분한다 |
용어를 바꾸다가 화면이 깨진 적이 있다. 등급 라벨을 바꿨더니 일부 차트가 비었다. 화면의 JS가 표시용 라벨 문자열을 키로 데이터를 찾고 있었기 때문이다.
# 서버: 라벨을 키로 집계
counts = {"경미 이슈": 120, "잠재 이슈": 40}
// 화면: 라벨 문자열로 꺼냄 → 라벨을 바꾸면 undefined
var minor = data["경미 이슈"];# 키는 코드값, 라벨은 표시용으로만
GRADE_LABEL = {"MINOR": "경미 이슈", "NEARMISS": "잠재 이슈"}
counts = {"MINOR": 120, "NEARMISS": 40}
// 화면은 코드값으로 꺼내고 라벨은 표시할 때만 붙인다
var minor = data["MINOR"];이미 라벨을 키로 쓰고 있다면 라벨과 그 라벨을 참조하는 모든 템플릿·JS를 한 번에 같이 바꿔야 한다. 장기적으로는 키와 라벨을 분리하는 게 맞다.
원칙 4. 설명 문구는 한 줄
AI 화면에는 설명을 많이 붙이고 싶어진다. 학습 데이터 기간, 예외 조건, 주의 사항까지. 그런데 설명이 길수록 읽히지 않고, 틀릴 곳도 많아진다. 실제로 데이터가 바뀐 뒤 갱신되지 않은 안내 상자가 "10건 중 0건, 정확도 0%"를 보여주고 있던 적이 있다.
상단 안내는 "실제 이슈 데이터로 학습된 모델입니다" 한 줄로 줄였다. 성능 카드에는 건수 표현과 함께 고위험 이슈는 별도 규칙으로 보조한다는 사실만 남겼다. 설계 근거나 계산 방식은 화면이 아니라 문서와 이런 글에 쓴다.
줄이기 전
- 학습 데이터 기간과 건수 설명
- 고위험 이슈 제외 조건 문장
- 합성 데이터 경고 배너
- 정확도 % 상자
줄인 뒤
- 상단 한 줄 안내
- "10건 중 약 6건" 성능 카드
- 중대 검토 플래그는 크게, 짧게
정리
- 성능은 건수로 말한다. 건수 환산은 정확도 기준으로 한다.
- 입력은 고르게 하고, 고른 값을 문장으로 만들어 텍스트 모델에 넣는다.
- 용어는 표를 만들어 한 번에 바꾸고, 코드에서는 키와 라벨을 분리한다.
- 설명 문구는 한 줄. 넣기 전에 "이걸 안 읽으면 오해하는가?"를 묻는다.