잘 쓰는 AI에서, 잘 판단하는 AI로
생성하는 AI에서 업무를 연결하는 AI로 — Jev가 보여주는 변화와 일의 재설계.
AI 시대 · 관점 · 글 고승원
큰 결과물을 만드는 시간은 줄었다. 그 사이 작은 결정을 내리는 시간은 생각보다 많이 남아 있다.
우리는 이제 AI에게 꽤 많은 일을 부탁한다. 이메일을 쓰고, 문서를 요약하고, 회의를 정리하고, 제품을 직접 개발하기도 한다. AI를 적극적으로 쓰는 사람이라면 일하는 속도와 가능한 일의 범위가 달라졌다는 사실을 이미 체감하고 있을 것이다.
그런데 결과물을 만드는 속도가 빨라졌다고 해서 하루의 모든 일이 같은 비율로 가벼워지지는 않는다. 초안은 금방 나오는데 확인할 일이 남고, 자료는 정리되는데 누구에게 넘길지 결정해야 하며, 회의록은 완성됐는데 그 안의 약속이 실제 업무로 연결되지는 않는다.
‘이것은 무엇인가’, ‘어디로 보내야 하는가’, ‘지금 처리해야 하는가’, ‘다음 단계로 넘어가도 되는가’를 판단하는 시간은 여전히 길다. 각각은 사소해 보이지만 하루에 수십 번 반복되고 여러 사람의 손을 거치면 조직을 움직이거나 멈추게 하는 일이 된다.
01 · System One
긴 답변 대신, 소프트웨어가 바로 쓰는 판단
최근 TypeSafe의 Jev를 살펴보면서 관심을 갖게 된 것도 이런 작은 판단의 문제였다. Jev는 자연어와 업무 자료를 읽고, 코드가 직접 활용할 수 있는 타입이 지정된 확률적 판단을 반환하는 모델이다. 답의 형태가 미리 정해져 있어, 미리 정의한 질문에 선택값·점수·확률로 답한다.
긴 설명문을 만드는 대신 문의가 어느 유형인지 판단하고, 문서를 새로 쓰는 대신 그 문서가 어떤 기준에 부합하는지 평가하는 데 초점을 맞춘다. TypeSafe는 이런 모델을 System One이라 부른다. 빠르고 집중된 판단을 소프트웨어가 바로 사용할 수 있게 하겠다는 방향이다.
이 글은 성과 보고서가 아니다. 공식 문서와 공개 실험을 읽고 정리하며 생각한, 변화와 적용 가능성에 관한 글이다. 지금 공개된 성능과 앞으로 기대하는 변화는 구분해서 보아야 한다.
02 · Three Primitives
동료에게 묻는 말로 바꾸면 된다
Jev는 세 가지 기본 방식을 제공한다. 기술 용어를 외울 필요는 없다. ‘어디로?’, ‘얼마나?’, ‘맞나요?’ 세 마디면 충분하다.
Choice
어디로?
정해진 후보 중 하나를 고른다
담당자 고르기 — 이 문의는 기업 구매 상담 담당
Score
얼마나?
설명된 단계에 따라 수준을 평가한다
구매 의향의 구체성 — 품목·수량·희망 납기가 명시됨
Noul
맞나요?
특정 조건이 참일 확률을 반환한다
대량 할인 문의 여부 — 그 조건에 해당하는지 확인
다만 구체적인 문의라는 평가가 실제 계약 성사 가능성을 뜻하지는 않는다. 납품 여부와 할인 조건은 재고·배송·판매 정책을 따로 확인해야 한다. 중요한 것은 무엇을 판단하고, 가능한 답이 무엇이며, 그 답 다음에 무엇을 할지가 드러난다는 점이다.
03 · One Inquiry, Many Judgments
한 문장 안에서 판단은 거의 동시에 일어난다
들어온 메시지
“사무용 의자 50개를 구매하려고 합니다. 다음 주 금요일까지 납품 가능한지, 대량 구매 할인이 있는지 알려 주세요.”
어디로 보내야 하는가?
기업 구매 상담 담당
구매 의향이 얼마나 구체적인가?
품목·수량·납기 명시 → 구체성 높음
대량 구매 할인을 문의했는가?
해당 조건에 부합
→ 기업 구매 문의로 분류한 뒤, 납기와 할인 조건 확인을 담당자에게 연결한다.
기존 생성형 AI도 문의를 분류하고 점수를 매길 수 있다. 새로운 점은 ‘분류를 한다’가 아니라, 범위가 정해진 판단을 빠르고 저렴하게 반복하고 그 결과를 프로그램이 처리하기 쉬운 형태로 제공하는 데 초점을 맞췄다는 것이다.
04 · Try a Judgment
같은 형태의 판단을, 세 가지 업무로 바꿔 본다
업무를 골라 보면 STATE(자료)에 세 가지 판단이 어떻게 붙는지 볼 수 있다. Choice로 어디로 보낼지, Score로 얼마나인지, Noul으로 조건이 참일 확률을 확인한 뒤, 다음 업무로 이어진다.
STATE
같은 주문에 두 번 결제됐어요. 오늘 안에 확인해 주실 수 있나요?
함께 볼 자료 · 고객 메시지 · 주문 정보 · 중복 결제 처리 기준
Choice
어느 담당자에게 보낼까요?
Score
처리 우선순위는 어느 정도인가요?
1.7/ 2
Noul
오늘 안에 확인을 요청했나요?
98%
조건이 참일 확률입니다 (강도가 아님).
98%는 요청이 있다는 판단의 확률입니다. 요청이 98%만큼 긴급하다는 뜻은 아닙니다.
다음 업무
결제 문의로 분류하고 빠른 확인 대상으로 표시합니다. 실제 중복 결제·환불 가능 여부는 따로 확인합니다.
05 · 스마트 if문
자연어의 의미를 다루는 판단이 조건문과 연결된다
기존 프로그램은 정해진 값에 따라 다음 행동을 나누는 데 능숙하다. 금액이 기준을 넘으면 추가 승인을 받게 만들 수 있다. 그러나 ‘고객이 사람과의 상담을 원한다면 담당자에게 연결한다’는 규칙에는 문장의 의미를 이해하는 과정이 필요하다. 같은 의도를 사람마다 다르게 표현하기 때문이다.
Jev는 그 조건을 판단할 값을 제공하고, 프로그램은 정해 둔 규칙에 따라 다음 단계를 수행한다. 사람이 읽고 해석하는 대화 인터페이스에 더해, 소프트웨어가 결과를 직접 받아 다음 처리를 결정하는 인터페이스가 중요해진다. 이것을 기계 친화적 지능, Machine-native intelligence로 이해해 볼 수 있다.
다만 분류와 의사결정 자동화 자체가 처음 등장한 것은 아니다. 자연어로 기준을 제시하는 범용 판단을 얼마나 경제적으로 소프트웨어에 넣을 수 있느냐가 여기서 살펴볼 변화다.
06 · Confidence Is Not Truth
높은 숫자를 받았다는 이유만으로 판단이 사실이 되지는 않는다
앞의 구매 문의에서 ‘대량 구매 할인을 문의했는가?’에 참일 확률을 90%로 반환했다고 가정해 보자. 이 숫자는 할인율이 90%라는 뜻도, 고객이 실제로 구매할 확률이 90%라는 뜻도 아니다. 주어진 자료와 질문을 바탕으로 그 조건이 참일 가능성을 모델이 추정했다는 의미다.
확신도(confidence)도 조심해서 이해해야 한다. Choice와 Score의 confidence는 선택지의 확률 분포를 요약한 값이며, 정답률을 따로 검증해 보증하는 값이 아니다. 한 선택지에 확률이 많이 모였다는 것과 그 선택이 실제로 옳다는 것은 다르다.
개념도 — 측정된 Jev 결과가 아님
80%로 예측한 사례를 많이 모았을 때 실제로도 약 80%가 그 조건에 해당하면, 확률이 잘 보정된 것이다. 이는 한 번의 답을 보증하는 성질이 아니라 여러 예측을 모아 확인하는 성질이다.
TypeSafe가 RLCD(Reinforcement Learning for Calibrated Decisions)라 부르는 학습 방향은 이 문제를 겨냥한다. 모델이 표현하는 확률과 실제 결과의 비율이 잘 맞도록 학습하겠다는 것이다. 불확실성을 업무에서 사용할 수 있는 신호로 만들겠다는 목표다.
여기서 공개된 사실보다 앞서 나가지 않으려 한다. RLCD가 어떤 손실 함수·보상·최적화를 쓰는지는 공식 자료에 충분히 공개되어 있지 않다. 학습 목표가 확률 보정에 있다는 사실과, 우리 업무의 모든 입력에서 보정이 잘 유지된다는 사실은 다르다. 실제 자료에서 예측과 결과를 비교하는 일은 여전히 필요하다.
위 90%는 설명을 위한 가상 수치이며 실제 Jev의 응답 결과가 아니다.
07 · Set the Threshold
어디까지 자동으로, 어디부터 사람이
확률 하나로 모든 것을 정하지 않는다. 자동으로 처리할 기준을 정하는 일이 더 중요하다. 기준을 올리고 내려 보면, 같은 예시가 자동 분류로 갈지 사람 검토로 갈지 바뀐다.
기준에 못 미쳐 담당자 검토로 보냄
여기서는 문의를 분류만 합니다. 실제 환불 실행에는 결제 확인·정책·권한 등 별도 조건이 필요합니다.
08 · What You Miss Matters More
정답률 몇 퍼센트보다, 무엇을 놓쳤는가
시스템이 잘 처리한 건은 눈에 잘 띈다. 그러나 실제 요청인데 요청이 아니라고 분류한 건은 업무 목록에서 사라진다. 담당자는 목록에 오른 일만 보고 하루를 마무리했는데, 고객은 아무 답을 받지 못한 상태가 된다. 자동화가 확인 시간을 줄여 줄수록 누락을 발견할 기회도 줄 수 있다.
완전 자동화라는 말보다, 자동 처리의 범위를 정하는 일이 더 생산적이다. 어떤 사례는 명확해서 바로 처리하고, 어떤 사례는 여전히 사람이나 다른 모델이 필요한지 구분하는 것이다.
Jev를 실제 데이터에 적용한 한 독립 실험에서도 차이가 드러났다. 짧고 분류 기준이 명확한 작업에서는 좋은 결과를, 문서 앞단에서 불필요한 페이지를 걸러 후속 호출을 줄이는 데도 효과를 보였다. 반면 이메일에서는 실제 요청을 확신 있게 제외하는 오류가 관찰됐다. 특정 데이터에 대한 결과이므로 일반화할 수는 없다.
09 · Splitting the Work
판단 · 사실확인 · 생성 · 실행을 나눈다
고객 지원을 예로 들면, 각각의 도구가 서로 다른 일을 맡는다. ‘AI 고객센터를 만들겠다’는 큰 목표가 몇 개의 검증 가능한 업무로 바뀌고, 문제가 생겼을 때 어느 단계에서 발생했는지 찾기 쉬워진다.
01
판단Jev 같은 판단 모델
문장의 의미를 읽어 문의 유형과 명시된 요구사항을 판단한다
02
사실 확인기존 업무 시스템
결제 내역·재고·권한처럼 확정할 수 있는 정보를 정확히 계산한다
03
생성생성형 AI
확인된 사실과 정책을 바탕으로 답변 초안을 작성한다
04
실행정해진 절차·사람
실제 발송·환불처럼 영향이 큰 행동의 권한을 별도로 관리한다
이 구조에서 Jev는 에이전트가 일을 시작하기 전과 결과를 내놓은 뒤에 놓일 수도 있다. 앞에서는 요청을 적절한 모델·담당자로 보내고, 뒤에서는 결과가 정의된 조건을 만족하는지 확인한다. 이런 의미에서 ‘지식 업무용 린터’라는 표현이 이해하기 쉽다. 다만 검사를 통과했다고 결과가 완전히 옳거나 안전한 것은 아니다.
10 · Twelve Ways to Use It
같은 자료에 서로 다른 질문을 던진다
고객 지원부터 교육·커뮤니티·구매·미디어·AI 오피스까지, 판단을 어디에 놓을 수 있는지 열두 가지로 정리했다. 각 카드를 펼치면 준비할 자료, Jev에 물어볼 질문, 다음 행동, 확인할 점을 볼 수 있다.
01고객 지원문의의 담당자 찾기매번 읽고 전달하던 문의를 먼저 분류합니다
준비할 자료
고객 문의와 제품·담당 부서 목록
Jev에 물어볼 질문Choice + Noul
어느 부서에 해당하는가? 여러 이슈가 함께 있는가?
다음 행동
명확한 문의는 담당 대기열로, 애매한 문의는 사람이 검토
확인할 점
오분류와 중요한 문의 누락을 함께 확인
02영업상담할 고객 우선순위구체적인 구매 신호가 있는 문의를 찾습니다
준비할 자료
도입 문의와 적합 고객 기준
Jev에 물어볼 질문Noul + Score
사용 시점·인원·필요 기능이 명시되어 있는가?
다음 행동
도입 검토가 구체적인 문의를 영업 담당자에게 먼저 노출
확인할 점
구매 신호는 실제 계약 성사 확률과 다름
03콘텐츠게시 전 글 점검글마다 같은 편집 기준을 적용합니다
준비할 자료
초안과 브랜드 작성 기준
Jev에 물어볼 질문Noul + Score
근거 없는 단정이 있는가? 같은 내용을 반복하는가?
다음 행동
검토가 필요한 초안을 표시하고 작성자에게 수정 요청
확인할 점
AI 작성 여부를 확정하는 도구로 쓰지 말 것
04마케팅고객 후기에서 문제 찾기많은 후기 속 반복되는 불편을 묶습니다
준비할 자료
후기와 문제 유형 목록
Jev에 물어볼 질문Choice + Noul
가격·배송·사용성 중 무엇을 말하는가? 개선 요구인가?
다음 행동
유형별 후기를 모아 다음 제품·캠페인 회의 자료로
확인할 점
언급 횟수·집계는 시스템이 계산
05교육학습자가 막힌 지점 찾기과제 피드백과 질문을 주제별로 나눕니다
준비할 자료
학습자 질문과 수업 주제·목표
Jev에 물어볼 질문Choice
개념 이해·도구 사용·과제 해석 중 어디에 막혔는가?
다음 행동
같은 어려움을 모아 보충 설명 준비
확인할 점
성적·역량을 이 판단만으로 확정하지 않음
06커뮤니티멤버 요청 연결하기대화에 묻힌 도움 요청과 제안을 찾습니다
준비할 자료
운영 채널 메시지와 요청 유형
Jev에 물어볼 질문Noul + Choice
도움 요청인가? 행사 제안인가? 운영 문의인가?
다음 행동
운영자가 확인할 요청을 모아 담당 역할에 연결
확인할 점
분류만으로 멤버를 평가·제재하지 않음
07총무·구매구매 요청 준비도 확인접수 전에 필요한 정보가 있는지 점검합니다
준비할 자료
구매 요청서와 필수 정보 목록
Jev에 물어볼 질문Noul
목적·사용 대상·필요 시점이 적혀 있는가?
다음 행동
누락 정보를 알려 주거나 담당 검토 대기열로
확인할 점
예산 계산·권한·결재는 기존 시스템이 맡음
08프로젝트회의 후속 업무 표시회의록에서 확인할 약속을 놓치지 않습니다
준비할 자료
회의록 문단과 업무 요청 기준
Jev에 물어볼 질문Noul
실행 약속이 있는가? 담당자가 명시됐는가?
다음 행동
관련 문단을 표시한 뒤 사람이 확인하거나 다른 AI로 업무 초안
확인할 점
Jev가 업무 문장을 새로 작성하는 것은 아님
09리서치읽어 볼 자료 선별조사 범위에 맞는 자료를 먼저 좁힙니다
준비할 자료
문서 제목·요약과 조사 범위
Jev에 물어볼 질문Noul + Score
연구 주제·대상·기간 조건에 관련되는가?
다음 행동
관련 자료를 먼저 읽고 나머지는 표본 검토
확인할 점
중요한 자료를 잘못 제외하는 비율을 측정
10미디어독자와 기사의 접점 찾기독자의 관심사에 맞는 기사 후보를 고릅니다
준비할 자료
기사와 독자의 관심 분야·업무
Jev에 물어볼 질문Noul + Score
독자의 업무와 연결되는 주제가 있는가?
다음 행동
관련 기사를 선별하고 다른 AI가 근거 확인·해설
확인할 점
관심 관련성과 기사 내용의 진실성은 별개
11업무 검색찾은 문서 다시 고르기검색 결과에서 실제 답이 있을 문서를 추립니다
준비할 자료
질문과 검색으로 찾은 후보 문단
Jev에 물어볼 질문Noul + Score
이 문단이 질문에 답하는 데 도움이 되는가?
다음 행동
관련성 높은 문단을 답변 작성 AI에 전달
확인할 점
전체 대신 검색으로 좁힌 후보부터 평가
12AI 오피스에이전트에게 업무 배정요청에 맞는 AI 담당자와 확인 단계를 정합니다
준비할 자료
사용자 요청과 사용 가능한 담당자·기능 목록
Jev에 물어볼 질문Choice + Noul
콘텐츠·운영·고객 지원 중 어디인가? 외부 발송이 필요한가?
다음 행동
담당 에이전트를 고르고 실행 전 확인 절차를 연결
확인할 점
작업 권한·실제 발송은 별도 규칙으로 관리
숫자로 보는 현실
70–500ms
공개 당시 발표한 종단 간 응답 시간
TypeSafe 공개 발표
≈0.8–0.9s
독립 실험에서 측정된 응답 시간 중앙값
독립 실험 · Aman Kumar
$0.042
입력 100만 토큰당 가격 · 출력 무료
공식 모델 문서
출처·측정 조건에 따라 달라질 수 있음(회사 발표 vs 독립 실험 구분). 출력 토큰에 비용을 청구하지 않는다는 정책이 계산 자원이 전혀 들지 않는다는 뜻은 아니다. 모델 단가가 낮다는 것과 최종 업무가 저렴해졌다는 것은 실제 흐름을 연결해 측정해야 알 수 있다.
11 · Attention as a Resource
짧지만 자주 끼어드는 일이 하루를 끊는다
어떤 업무는 처리 시간이 길어서 힘들고, 어떤 업무는 짧지만 자주 끼어들어서 힘들다. 문의 하나를 전달하는 데 1분이 걸렸다 해도, 하던 일을 멈추고 다시 돌아오는 과정까지 1분으로 설명할 수는 없다. 이런 일을 줄이는 가치는 몇 초를 단축했는지뿐 아니라, 사람이 중요한 일을 얼마나 연속해서 할 수 있게 됐는지에서도 찾아야 한다.
솔로프리너에게는 특히 직접적이다. 혼자 일하는 사람은 제품을 만들고 파는 일뿐 아니라 그 주변의 작은 운영 판단까지 하루에 받아들인다. 사업이 커질수록 매출과 함께 자신의 주의도 더 많이 소비되는 구조가 될 수 있다. 반복되는 판단을 업무 시스템에 정리하는 일은 그래서 수익구조와도 연결된다.
나는 내 시간을 계속 투입해야 유지되는 수익과, 일정한 관리 아래 반복적으로 발생하는 수익을 구분한다. 고객이 늘 때마다 창업자의 확인과 결정이 같은 비율로 늘어난다면 어느 순간 다시 시간이 성장을 제한한다. 무엇을 자동으로 처리하고 어떤 문제에만 직접 개입할지 정하면, 혼자 감당할 수 있는 사업의 범위가 달라진다.
물론 도구 하나를 연결했다고 수익구조가 만들어지지는 않는다. 시장이 원하지 않는 제품을 더 효율적으로 운영해도 시장이 생기지는 않는다. 도구가 낮춰 주는 비용과 사업이 해결해야 할 문제를 구분해야 한다. 오히려 운영을 더 적은 비용으로 처리하면 사람에게 무엇이 남는지가 더 분명해진다 — 누구의 문제를 풀지, 어떤 약속을 하고 어디까지 책임질지.
12 · New Skills, Real Limits
분해하고 검증하는 능력, 그리고 아는 한계
앞으로의 AI 교육에서는 프롬프트를 쓰는 법과 함께 업무를 분해하고 결과를 검증하는 법을 다뤄야 한다. AI에게 좋은 답을 받는 경험이 업무를 끝내는 역량으로 이어지려면 이런 과정이 필요하다.
새로 중요해지는 역량
업무를 작은 판단으로 분해하는 능력 — 무엇을 판단할지, 가능한 답은 무엇인지, 그 답이 다음 어떤 행동으로 이어지는지 나눈다.
결과를 검증하는 능력 — 전체 정확도만 보지 않고 자동 처리 범위, 그 구간의 오류, 중요한 누락을 함께 본다.
기준을 옮기는 능력 — 경험 많은 사람의 머릿속 판단을 다른 사람이 이해하고 검토할 수 있는 질문과 기준으로 표현한다.
알아둘 한계
한국어 등 비영어 언어의 정확도가 영어와 동등하지 않을 수 있다. 생략과 맥락 의존 표현이 많은 짧은 한국어 요청은 특히 주의해야 한다.
정확한 계산이나 날짜 비교에 약하고, 불필요한 내용이 많은 긴 입력에서 정확도가 떨어질 수 있다.
보안과 권한은 자연어 판단 하나에 의존해선 안 된다. 실제 접근·실행의 경계는 시스템이 강제해야 한다.
내가 만드는 DoDone 같은 AI 오피스에도 이 관점은 연결된다. 여러 AI 에이전트가 함께 일하는 환경에서는 누가 어떤 요청을 맡고, 어떤 자료를 받으며, 어디에서 확인을 받아야 하는지가 중요하다. 처음부터 하나의 에이전트에게 모든 판단을 맡기기보다 요청의 성격과 필요한 확인을 먼저 나누는 구조를 검토할 수 있다.
‘AI를 잘 활용한다’의
범위가 넓어진다.
필요한 결과물을 빠르게 만드는 능력은 계속 중요하다. 여기에 어떤 판단을 어디에 배치하고, 누구에게 어떤 정보를 전달하며, 어느 지점에서 사람이 개입해야 하는지를 설계하는 능력이 더해질 것이다. 좋은 모델을 선택하는 것과 그 모델이 실제로 일을 끝내도록 만드는 것 사이에는 업무에 대한 이해와 책임이 놓여 있다.