AI 에이전트는 어디까지 일을 맡길 수 있을까
도구를 사용하고 결과에 따라 다음 행동을 정하는 AI. 공개 자료 조사라는 작은 사례로 활용 범위와 확인할 지점을 살펴본다.
AI로 제작한 개념 삽화입니다.
답변 다음에 일이 이어질 때
“행사 장소를 알아봐 줘.” 이 부탁을 받은 AI가 장소 목록을 설명할 수도 있고, 웹에서 후보를 찾고 조건을 비교한 뒤 문의 메일 초안까지 만들 수도 있다. 후자의 작업에서는 중간 결과에 따라 다음 행동이 달라진다. 대관 인원이 부족하면 다른 후보를 찾아야 하고, 가격이 공개되지 않았다면 빈칸으로 남기거나 문의가 필요하다고 알려야 한다.
AI 에이전트를 이해할 때 살펴볼 것은 목표를 향해 도구를 쓰면서, 모델이 중간 결과에 따라 다음 행동을 동적으로 정하는 과정이다. 대화창이 있는지는 구분 기준이 아니다. 같은 대화형 서비스 안에도 단순 답변, 정해진 자동화, 에이전트 동작이 함께 들어갈 수 있다.
챗봇·자동화·에이전트를 구분하는 질문
‘에이전트’의 정의는 제품과 연구에 따라 다르다. Anthropic은 정해진 코드 경로를 따르는 워크플로와 모델이 과정·도구 사용을 동적으로 정하는 에이전트를 구분한다. 이 글도 그 구분을 빌려 동작을 설명한다. Building effective agents
| 살펴볼 동작 | 행사 장소 조사에 적용하면 |
|---|---|
| 한 번의 응답 | 제공한 장소 소개문을 요약한다. |
| 정해진 순서의 자동화 | 지정된 목록을 읽고, 같은 항목을 추출해 표로 저장한다. |
| 결과에 따라 진행하는 에이전트 | 조건에 맞는 후보를 찾고, 빠진 항목을 추가로 조사하며, 근거가 부족하면 질문하거나 멈춘다. |
실제 시스템은 이 방식을 섞어 쓴다. ‘자동’이라는 이름이나 연결된 도구 수만으로 어느 방식인지 알 수는 없다.
에이전트가 일을 이어가는 방식
작업은 다음과 같이 구성할 수 있다.
- 목표와 제약을 받는다. 무엇을 완성할지, 어디까지 접근할지 정한다.
- 다음 행동을 고른다. 검색할지, 문서를 읽을지, 질문할지 선택한다.
- 도구를 실행한다. 허용된 검색·파일·업무 시스템을 사용한다.
- 실제 결과를 확인한다. 찾은 자료나 저장된 파일을 기준으로 진행 상황을 판단한다.
- 계속하거나 멈춘다. 부족한 정보를 보완하고 완료·한도 도달·승인 필요 중 해당 상태를 알린다.
이 반복이 항상 성공을 뜻하지는 않는다. 검색을 잘못 시작하거나 도구의 오류를 오해하면 이후 판단도 어긋날 수 있다. Anthropic은 도구의 실행 결과로 진행 상황을 판단하고, 최대 반복 횟수 같은 종료 조건을 두도록 권한다. 에이전트의 실행과 피드백
첫 업무로는 공개 자료 비교를 권한다
처음 맡길 작업으로는 원문을 직접 확인할 수 있는 작은 조사가 적합하다. 다음은 실제 성능 측정 결과가 아닌 활용 설계 예시다.
공개된 행사장 세 곳을 비교해 줘. 각 공식 홈페이지에서 위치, 수용 인원, 공개된 대관료를 찾아 표로 작성해 줘. 항목마다 출처 링크와 확인일을 남겨 줘. 공개되지 않은 금액은 ‘확인 필요’로 적어 줘. 로그인, 예약, 결제, 문의 발송은 하지 말고, 15분 안에 확인한 범위와 남은 질문을 보고해 줘.
이 요청에는 결과물, 출처 범위, 미확인 정보 처리, 행동 범위, 종료 조건이 들어 있다. 사용 도구에 시간 제한 기능이 없다면 운영자가 제한을 걸거나 중간에 중단해야 한다. 문장으로 요청하는 것만으로 시스템 권한이 제한되는 것은 아니다.
첫 실습에는 검색과 읽기에 필요한 권한만 연결한다. 페이지 안에 다른 행동을 요구하는 문장이 있어도 조사 자료로 취급한다.
결과를 받으면 출처 링크가 맞는지 확인하고, 후보 하나를 골라 원문을 항목별로 대조한다. 수용 인원이 원하는 행사 형태의 기준인지, 대관료의 적용 조건이 표에서 빠지지 않았는지 살핀다. 그 한 건에서 문제가 발견되면 나머지 후보도 같은 항목을 다시 확인한다. 실제 의사결정에 쓸 가격과 수용 인원은 모든 후보의 원문을 확인한다.
어떤 일부터 맡기면 좋을까
아래 구분은 시작 범위를 정하기 위한 제안이다. 실제 허용 여부는 자료와 업무의 성격에 맞춰 결정한다.
| 작업 | 처음 정할 범위 | 완료를 확인하는 방법 |
|---|---|---|
| 공개 자료 조사 | 지정한 주제와 공식 출처 | 핵심 항목이 원문과 맞는지 확인 |
| 문서 정리 | 원본을 보존하고 수정 사본 작성 | 빠진 내용과 변경점 비교 |
| 코드 수정 | 작업 브랜치에서 변경안 작성 | 변경 검토와 요청한 검증 결과 확인 |
| 문의·공지 작성 | 수신인과 본문 초안까지 | 사람이 대상·내용을 확인한 뒤 발송 |
실패 비용이 낮고 결과를 비교할 수 있는 일부터 시작하면 맡길 범위를 조정하기 쉽다. 발송·예약·삭제처럼 외부에 영향을 주는 작업은 실행 전에 확인할 지점을 따로 둔다. Google Cloud도 중요한 판단 단계에 사람의 검토를 넣는 설계를 소개한다. Human-in-the-loop 설계
연결보다 먼저 정할 세 가지
첫째, 접근 범위다. 조사에 필요한 자료와 도구만 제공한다. 읽기 권한과 수정·발송 권한을 구분하고, 실행 기록을 남긴다. 확인이 필요한 행동은 실제 도구나 운영 절차에서 멈추도록 설계한다.
둘째, 완료 기준이다. “잘 정리해 줘” 대신 “세 후보를 같은 항목으로 비교하고, 빈칸과 출처를 표시해 줘”처럼 확인 가능한 결과를 요청한다. Anthropic의 도구 설계 안내도 실제 업무에 가까운 평가 과제와 검증 가능한 결과를 권한다. Writing effective tools for agents
셋째, 도입 효과다. 걸린 시간뿐 아니라 사람이 고친 양, 빠진 항목, 잘못된 행동, 실행 비용도 함께 기록한다. 예를 들어 비슷한 조사 다섯 건을 수행해 수작업과 비교하면 다음에 무엇을 바꿀지 정하기 쉽다. 다섯 건은 작은 실습 범위이며 일반적인 신뢰도를 입증하는 표본 수는 아니다.
절차가 일정한 일은 고정된 자동화로 충분할 수 있다. 매번 상황을 해석하고 다음 조치를 바꿔야 하는 부분에 에이전트를 적용하는 편이 도입 효과를 판단하기 쉽다.
내일 맡길 한 가지를 정해 보자
처음에는 원문과 대조할 수 있는 조사와 수정 사본 작성까지 맡기고, 외부 발송이나 예약은 확인 뒤 실행하는 범위로 시작하자. 웹 검색이나 파일 읽기를 지원하는 도구에서 작은 업무 하나를 골라 다음 네 줄을 적어 보자.
- 완성할 것: 어떤 결과물을 받을 것인가?
- 사용할 것: 어떤 자료와 도구에 접근해도 되는가?
- 멈출 때: 언제 질문하고, 언제 종료해야 하는가?
- 확인할 것: 사람이 무엇을 보고 완료를 판단할 것인가?
이 네 줄이 정해지면 AI가 맡을 일과 사람이 확인할 일이 구체적으로 드러난다. 첫 결과를 검토하고 범위를 조금씩 넓히는 것이 이 글에서 권하는 출발점이다.
출처와 글의 범위
- Anthropic — Building effective agents, 2024-12-19 발행, 2026-09-25 확인. 개념 구분과 피드백 구조를 참고했다. 원문에는 이후 도구 환경이 달라졌다는 주석이 있다. 여기서는 특정 SDK 사용법을 다루지 않는다.
- Anthropic — Writing effective tools for agents, 2025-09-11 발행, 2026-09-25 확인. 도구와 검증 가능한 결과의 관계를 참고했다.
- Google Cloud — Choose a design pattern for your agentic AI system, 2026-09-25 확인. 사람의 개입 지점을 둔 설계를 참고했다.
행사장 조사 요청과 업무 분류, 네 줄 작성법은 이 글의 편집 제안이다. 특정 제품의 성능이나 절감률을 측정한 결과가 아니다. AI를 활용해 작성·검토했으며 오류 제보와 내용 보완을 받을 수 있다.
첨부 자료
작성자가 기록한 출처
- Anthropic — Building effective agents · 확인 2026-09-25
- Anthropic — Writing effective tools for agents · 확인 2026-09-25
- Google Cloud — Agentic AI design patterns · 확인 2026-09-25