1장 채팅 다음의 인터페이스
챗봇은 답을 제안하지만 컴퓨터 사용 에이전트는 화면을 읽고 행동한다. 성능 차이보다 중요한 변화는 실패의 반경이다. 잘못된 답은 복사하지 않으면 끝나지만 잘못된 클릭은 메일, 예약, 결제, 삭제로 이어진다. 그러므로 목표보다 먼저 권한과 중단 조건을 설계한다.
OpenAI의 현재 활용 안내에는 ChatGPT가 컴퓨터에서 클릭·입력·탐색하는 흐름과 Codex의 장기 작업이 별도 사례로 제시돼 있다. Google은 브라우저 행동 직전에 별도 비평 구성 요소가 사용자 의도와 일치하는지 검사하는 접근을 설명한다. 둘을 합치면 원칙은 간단하다. 모델이 화면을 해석해도 행동 허가는 별도의 정책이 결정한다.
실습 1 위험 동사를 색칠한다
lab/index.html을 열고 ‘컴퓨터 운영’을 선택한다. 공개 페이지 읽기, 임대 문의 보내기, 예약금 결제를 차례로 판정한다. 읽기는 allow, 보내기와 결제는 approve가 나와야 한다. 같은 화면을 보지 못하면 캐시보다 현재 파일 경로를 먼저 확인한다.