WEBBOOK CHAPTER

ChatGPT 업무 자동화: 3장 화면을 읽는 세 가지 방법

3장 화면을 읽는 세 가지 방법

DOM은 구조화돼 빠르지만 실제 픽셀과 다를 수 있다. 스크린샷은 사람이 보는 모습과 가깝지만 좌표와 해상도 변화에 약하다. 접근성 트리는 역할과 이름이 분명하지만 모든 앱이 잘 제공하지 않는다. 하나만 고집하지 말고 DOM 역할 → 텍스트 → 제한된 시각 추론 순으로 폴백한다.

셀렉터는 .blue-button:nth-child(3)보다 button[name="임대 문의"]처럼 의미를 담아야 한다. 행동 전에는 대상 이름과 주변 문맥을 로그에 남긴다. 화면이 바뀌면 추측해서 클릭하지 말고 다시 관찰한다.

실습 3 관찰과 행동을 분리한다

종이에 observe → propose → authorize → act → verify를 적는다. 문의 버튼을 찾은 결과는 propose일 뿐 클릭 성공이 아니다. 버튼이 두 개라면 ambiguous-target으로 멈추는 규칙을 추가한다.