홍보팀에는 하루 두 번 돌아오는 일이 있다. 오전과 오후, 그날의 주요뉴스를 골라 PDF 한 부로 묶는 일이다. 당번이 돌아가며 맡고, 완성본은 경영진에게 올라간다.

기자로 일할 때 나는 스크랩을 당하는 쪽이었다. 내 기사가 어느 회사 아침 보고서에 들어갔는지 알 길은 없었지만, 들어갔으면 좋겠다고 생각하며 쓴 날은 있었다. 자리를 옮기고 나서는 고르는 쪽이 됐다. 그렇게 2월 중순부터 7월 초까지 쌓인 파일이 246개였다. 86영업일, 기사 항목으로는 2,645건.

어느 날 이게 아까웠다. 매일 만들고, 한 번 읽히고, 폴더에 묻힌다. 이걸 한꺼번에 다시 읽으면 뭐가 보일까. 7월 초 하루를 통째로 비워서 AI와 같이 뜯어봤다.

목차는 글자였고 본문은 사진이었다

처음 막힌 건 파일 형식이었다. 스크랩 PDF는 표지, 목차, 본문 순서인데 목차 페이지만 텍스트이고 본문은 전부 스캔 이미지다. 지면을 오려 붙이는 방식이니 당연한 일이다.

다행히 목차에 필요한 게 거의 다 있었다. 날짜, 오전·오후 구분, 기사 제목, 언론사. 여기까지는 OCR 없이 바로 뽑혔다. 문제는 기자 이름과 본문이었다. 누가 썼는지, 기사 안에 경쟁사가 몇 번 나오는지는 사진 속 글자를 읽어야 알 수 있다.

그래서 본문 전체를 OCR로 돌렸다. 한국어 인식 엔진을 여섯 갈래로 나눠 돌렸는데도 30분쯤 걸렸다. 바이라인 인식률은 85% 정도 나왔다. 나쁘지 않은 숫자지만, 재미있는 오류가 섞여 있었다. 'GS'가 '68'로 읽히는 식이다. 라틴 문자 두 글자는 기계 눈에 숫자와 구분이 잘 안 됐다. 결국 회사 이름은 '칼텍스'처럼 한글로 된 부분으로 찾아야 했다.

제목만 볼 때와 본문까지 볼 때의 차이도 컸다. 경쟁사 이름이 제목에 나오는 경우는 본문에 나오는 경우의 5분의 1 정도였다. 제목만 세면 경쟁사가 거의 안 보이는데, 실제로는 기사 곳곳에 있었다. 기자 시절에 제목을 뽑으며 회사명을 빼던 기억이 났다. 독자가 모르는 회사 이름은 제목에서 먼저 빠진다.

당번마다 보는 뉴스가 달랐다

제일 궁금했던 건 사실 이거였다. 당번이 매일 바뀌는데, 사람에 따라 고르는 기사가 달라지나.

달랐다. 당번표를 날짜별로 붙여서 비교해보니, 어떤 사람이 맡은 날은 유가 기사 비중이 평균보다 3%포인트 넘게 높았고, 다른 사람 날에는 정부 정책 기사가 더 많았다. 국제정세를 덜 고르는 사람도 있었다. 대단한 편향이라고 할 정도는 아니다. 다만 누가 골랐는지가 숫자로 드러날 만큼은 달랐다.

이걸 나쁘다고 보기는 어렵다. 스크랩은 원래 판단의 산물이고, 판단에는 그 사람이 평소 무엇을 중요하게 보는지가 묻어난다. 다만 경영진은 매일 같은 기준으로 고른 뉴스를 받는다고 생각할 것이다. 그 사이의 간극은 알고 있어야 했다. 이 결과를 놓고 팀에서 공통 체크리스트를 만들자는 이야기를 했고, 초안은 나왔지만 아직 확정하지는 못했다.

넉 달 내내 유가였다

주제로 나눠보면 답은 싱거웠다. 유가·에너지 수급 기사가 전체의 3분의 1이었다. 국제정세가 23%, 정부 정책이 11%로 뒤를 이었다. 이란과 호르무즈 해협 문제가 20주 가까이 이어졌으니 그럴 만했다.

흐름으로 보면 조금 더 읽히는 게 있었다. 석유화학 기사는 2월에 10% 남짓이었다가 4월에 18% 가까이 올랐고, 7월 들어 다시 내려갔다. 중동 사태가 원료 쪽 걱정으로 번졌다가 가라앉는 모양이 그대로 그려졌다. 정책 기사는 4월에 가장 많았는데, 새 정책 이슈가 나오면 대개 일주일 안에 기사량이 정점을 찍고 빠졌다. 홍보 담당자 입장에서는 대응할 시간이 생각보다 짧다는 뜻이다.

회사 이름이 직접 나온 기사도 따로 추려서 하나하나 읽었다. 대부분 우호적이었다. 그런데 뭐가 가장 많이 나왔는지 보니 본업 이야기가 아니라 스포츠단 기사였다. 좋은 기사가 많다는 것과 우리가 하고 싶은 이야기가 나가고 있다는 건 다른 문제였다. 좀 뜨끔했다.

AI가 한 일, 내가 한 일

하루 만에 끝낼 수 있었던 건 AI 덕분이다. 목차 파싱, OCR, 태깅, 집계, 대시보드 제작까지 스크립트 열 개 정도가 나왔고, 새 달 파일이 들어오면 순서대로 다시 돌리면 된다. 예전 같으면 인턴 한 명이 몇 주 붙어야 했을 일이다.

그래도 사람이 해야 하는 부분이 분명히 있었다. 기사 톤을 우호·중립·비판으로 나누는 건 자동화하지 않았다. 60여 건을 본문까지 읽고 하나씩 판정했다. 제목은 중립인데 마지막 문단에 뼈가 있는 기사가 있고, 비판처럼 보이는데 사실 업계 전체를 두둔하는 기사도 있다. 이건 키워드로는 안 잡힌다.

용어도 하나 바꿨다. 분석 초안에 특정 표현이 카테고리 이름으로 붙어 있었는데, 보고서 문장에서는 쓰지 않기로 하고 다른 말로 통일했다. 기사 원문 인용은 그대로 두되 우리 말로 쓰는 부분은 우리가 고른다. 사소해 보여도 이런 게 보고서의 태도를 정한다.

기자별·매체별로 더 세밀하게 본 결과도 있다. 그건 팀 안에서만 쓴다. 어떤 기자가 우리에게 우호적인지 표로 만들 수는 있어도, 그걸 밖에 내놓는 순간 그 표는 전혀 다른 물건이 된다.

쌓아둔 것을 다시 쓰는 법

마지막으로 월별 목차와 분석 결과를 NotebookLM에 넣어뒀다. 팀원들이 "4월에 유류세 기사 어느 매체가 제일 많이 썼지" 같은 걸 물으면 출처와 함께 답이 나온다. 스크랩이 보고서에서 끝나지 않고 검색 가능한 기록이 된 셈이다.

해보고 나서 생각이 조금 바뀌었다. 나는 스크랩을 세상에서 무슨 일이 있었는지 정리하는 일로 여겼다. 다시 읽어보니 그보다는 우리 팀이 넉 달 동안 무엇을 걱정했는지가 더 잘 보였다. 매일 고른 기사는 결국 그날 우리가 가장 신경 쓴 기사다.

← 전체 글 보기