하이쿠 AI 의 기술 상세 — LLM 의 하이쿠 생성, 그 구조와 한계

현재 (2026년) 의 주요 LLM (Claude Opus 4.7·GPT-4o·Gemini 2.5 Pro) 은 하이쿠를 「그런대로」 만들 수 있다. 하지만 기술적으로 무엇이 일어나고 있는가. Transformer 아키텍처·음수 계산의 곤란·계어 사전과의 연계·훈련 데이터의 편향·프롬프트 엔지니어링·멀티모달 하이쿠·평가 AI — 하이쿠 AI 의 기술적 내실과, 2020년대 후반의 전망을 따라간다. 이 시리즈의 최종회.

haikuaillmtransformerprompt-engineeringtechnical

「하이쿠를 만들 수 있는 AI」 의 기술적 내용

19 기사 「하이쿠 AI 와 생성 모델」 에서는, 생성 AI 가 하이쿠를 만드는 현상과, 그것에 대한 하이단의 반응을 다루었다. 이 기사에서는, 기술적으로 무엇이 일어나고 있는가 를 더 깊이 본다. Transformer 부터 음수 계산, 프롬프트, 멀티모달, 평가 AI 까지.

독자는 하이쿠 애호가이며 AI 연구자가 아니라는 전제로, 기술 용어는 최소한으로, 그러나 정확하게 설명해 간다.

Transformer 와 대규모 언어 모델 (LLM)

현대의 하이쿠 AI 의 토대는, 2017년에 Google 이 발표한 Transformer 라는 신경망 아키텍처. 이하, 그 요점:

1. 토큰화 (Tokenization)

텍스트를 「토큰」 이라 부르는 작은 단위로 분할한다. 일본어의 경우:

  • 1문자 = 1토큰 이 아니다
  • 형태소 해석 에 가까운 분할 (「하이쿠」 = 1토큰, 「후루이케야」 = 2-3토큰, 모델에 따라)
  • 현대의 주요 LLM 의 일본어 토큰화는 정확도가 높다

2. Attention 메커니즘

입력문의 각 단어 (토큰) 가, 다른 모든 단어와의 관계 를 계산한다. 이로써 문맥을 포착한다. 하이쿠의 경우:

  • 「후루이케야」 의 「야」 가 끊는 말인 것을, 전후의 관계에서 「이해」 한다
  • 「사쿠라」 가 계어인 것을, 훈련 데이터에서 통계적으로 「인식」 한다

3. 대규모화

2022년 이후의 LLM (GPT-4·Claude 3·Gemini) 은 수백억-수조 파라미터 의 스케일. 이로써, 일본어·영어·하이쿠와 같은 특수한 문체를 포함한 방대한 언어 패턴 을 흡수하고 있다.

4. 생성

입력 프롬프트에 대해, 다음에 올 토큰을 확률적으로 예측 하기를 계속함으로써, 문장을 생성한다. 하이쿠의 경우, 「가을의 하이쿠를 5-7-5 로 만들어」 → LLM 은 「가을 → 바람 → 야 → 낙엽 → 노 → 소리 → 노 → …」 라고 잇달아 토큰을 예측.

음수 계산의 곤란

「5-7-5 의 음수를 지킨다」 는 것은, 표면적으로는 간단해 보이지만, LLM 에게는 의외로 어렵다. 이유:

1. 토큰 ≠ 음수

LLM 의 토큰은 형태소·문자의 단편. 「도쿄」 는 1토큰 (음수 4), 「요음 (きゃ·きゅ)」 은 1-2토큰이지만 음수 1, 「촉음 (っ)」 「장음 (ー)」 은 1음으로 카운트. 이 어긋남을 LLM 은 서투르다.

2. 음수 계산의 학습

LLM 은 「음수 계산」 을 명시적으로 학습하지 않는다. 훈련 데이터에서 「5-7-5 의 하이쿠란 이런 길이의 것」 을 통계적으로 추측 하고 있다. 이로써 대부분은 성공하지만, 드물게 실패한다.

3. 예

LLM 에게 「10 구, 5-7-5 의 가을의 하이쿠를 만들어」 라고 의뢰하면:

  • 8-9 구는 5-7-5 를 지킨다
  • 1-2 구는 음수가 어긋난다 (4-7-5 나 5-8-5)
  • 음수의 어긋남을 LLM 자신은 알아채지 못한다

4. 음수 체크의 외부화

현대의 프로 하이쿠 AI 도구는, LLM 의 생성 + 외부의 음수 체커 의 2단계로 운용한다. 「생성 → 체크 → 음수가 다르면 재생성」 의 루프.

계어 사전과의 연계

하이쿠에는 계어 가 필요. LLM 은 훈련 데이터에서 5,000어의 계어 를 거의 암기하고 있다:

1. 계어의 인식

LLM 에게 「벚꽃은 무엇의 계어?」 라고 물으면 「봄의 계어」 라고 정답할 수 있다. 「꽁치」 「여름의 달」 「눈」 도 마찬가지.

2. 계 겹침의 검출

하지만 LLM 은 계 겹침을 검출하는 것은 서투르다. 「벚꽃과 개구리 양쪽이 들어간 하이쿠」 를 의뢰하면, 「이는 계 겹침」 이라고 경고 없이 생성하는 경우가 많다.

3. 방제·현대 계어

현대의 외래어 (크리스마스·밸런타인·할로윈) 는, LLM 이 이것을 계어로서 인식할지 여부는, 모델 따라. 훈련 데이터에 포함되는 사이지키의 버전에 의존.

4. 외부 계어 API 와의 연계

프로 하이쿠 AI 시스템은, LLM + 계어 사전 API 의 연계로 운용. 생성된 하이쿠의 계어를 사전 조회하여, 「이는 봄의 계어」 「계 겹침 있음」 이라고 판정.

훈련 데이터의 편향

LLM 의 훈련 데이터에는, 하이쿠에 관한 중요한 편향이 있다:

1. 바쇼·교시·시키에의 집중

훈련 데이터에는, 교과서에 실리는 유명 구 가 과잉으로 포함된다. 「후루이케야」 「나쓰쿠사야」 「가키 쿠에바」 는 방대한 텍스트에서 등장한다. 이 때문에 LLM 은:

  • 이들 유명 구를 그대로 출력하는 경우가 있다 (표절 취급이 될 수 있다)
  • 이들 스타일에 강하게 이끌린다

2. 현대 하이쿠의 희박함

가네코 도타·기시모토 나오키·고노 사키의 작품은, 훈련 데이터에 포함되지만 바쇼만큼 대량은 아니다. 이 때문에 LLM 은 현대 하이쿠의 스타일을 재현하는 것은 서투르다.

3. 지방 하이쿠·여성 하이쿠의 결락

에도기의 여성 하이진 (지요조·스테조), 지방 하이쿠 (마쓰에·시나노) 는, 훈련 데이터에서의 노출이 적다. 이 때문에 LLM 은 이러한 전통을 바르게 재현할 수 없다.

4. 훈련 데이터의 시대성

LLM 의 훈련 데이터의 컷오프 (최신의 정보의 시점) 는, 모델마다 다르다. 2024년 이후의 새로운 하이쿠 (고노 사키의 최신 구 등) 는 반영되지 않는 경우가 있다.

프롬프트 엔지니어링

하이쿠 AI 를 사용할 때, 프롬프트 (지시문) 의 쓰는 법 으로 출력 품질이 크게 바뀐다. 실천적인 요령:

나쁜 프롬프트

하이쿠를 만들어

이래서는 LLM 이 무엇을 어떻게 만들지 알 수 없어, 범용의 하이쿠가 출력된다.

좋은 프롬프트

가을의 저녁, 강가에서 혼자 있는 정경을, 5-7-5 의 하이쿠로 해주세요. 계어는 「아키노 쿠레」 또는 「유야케」. 끊는 말은 「야」 나 「가나」 를 써 주세요. 바쇼풍의 조용한 서정을 지향해 주세요.

이와 같이 소재·음수·계어·끊는 말·스타일 을 구체적으로 지정하면, 정밀도가 오른다.

더 고도한 프롬프트

당신은 바쇼의 제자로서 하이카이를 수행하고 있습니다. 「오쿠노 호소미치」 의 한 절을 읽고, 그 후에 이어지는 새로운 구를 1개 만들어 주세요. 음수 5-7-5, 계어는 「가을」 계, 끊는 말 「야」 를 상 5에. 바쇼의 「유겐」 과 「가루미」 의 미학을 의식해 주세요.

이와 같이 페르소나 (역할) + 구체적인 문맥 + 제약 + 미학 을 조합하면, LLM 이 고도한 모방을 시도한다.

반복과 선택

실무에서는, 1회로 완벽한 하이쿠를 얻는 것은 드물다. 20-50 구를 생성시키고, 인간이 선택하는 (큐레이션) 것이 현실적. 이는 「AI 와 공작」 의 한 형태.

현대의 주요 LLM 의 하이쿠 생성 능력

2026년 시점의 주요 LLM 의 하이쿠 능력 (필자의 실측이 아니라, 일반적인 관찰에 기초):

Claude Opus 4.7 (Anthropic)

  • 음수: 거의 확실히 5-7-5 를 지킨다
  • 계어: 적절히 선택
  • 끊는 말: 적절히 배치, 이중 끊는 말은 드물다
  • 문화적 깊이: 중정도에서 높음, 바쇼·교시풍의 서정을 재현
  • 오리지널리티: 중정도, 훈련 데이터의 범위 내

GPT-4o / GPT-5 (OpenAI)

  • 음수: 높은 확률로 지킨다
  • 계어: 적절, 현대 계어 (크리스마스 등) 도 대응
  • 끊는 말: 적절, 때때로 이중 끊는 말
  • 문화적 깊이: 중정도
  • 오리지널리티: 중정도

Gemini 2.5 Pro (Google)

  • 음수: 지키지만, 드물게 어긋난다
  • 계어: 대응, 현대 계어도
  • 끊는 말: 대응
  • 문화적 깊이: 중정도
  • 멀티모달: 이미지 입력으로 하이쿠 생성이 가능 (Gemini 의 특징)

DeepL Write / 일본어 특화 모델

  • 일본어의 음수 계산: 영어권 LLM 보다 정확
  • 계어: 상세
  • 번역과의 연계: 영일 번역과 조합하기 쉽다

결론: 주요 LLM 3사의 하이쿠 능력은 2026년 시점에서 거의 팽팽. 차이는 미세하고, 용도에 따라 선택하는 단계.

멀티모달 하이쿠 — 이미지에서 하이쿠

멀티모달 LLM (GPT-4o, Claude Opus 4.7, Gemini 2.5 Pro) 은, 이미지를 입력으로 하이쿠를 생성 할 수 있다. 예:

실례

이미지 입력: 가을의 교토, 긴카쿠지의 단풍 사진

프롬프트: 「이 이미지를 하이쿠로 해 주세요」

출력 예:

銀閣や 苔むす庭の 秋深し (긴카쿠야 코케무스 니와노 아키후카시)

특징:

  • 이미지에서 구체적인 대상 (긴카쿠·정원·가을) 을 추출
  • 계감 (아키후카시) 을 선택
  • 끊는 말 「야」 를 배치

응용

  • 관광지의 하이쿠 AR 앱 — 경치를 사진으로 찍으면, AI 가 하이쿠를 돌려준다
  • 사진 하이쿠의 지원 — 아마추어가 사진에 구를 곁들일 때, AI 가 초안을 제시
  • 국제 교류 — 외국인 관광객이 이미지에서 하이쿠를 만들 수 있다

현재의 한계

  • 이미지의 세부의 놓침 (그림자·빛의 질감 등)
  • 계절의 판정 의 오류 (상록수만 찍힌 사진에서는 계절 불명)
  • 문화적 컨텍스트 의 결락 (이 절의 역사적 의미 등)

평가 AI — 하이쿠의 좋고 나쁨을 판정하는 AI

생성 AI 와는 별도로, 하이쿠의 질을 평가하는 AI 의 연구가 진행되고 있다:

1. 통계적 평가

  • 음수의 정확성
  • 계어의 유무·겹침
  • 끊는 말의 적절성
  • 이들은 자동 판정 가능

2. 시정의 평가

「이 구는 시로서 뛰어난가」 라는 주관적인 평가. 이것은 AI 에게는 아직 어렵다:

  • 전문 하이진의 선구 데이터 를 훈련 데이터로 쓰는 시도
  • 종합 하이지의 게재/미게재 를 라벨로 한 이진 분류
  • 현재의 정밀도는 60-70%, 인간의 합의율 (80-90%) 에는 미치지 못한다

3. 응용

  • 하이쿠 고시엔의 예선 에 평가 AI 를 사용 (시험 단계)
  • 종합 하이지의 투구란 에서 AI 가 사전 필터링
  • 교육 현장 에서, 학생의 하이쿠에의 평가 피드백

4. 장래

생성 AI + 평가 AI 의 조합 으로, 질 높은 하이쿠의 대량 생성 이 가능하게 된다. 이는 하이쿠 창작의 성질 자체를 바꿀 가능성이 있다.

AI 하이쿠의 저작권과 창작성

현재, 세계의 저작권법은 AI 생성물의 저작권 에 대해 명확한 결론을 내지 않는다. 미국·일본·EU 에서 논의 중.

쟁점

  1. AI 가 단독으로 생성한 하이쿠 — 저작권은 성립하는가, 성립한다면 누구의 권리인가
  2. 인간이 AI 와 공작한 하이쿠 — 인간의 창작성의 비율이 문제
  3. 기존의 명구를 훈련 데이터로 한 AI — 권리자에의 환원은 필요한가

하이쿠계의 현상

  • 하이쿠 고시엔: 고교생이 AI 생성구를 제출하는 것은 금지
  • 종합 하이지: AI 생성구는 원칙 미게재, 하지만 판정은 어렵다
  • 주재지: 주재의 판단 따라, 통일되어 있지 않다
  • SNS: AI 생성구를 명시하면 투고 가, 이 일반적인 합의

2020년대 후반의 전망

이 시리즈를 쓰고 있는 2026년 시점에서, 하이쿠 AI 는 아직 발전 도상. 2020년대 후반 (2027-2030) 의 예측:

1. 퍼스널라이즈드 하이쿠 AI

개개 사용자의 과거의 투고·흥미·생활 패턴을 학습하여, 그 사람의 「~다움」 에 맞춘 하이쿠 를 제안하는 AI. SNS 플랫폼과 결합.

2. 멀티모달의 심화

이미지·음성·동영상에서 하이쿠를 생성하는 능력이 향상. 관광지의 QR 코드 를 읽으면, 그 장소의 정경에 맞춘 하이쿠가 돌아온다, 는 응용.

3. 실시간 구회 AI

온라인 구회의 장에 AI 가 참가자로서 가담하고, 실시간으로 구를 낸다·선택한다는 기능. 「AI 와 인간의 믹스 구회」 가 시험적으로 이루어질 가능성.

4. 교육에서의 본격 도입

중학·고교의 국어 수업에서, 하이쿠 AI 가 표준적인 교재가 된다. 학생이 AI 와 대화하면서 하이쿠를 배운다.

5. 국제 하이쿠 지원

다언어 AI 가, 일본어 하이쿠를 영어·프랑스어·한국어로 번역하면서, 세계 하이진의 대화를 지원. 세계 하이쿠 커뮤니티 의 인프라로서 기능.

「AI 와 하이쿠」 의 본질적인 물음

기술이 얼마나 진행되어도, 남는 본질적인 물음:

1. 「하이쿠를 만드는 주체」 는 누구인가

프롬프트를 입력하는 인간인가, 생성하는 AI 인가, 훈련 데이터를 제공한 과거의 하이진들인가. 창작성의 소재 의 물음.

2. 「하이쿠의 예술적 가치」 는 누가 결정하는가

AI 가 생성한 「기술적으로 완벽한」 하이쿠와, 인간이 생활 속에서 만든 「서투르지만 진실한」 하이쿠. 어느 쪽이 「진정한 하이쿠」 인가.

3. 「하이쿠를 읽는」 다는 영위

AI 생성구를 읽고 감동하는 것은 가능한가. 감동이 생길 때, 그것은 AI 의 교묘함에의 감탄인가, 아니면 인간의 시정에의 공감인가.

4. 400년의 전통과의 관계

바쇼·부손·잇사·교시·도타가 쌓아 온 하이쿠의 전통에, AI 하이쿠는 어떻게 자리매김되는가. 21세기의 하나의 새로운 유파 인가, 아니면 다른 시형 인가.

이러한 물음은, 이 시리즈의 33 기사를 통해 시사되어 왔지만, 명확한 답은 없다. 21세기의 하이쿠인·하이쿠 애호가·기술자가, 앞으로 30-70년에 걸쳐 생각하고, 실천하고, 답해 갈 물음.

이 시리즈의 완결

하이쿠 400년사 시리즈, 이것으로 33 기사 + overview = 34 콘텐츠 를 다 썼다. 데이토쿠의 데이몬 하이카이 (17세기 전반) 부터, 현대의 생성 AI (2020년대) 까지의 400년을, 주요한 인물·작품·기법·사상·지역·국제화·기술이라는 다면에서 따라왔다.

「왜 400년, 17음은 살아 계속하고 있는가」 — 이 물음에의 부분적인 답:

  1. 17음의 극단적인 짧음 이, 반대로 읽는 이의 상상력의 여지 를 최대화한다
  2. 5,000어의 계어 시스템 이, 짧음을 정보 밀도 로 보완한다
  3. 「야」 「가나」 「케리」 의 끊는 말 이, 17음에 구조의 골격 을 준다
  4. 각 시대의 하이진의 도전 이, 현대의 소재를 17음에 접어 넣는 궁리를 쌓아 왔다
  5. 주재지·구회·하이쿠 고시엔·SNS 등, 계승의 구조가 다층적으로 마련되어 있다
  6. 국제화와 AI 라는 새로운 변수 속에서, 여전히 새로운 구가 계속 태어나고 있다

400년 전의 마쓰나가 데이토쿠, 바쇼, 잇사, 시키, 교시, 산토카, 도타 — 이 400년간의 하이진의 집합적인 업적 속에서, 21세기의 하이진들은 새로운 17음을 계속 만든다. 그리고, 22세기의 하이진들도, 분명 같은 5-7-5 의 프레임으로, 그 시대의 생을 새길 것이다.

마지막으로, 바쇼의 말로

바쇼가 만년에 말했다고 전해지는 말:

「후에키 류코 (不易流行)」

변하지 않는 것 (17음·계어·끊는 말) 과, 계속 변하는 것 (시대의 소재·생활의 실감) 의 양쪽 이, 하이쿠를 하이쿠답게 한다. 400년 전의 바쇼의 이 말은, 생성 AI 가 하이쿠를 만드는 2026년의 우리에게도, 여전히 유효한 지침.

이 시리즈가, 독자에게 하이쿠의 우주에의 하나의 입구가 된다면 다행. 바쇼·부손·잇사·시키·교시·산토카·호사이·도타, 그리고 현대의 고노 사키·이와타 케이 등, 400년의 하이진들의 구를, 앞으로도 계속 읽어 주세요.

그리고, 만약 당신 자신이 5-7-5 를 만들고 싶어진다면, 그것은 400년의 전통에의 하나의 새로운 참가. 그 구가 아무리 서투르더라도, 데이토쿠에서 도타까지의 하이진들이 쌓아 온 17음의 프레임은, 당신의 구를 기다리고 있다.

← Back to 하이쿠 400년사