<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom"><channel><title>개인 |</title><link>https://inhyuk2000.github.io/tags/%EA%B0%9C%EC%9D%B8/</link><atom:link href="https://inhyuk2000.github.io/tags/%EA%B0%9C%EC%9D%B8/index.xml" rel="self" type="application/rss+xml"/><description>개인</description><generator>HugoBlox Kit (https://hugoblox.com)</generator><language>en-us</language><lastBuildDate>Tue, 04 Aug 2026 00:00:00 +0900</lastBuildDate><image><url>https://inhyuk2000.github.io/media/icon_hu_eee4a95885829ab2.png</url><title>개인</title><link>https://inhyuk2000.github.io/tags/%EA%B0%9C%EC%9D%B8/</link></image><item><title>NotiLLM : LLM 기반 자연어 알림 전송 제어</title><link>https://inhyuk2000.github.io/projects/notillm/</link><pubDate>Tue, 04 Aug 2026 00:00:00 +0900</pubDate><guid>https://inhyuk2000.github.io/projects/notillm/</guid><description>
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-orange-100 dark:bg-orange-900 border-orange-500"
data-callout="warning"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-orange-600 dark:text-orange-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="M12 9v3.75m-9.303 3.376c-.866 1.5.217 3.374 1.948 3.374h14.71c1.73 0 2.813-1.874 1.948-3.374L13.949 3.378c-.866-1.5-3.032-1.5-3.898 0zM12 15.75h.007v.008H12z"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;해당 서비스는 연구실의 아이디어를 기반으로 서비스화한 것으로, 관련 저작권은 연구실에 있습니다.&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-purple-100 dark:bg-purple-900 border-purple-500"
data-callout="important"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-purple-600 dark:text-purple-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="M12 9v3.75m9-.75a9 9 0 1 1-18 0a9 9 0 0 1 18 0m-9 3.75h.008v.008H12z"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;정리예정 진행중입니다.&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;h3 id="요약"&gt;요약&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;프로젝트 이름&lt;/strong&gt;: NotiLLM&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;프로젝트 기간&lt;/strong&gt;: 2026.07 ~ (진행중)&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;프로젝트 설명&lt;/strong&gt;: LLM Agent를 실서비스로 배포하고, 수집된 사용자 데이터를 기반으로 데이터 분석&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;프로젝트 목적&lt;/strong&gt;: 수집된 데이터를 분석해 추가 아이디어 확장&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="problem"&gt;Problem&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;기존 수동제어 기반 방식은 사용자의 직접 설정을 필요로 하므로, &lt;strong&gt;사용자 부담이 증가&lt;/strong&gt;하고 사용성이 떨어집니다.&lt;/li&gt;
&lt;li&gt;반대로 ML 기반 알림 수신 타이밍 예측 방식들은 정확성을 높이기 위한 연구들이 많이 진행되고 있지만, 근본적으로 사용자의 비언어적 신호를 기반으로 하기에 &lt;strong&gt;예측이 부정확&lt;/strong&gt;합니다.&lt;/li&gt;
&lt;li&gt;따라서 본 연구는 수동 제어 방식의 불편함과 모델 기반 방식의 부정확성을 둘 다 잡고 해결하기 위해, &lt;strong&gt;LLM 기반 사용자 제어&lt;/strong&gt;를 진행합니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;div class="callout flex px-4 py-3 mb-6 rounded-md border-l-4 bg-blue-100 dark:bg-blue-900 border-blue-500"
data-callout="note"
data-callout-metadata=""&gt;
&lt;span class="callout-icon pr-3 pt-1 text-blue-600 dark:text-blue-300"&gt;
&lt;svg height="24" xmlns="http://www.w3.org/2000/svg" viewBox="0 0 24 24"&gt;&lt;path fill="none" stroke="currentColor" stroke-linecap="round" stroke-linejoin="round" stroke-width="1.5" d="m16.862 4.487l1.687-1.688a1.875 1.875 0 1 1 2.652 2.652L6.832 19.82a4.5 4.5 0 0 1-1.897 1.13l-2.685.8l.8-2.685a4.5 4.5 0 0 1 1.13-1.897zm0 0L19.5 7.125"/&gt;&lt;/svg&gt;
&lt;/span&gt;
&lt;div class="callout-content dark:text-neutral-300"&gt;
&lt;div class="callout-title font-semibold mb-1"&gt;본 서비스는 연구실의 아이디어를 실제 서비스로 확장하고, 배포 및 운영 경험을 바탕으로 후속 연구 및 서비스 고도화를 진행하기 위한 목적으로 개발되었습니다.&lt;/div&gt;
&lt;div class="callout-body"&gt;&lt;/div&gt;
&lt;/div&gt;
&lt;/div&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Architecture"
srcset="https://inhyuk2000.github.io/projects/notillm/img/chat-screen_hu_c521ae42cf5fbdb9.webp 320w, https://inhyuk2000.github.io/projects/notillm/img/chat-screen_hu_41301439f970b9a2.webp 480w, https://inhyuk2000.github.io/projects/notillm/img/chat-screen_hu_8af69f2d87435f76.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://inhyuk2000.github.io/projects/notillm/img/chat-screen_hu_c521ae42cf5fbdb9.webp"
width="760"
height="648"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;h3 id="서비스-디자인"&gt;서비스 디자인&lt;/h3&gt;
&lt;p&gt;Figma를 활용해 실제 서비스에 가까운 수준으로 UI/UX를 디자인했습니다. 화면을 구성할 때는 사용성을 고려해 버튼과 텍스트의 배치를 설계하고, 사용자에게 어떤 정보를 효과적으로 제공할지 중점적으로 고민했습니다. &lt;span class="high-mark"&gt;&lt;strong&gt;[1] 특히 알림 피로가 얼마나 줄어들었는지 사용자가 직접 확인할 수 있도록 차단된 알림의 실시간 통계 기능을 추가&lt;/strong&gt;&lt;/span&gt;
했습니다. 또한 필요한 경우 &lt;span class="high-mark"&gt;&lt;strong&gt;[2] 모든 알림을 한 번에 확인할 수 있는 버튼을 제공&lt;/strong&gt;&lt;/span&gt;
하고, 홈 화면 하단에서는 &lt;span class="high-mark"&gt;&lt;strong&gt;[3] 수신된 알림을 앱별로 요약&lt;/strong&gt;&lt;/span&gt;
해 확인할 수 있도록 구성했습니다.&lt;/p&gt;
&lt;h3 id="시스템-설계-확장"&gt;시스템 설계 확장&lt;/h3&gt;
&lt;p&gt;Function Calling을 통해 사용자의 자연어를 JSON 구조로 변환할 때는 기본 동작을 &amp;ldquo;알림을 허용(받아줘 Default)&amp;ldquo;으로 할지, &amp;ldquo;알림을 차단(받지마 Default)&amp;ldquo;으로 할지 설계 방향을 결정해야 했습니다. &lt;strong&gt;연구를 진행하면서 한 가지 방식만 적용할 경우 예상하지 못한 반례가 발생한다는 점을 확인&lt;/strong&gt;했습니다. 이를 해결하기 위해 두 가지 기본 동작을 모두 지원하도록 Function Calling을 설계하여 다양한 명령을 유연하게 처리할 수 있도록 확장했습니다. 그 결과 &lt;span class="high-mark"&gt;&lt;strong&gt;기존에는 처리하기 어려웠던 &amp;ldquo;매일&amp;rdquo;, &amp;ldquo;평일만&amp;rdquo;, &amp;ldquo;주말만&amp;quot;과 같은 반복 · 주기성 명령까지 안정적으로 지원&lt;/strong&gt;&lt;/span&gt;
할 수 있었습니다.&lt;/p&gt;
&lt;h3 id="느낀점"&gt;느낀점&lt;/h3&gt;
&lt;p&gt;테스트를 진행하며 다양한 사용자층을 확보하는 것이 중요하다는 점을 느꼈습니다. 현재는 테스트 사용자가 가까운 지인들로 한정되어 있어 충분히 의미 있는 인사이트를 도출하지는 못했지만, &lt;span class="high-mark"&gt;&lt;strong&gt;연령대에 따라 사용하는 표현과 언어 습관에 차이가 있다는 점을 확인&lt;/strong&gt;&lt;/span&gt;
할 수 있었습니다. 이를 통해 Function Calling 프롬프트를 제 언어 습관과 표현 방식을 중심으로 설계했다는 한계를 깨달았으며, 향후에는 다양한 사용자 표현을 수집하고 반영해 자연어 명령에 대한 처리 범위를 확장해야 한다고 판단했습니다.&lt;/p&gt;
&lt;hr&gt;
&lt;p&gt;Questions? Leave a comment below or reach out on
!&lt;/p&gt;</description></item><item><title>멀티 모델을 활용한 RAG Generation 단계 환각 탐지</title><link>https://inhyuk2000.github.io/projects/a-multi-llm-cross-verification-framework-for-attribution-hallucination-detection-in-rag-generation/</link><pubDate>Tue, 15 Jul 2025 00:00:00 +0900</pubDate><guid>https://inhyuk2000.github.io/projects/a-multi-llm-cross-verification-framework-for-attribution-hallucination-detection-in-rag-generation/</guid><description>&lt;h4 id="-paper"&gt;📄 Paper&lt;/h4&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;멀티 모델을 활용한 RAG Generation 단계 환각 탐지&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;📑
&lt;/p&gt;
&lt;h4 id="-ppt"&gt;🖼️ PPT&lt;/h4&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;&lt;strong&gt;Graduation Project PPT&lt;/strong&gt;&lt;/p&gt;
&lt;/blockquote&gt;
&lt;p&gt;📄
&lt;/p&gt;
&lt;h3 id="요약"&gt;요약&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;프로젝트 이름&lt;/strong&gt;: 멀티 모델을 활용한 RAG Generation 단계 환각 탐지&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;영문 제목&lt;/strong&gt;: A Multi-LLM Cross-Verification Framework for Attribution Hallucination Detection in RAG Generation&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;프로젝트 기간&lt;/strong&gt;: 2025.03 ~ 2025.07&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;프로젝트 설명&lt;/strong&gt;: 동일한 RAG 검색 문서를 기반으로 ChatGPT와 LLaMA가 독립적으로 답변을 생성하고, 유사도가 낮을 때 문서 인용 기반 상호 평가·토론을 수행하는 Generation 단계 환각 탐지 시스템&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;프로젝트 목적&lt;/strong&gt;: RAG Generation 단계에서 발생하는 환각을 단일 모델 검증의 한계를 넘어, 서로 다른 LLM의 답변 다양성으로 탐지하고 교정&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;검증 데이터&lt;/strong&gt;: TruthfulQA 중 Source가 Wikipedia인 질문 50문항&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;비교 모델&lt;/strong&gt;: ChatGPT-3.5-turbo, Groq 기반 llama-4-maverick-17b-128e-instruct&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;주요 검증 대상&lt;/strong&gt;: 최종 답변, 원본 문서 인용 문장, 근거가 답변을 지지하는 이유&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;주요 성과&lt;/strong&gt;: 한 모델만 오답인 문항에서 토론을 통해 약 절반을 정답으로 교정 (GPT만 오답 3문항 중 1문항, LLaMA만 오답 13문항 중 7문항)&lt;/li&gt;
&lt;/ul&gt;
&lt;br/&gt;
&lt;h3 id="연구를-시작하게-된-배경"&gt;연구를 시작하게 된 배경&lt;/h3&gt;
&lt;p&gt;기존 LLM의 환각을 개선하기 위해 RAG 기법이 도입되었지만, RAG를 활용한 LLM에서도 환각 문제는 여전히 남아 있었습니다.&lt;/p&gt;
&lt;blockquote class="border-l-4 border-neutral-300 dark:border-neutral-600 pl-4 italic text-neutral-600 dark:text-neutral-400 my-6"&gt;
&lt;p&gt;SUFFICIENT CONTEXT: A NEW LENS ON RETRIEVAL AUGMENTED GENERATION SYSTEMS (2025) 논문 일부 발췌&lt;/p&gt;
&lt;/blockquote&gt;
&lt;ul&gt;
&lt;li&gt;RAG로 추가 맥락을 주더라도 AI의 자신감이 올라가는 것과 정확성이 항상 비례하지는 않았습니다.&lt;/li&gt;
&lt;li&gt;ChatGPT 4o, Gemini 1.5 Pro, Gemma 27B처럼 모델이 다르면 학습 데이터 차이로 환각률도 다르게 나타났습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;p&gt;따라서 본 연구에서는 &lt;span class="high-mark"&gt;&lt;strong&gt;서로 다른 언어 모델의 답변 다양성을 Generation 단계 환각 개선에 활용&lt;/strong&gt;&lt;/span&gt;
하고자 했습니다. RAG 파이프라인 중에서도 Query Rewriting과 Generation에서 환각이 자주 발생하는데, Generation은 LLM 사용이 필수이므로 이 단계에 집중해 멀티 에이전트 구조로 분기했습니다.&lt;/p&gt;
&lt;h3 id="시스템-아키텍처"&gt;시스템 아키텍처&lt;/h3&gt;
&lt;p&gt;
&lt;figure &gt;
&lt;div class="flex justify-center "&gt;
&lt;div class="w-full" &gt;
&lt;img alt="Architecture"
srcset="https://inhyuk2000.github.io/projects/a-multi-llm-cross-verification-framework-for-attribution-hallucination-detection-in-rag-generation/img/architecture_hu_491d715c65ecc5a.webp 320w, https://inhyuk2000.github.io/projects/a-multi-llm-cross-verification-framework-for-attribution-hallucination-detection-in-rag-generation/img/architecture_hu_886f383c93590605.webp 480w, https://inhyuk2000.github.io/projects/a-multi-llm-cross-verification-framework-for-attribution-hallucination-detection-in-rag-generation/img/architecture_hu_d2cbbb04f0d4c118.webp 760w"
sizes="(max-width: 480px) 100vw, (max-width: 768px) 90vw, (max-width: 1024px) 80vw, 760px"
src="https://inhyuk2000.github.io/projects/a-multi-llm-cross-verification-framework-for-attribution-hallucination-detection-in-rag-generation/img/architecture_hu_491d715c65ecc5a.webp"
width="760"
height="428"
loading="lazy" data-zoomable /&gt;&lt;/div&gt;
&lt;/div&gt;&lt;/figure&gt;
&lt;/p&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;Query Rewriting&lt;/strong&gt;: 추가 LLM(&lt;code&gt;gpt-5.2-2025-12-11&lt;/code&gt;, temp=0)으로 검색 쿼리 생성&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;Generation 1 / 2&lt;/strong&gt;: ChatGPT-3.5-turbo, llama-4-maverick-17b-128e-instruct가 동일 검색 문서로 독립 답변&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;답변 유사도 계산&lt;/strong&gt;: SentenceTransformer(&lt;code&gt;all-MiniLM-L6-v2&lt;/code&gt;), threshold=0.8&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;일치 시 종료 / 불일치 시 토론&lt;/strong&gt;: 상대 답변이 문서에 근거하는지 문장 직접 인용으로 상호 평가&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="토론-프롬프트-설계"&gt;토론 프롬프트 설계&lt;/h3&gt;
&lt;p&gt;각 모델은 답변 시 아래 세 가지를 함께 작성하도록 했습니다.&lt;/p&gt;
&lt;ol&gt;
&lt;li&gt;최종 답변&lt;/li&gt;
&lt;li&gt;원본 문서 인용 문장&lt;/li&gt;
&lt;li&gt;해당 근거가 답변을 지지하는 이유&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;답변이 불일치하면, 상대 답변이 문서에 근거하는지를 &lt;span class="high-mark"&gt;&lt;strong&gt;문서 문장을 직접 인용해 평가&lt;/strong&gt;&lt;/span&gt;
하도록 지시했습니다.&lt;/p&gt;
&lt;h3 id="실험-설계"&gt;실험 설계&lt;/h3&gt;
&lt;ol&gt;
&lt;li&gt;TruthfulQA 중 Wikipedia 출처 질문 50문항 선정&lt;/li&gt;
&lt;li&gt;RAG 기반 독립 답변 생성&lt;/li&gt;
&lt;li&gt;유사도 불일치 시 토론 진행&lt;/li&gt;
&lt;li&gt;Best Answer / Best Incorrect Answer 기준 수동 검증&lt;/li&gt;
&lt;/ol&gt;
&lt;p&gt;단순 사실 판단 데이터는 제외하고, 정·오답이 라벨링된 문항만 사용해 교정 효과를 수치화했습니다.&lt;/p&gt;
&lt;h3 id="실험-결과"&gt;실험 결과&lt;/h3&gt;
&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;구분&lt;/th&gt;
&lt;th style="text-align: right"&gt;문항 수&lt;/th&gt;
&lt;th&gt;토론 후&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;GPT만 정답&lt;/td&gt;
&lt;td style="text-align: right"&gt;3&lt;/td&gt;
&lt;td&gt;정답 교정 1 / 오답 유지 2&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;LLaMA만 정답&lt;/td&gt;
&lt;td style="text-align: right"&gt;13&lt;/td&gt;
&lt;td&gt;정답 교정 7 / 오답 유지 6&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;둘 다 오답&lt;/td&gt;
&lt;td style="text-align: right"&gt;14&lt;/td&gt;
&lt;td&gt;정답 교정 0&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;둘 다 정답&lt;/td&gt;
&lt;td style="text-align: right"&gt;20&lt;/td&gt;
&lt;td&gt;-&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;
&lt;p&gt;한 모델만 오답인 경우 약 절반이 토론으로 교정되었고, &lt;span class="high-mark"&gt;&lt;strong&gt;둘 다 오답이면 토론만으로는 교정되지 않았습니다.&lt;/strong&gt;&lt;/span&gt;&lt;/p&gt;
&lt;h3 id="유형별-분석"&gt;유형별 분석&lt;/h3&gt;
&lt;p&gt;Misconceptions, Conspiracies, Superstitions, Paranormal, Fictions 중 &lt;strong&gt;미신(Superstitions)&lt;/strong&gt; 문항에서 오류율이 가장 높았습니다 (GPT 0%, LLaMA 22%).&lt;/p&gt;
&lt;h3 id="결론"&gt;결론&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;Generation 단계 모델만 바꿔도 성능 차이가 컸습니다.&lt;/li&gt;
&lt;li&gt;한 모델만 오답일 때 토론의 교정 효과가 확인되었습니다.&lt;/li&gt;
&lt;li&gt;두 모델이 모두 오답이면 RAG 토론만으로는 교정이 어려웠습니다.&lt;/li&gt;
&lt;li&gt;미신 · 잘못된 상식류 문항에서 특히 취약했습니다.&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="사례"&gt;사례&lt;/h3&gt;
&lt;ul&gt;
&lt;li&gt;&lt;strong&gt;둘 다 정답&lt;/strong&gt;: Fortune cookie 기원 질문 — 유사도 0.97, Conflict False로 종료&lt;/li&gt;
&lt;li&gt;&lt;strong&gt;한 모델만 정답 → 교정&lt;/strong&gt;: 식사 후 수영 대기 시간 질문 — 1차 불일치 후, 문서에 대기 시간 언급이 없다는 인용 평가로 합의 도달&lt;/li&gt;
&lt;/ul&gt;
&lt;h3 id="프로젝트를-진행하며-느낀점"&gt;프로젝트를 진행하며 느낀점&lt;/h3&gt;
&lt;p&gt;멀티 에이전트 챗봇 토론 시스템을 활용한 환각 교정 서비스를 개발하면서 환각 문제를 깊이 분석하던 중, 연구를 더욱 발전시킬 수 있는 새로운 방향을 발견했습니다. 일반적인 사실 오류뿐만 아니라, &lt;span class="high-mark"&gt;&lt;strong&gt;출처 환각(Attribution Hallucination)&lt;/strong&gt;&lt;/span&gt;
역시 실제 서비스 환경에서 빈번하게 발생하는 중요한 문제라는 점을 알게 되었고, 이를 해결하기 위해 본 프로젝트를 진행하게 되었습니다.&lt;/p&gt;
&lt;p&gt;본 연구에서는 각 LLM에 RAG(Retrieval-Augmented Generation) 시스템을 구축하고, 서로의 답변에 포함된 출처를 교차 검증하도록 설계하여 출처 환각을 줄이는 것을 목표로 했습니다. 다만 어떤 데이터셋을 구성해야 하는지, 출처의 일치 여부를 어떤 기준으로 검증해야 하는지 등 연구 설계 단계에서 많은 고민이 있었고, 이를 구체화하기 위해 교수님과 지속적으로 논의하며 연구 방향을 수정해 나갔습니다.&lt;/p&gt;
&lt;p&gt;최종적으로는 Prompt Engineering과 LLM 간 대화 구조를 보다 정교하게 설계함으로써 의미 있는 성능 개선을 확인할 수 있었고, 이를 바탕으로 논문화까지 진행할 수 있었습니다. 아직 해결해야 할 한계점이 남아 있지만, 이를 보완하며 출처 환각 탐지 및 교정 성능을 더욱 향상시키는 방향으로 연구를 계속 발전시킬 계획입니다.&lt;/p&gt;</description></item></channel></rss>