농촌진흥청이 농업 전용 거대언어모델을 만들었다는데, 범용 AI와 무엇이 다를까?
농촌진흥청이 농생명 논문과 국가 연구 데이터로 학습시킨 거대언어모델을 10월부터 쓰기 시작했어요. 답변마다 근거와 출처 번호를 붙이고, 데이터는 기관 안에서만 돌려요.
3줄 요약
- 농진청은 5개 학회 논문과 자체 논문·보고서로 '농생명 특화 거대언어모델'을 만들어 10월부터 연구자 시범 서비스를 시작했어요.
- 답변과 함께 근거 문헌과 데이터 출처를 번호로 보여주고, 데이터와 계산을 기관이 직접 관리하는 온프레미스 방식이에요.
- 대국민 서비스는 2027년 1월, 연구 지원 에이전트 개발은 2028년 서비스가 목표예요.

01무슨 일인가
챗봇에 우리나라 콩 품종 연구를 물었는데 막연한 답만 돌아온 경험이 있다면 이 소식이 반가울 거예요. 농촌진흥청은 농생명 분야 논문과 국가 연구 데이터로 인공지능을 학습시켜 '농생명 특화 거대언어모델(LLM)'을 개발했고 10월부터 활용한다고 10월 6일 밝혔어요.
학습에 쓴 자료는 원예, 육종, 작물, 약용작물, 식물병리 5개 학회와 업무협약을 맺어 확보한 학술논문 약 2만 편이 바탕이에요. 여기에 농진청이 낸 SCI(E) 국제학술지 논문 1만여 편과 연구개발 보고서 약 3,000건이 더해졌어요.
이 모델은 답을 낼 때 근거와 출처를 함께 붙여요. 예를 들어 콩 개화기 유전자의 최근 국내 연구 동향을 물으면 관련 국내 논문 12건을 찾아 주고, 학회지 논문과 농업생명공학정보센터(나빅) 유전형 자료를 번호를 매겨 정리해 줘요.

02왜 이렇게 됐나
농진청은 범용 거대언어모델의 한계를 세 가지로 꼽았어요. 국내 농생명 연구 데이터를 충분히 모르고, 답변 근거를 원문이나 자료 단위로 확인하기 어렵고, 아직 공개하지 않은 민감한 데이터를 외부 서비스에 맡기기 곤란하다는 거예요.
그래서 만든 방식이 온프레미스(자기 건물 안 서버에 설치해 직접 운영하는 방식)예요. 자료와 AI와 계산 과정을 기관이 직접 관리하니 정보가 밖으로 새지 않고, 원본 데이터베이스와 검색 색인과 훈련 데이터를 따로 분리해 뒀어요.
연구진은 그림 파일로 저장된 옛 논문까지 글자 인식으로 바꿔 국문·영문 문헌 2만6711편을 정리했고, 이 자료로 묻고 답하는 데이터 48만1968건과 풀이 자료 2만9480건을 만들었어요. 공개된 기반 모형 4종에 이 데이터를 미세 조정해 농생명 지식을 입혔고, 답을 낼 때는 검색 결과를 함께 붙여 원본 기록을 직접 불러오게 했어요.
03이 숫자는 큰 건가
논문 약 2만 편은 농진청이 모은 SCI(E) 논문 1만여 편의 두 배고, 연구개발 보고서 3,000건의 6배가 넘어요. 학회 논문을 적극적으로 끌어온 것이 이 모델의 몸집을 만든 셈이에요.
정리한 문헌 2만6711편에서 묻고 답하는 데이터 48만1968건을 뽑았으니 문헌 한 편당 약 18건이에요. 한 편의 논문을 질문과 답으로 열여덟 번 쪼개 가르쳤다는 뜻이에요.
다만 이 숫자들은 얼마나 많이 읽혔는지를 알려줄 뿐 얼마나 정확한지는 말해 주지 않아요. 농진청 발표에는 정확도나 오답률 수치가 없어요.
04지난번엔 어떻게 됐나
농진청의 인공지능은 이번이 세 번째예요. 농업인용 'AI 이삭이'와 기획·행정업무와 연구용 'AI 새싹이'가 먼저 있었고, 이번 모델은 농생명 분야 연구용으로 더해졌다고 농진청은 밝혔어요. 세 인공지능은 각각 별도 모델로 돌리면서 보고서와 발간물을 매개로 연계하는 구조예요.
뉴시스가 7월 16일 전한 농진청 하반기 업무보고에서 AI 이삭이는 17개 정보시스템과 연계하고, 9월에 음성인식과 농가경영진단 기능을 더한 2.0을 내놓겠다고 했어요. 이삭이가 실제로 얼마나 쓰이는지는 확인한 자료가 없어서, 앞선 사례의 성적표로 견줄 수는 없어요.
05나한테 뭐가 달라지나
일반 농업인이나 소비자가 이 모델을 직접 쓸 수 있는 시점은 2027년 1월 본격적인 대국민 서비스부터예요. 지금은 농진청 연구자만 이용하는 시범 서비스 단계이고, 나빅에 탑재돼 이번 달 문을 열었어요. 시범에서 대국민 서비스까지는 약 3개월이에요.
영농 상담이 목적이라면 농진청이 먼저 내놓은 AI 이삭이를 쓰는 편이 맞아요. 이번 모델은 논문과 연구 데이터를 찾는 연구용이라서 병해충을 진단하는 용도와는 결이 달라요.
쓸 일이 생기면 답변에 붙은 출처 번호를 직접 눌러 원문과 맞는지 확인하는 습관이 필요해요. 근거를 보여주는 구조이지 틀린 답이 없다는 보증은 발표에 없어요.
이것만 기억하세요
- 농진청이 농생명 논문과 국가 연구 데이터로 거대언어모델을 만들어 10월부터 연구자 시범을 시작했어요.
- 학회 논문 약 2만 편, SCI(E) 논문 1만여 편 등으로 학습했고 답변마다 출처 번호를 붙이며 데이터는 기관 안에서만 돌려요.
- 일반 이용은 2027년 1월 대국민 서비스부터이고 정확도 수치가 없으니 출처 번호를 눌러 원문을 확인해요.




