NLP study

more

[연구 회고] 불공정약관 심사를 위한 지식 그래프 기반 법령 검색 전략의 비교 분석

정부 부처 AI 확산사업의 일환으로, 공정거래위원회의 약관심사 과정을 보조하는 시스템의 연구 개발을 진행하는 과정에서 연구 성과를 정리하여 학술대회 논문을 발표하였습니다.- 2026.07.17 논문이 개제되어 링크로 공유합니다.https://drive.google.com/file/d/17IHqYISPqnIVLg5Nsl4-VdetLAkW9d50/view TL;DR1. 어떠한 "사건"으로부터 연관된 "법령 조문"을 떠올리는 과정은 단순한 벡터 유사도, 하이브리드 검색으로는 한계가 있다.2. 어떠한 "사건"의 불공정/위법 여부 등등에 대해, 전문가들도 판단하기 전 과거 유사 사례가 있는지 먼저 탐색하지 않는가? 이는 곧 과거 유사 사례들로부터 "지식 그래프" 와 같은 구조적 관계를 만들어낼 수 있는 가능성이 ..

NLP study 2026.07.17 0

[NeurIPS 2025] 논문리뷰: Learning to Learn with Contrastive Meta-Objective

NeurIPS 2025 Conference Oral에 제출된 다양한 논문들을 빠르게 훑어보는 시간을 가졌습니다. Top-tier 학회에 oral 로 accepted 된 논문들의 아이디어를 빠르게 살펴보고 연구 동향을 파악하는 역량을 키워보려고 합니다.오늘 살펴본 논문은 Tsinghua University 에서 발표한 'Learning to Learn with Contrastive Meta-Objective' 입니다.빠르게 핵심적인 내용을 살펴보았습니다. https://arxiv.org/pdf/2410.05975 TL;DR - TakeawayMeta-learning은 "학습하는 방법을 학습하는" 것meta-learning은 "고양이, 개, 새 등 여러 태스크를 경험하면서 '새로운 동물을 단 몇 장만 보고도..

NLP study 2026.01.09 0

[논문 리딩] Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization

논문 리뷰: Attention Illuminates LLM Reasoning: The Preplan-and-Anchor Rhythm Enables Fine-Grained Policy Optimization, Shanghai Jiao Tong University, Alibaba Group, 2025.10 Reasoning 관련된 논문을 찾아보다 상당히 흥미로운 논문을 찾게되어 논문 스터디를 진행해보았다. TL;DR느낀점 요약: 1. 전반적으로 색다른, 흥미로운 접근으로 보인다. token level, logit 값을 토대로 reasoning을 촉진시킬 수 있는 연구가 기존에 있긴 했으나, ... Attention을 head 기준으로 쪼개 색다르게 token level로 접근한 것은 매우 흥미로운 접근. ..

NLP study 2025.11.10 0

[논문 리딩] RLT: Reinforcement Learning Teachers of Test Time Scaling

논문 리뷰: RLT: Reinforcement Learning Teachers of Test Time Scaling, SakanaAI, Japan, 2025 SakanaAI 팀에서 재미있는 강화학습+Distillation 논문을 작성하여, 어떤 방식으로의 연구가 진행되었는지 궁금해 논문 스터디를 진행했고, 그 기록을 정리하고자 했다. TL;DR 느낀점 요약: 1. Deepseek로 촉발된 최근의 강화학습 프레임워크는 구조상 Teacher-Student 패러다임과 유사한데, 이는 Distillation의 형태로 지식을 전달해주는 구조이므로, 학습자인 student가 습득하기 더 효과적인 데이터 생성방법이 필요하고(Prompting), 생성된 데이터를 teacher-student 사이의 효과적인 학습..

NLP study 2025.10.04 1

Docker & Docker Compose 관련 개념 정리

내가 다시 보려고 정리하는 docker & docker compose 관련 개념정리. 생각보다 최근에 많이 사용하게 되었는데 잘 모르고 사용하게 되는 것 같아 필요한 개념들을 정리해보려고 한다. 도커 컨테이너란,간단히 말해서, OS의 커널을 공유하는 별도의 격리된 환경에서(어플리케이션 실행 환경을 분리) 동작하는 것과 같이 어플리케이션을 실행하도록, 코드와 종속성 패키지들을 패키징하는 표준 소프트웨어 단위. A container is a standard unit of software that packages up code and all its dependencies so the application runs quickly and reliably from one computing environment to..

NLP study 2025.06.22 0

[한국어 법률 및 약관 검색 특화를 위한 klaw-Contriever의 연구] 회고(2)

TL; DR1. 공정거래위원회의 보도자료(약관 - 불공정성 판단 근거 법령이 매핑된 자료)를 정제하여 직접 '법령 검색 평가세트'를 제작했다.2. Contriever 방법론을 기존 오픈소스 대비 xx% 성능 향상시켰으나, 현실적으로 아직 사용하기 어려운 검색 성능이다.3. 실험 과정에서 이런저런 어려움이 있었다... (학습 시간 40시간, 평가코드 디버깅 어려움, 법령정보 크롤링 예외처리 등) - 25.10.03 업데이트: 논문 개제본을 추가합니다.https://drive.google.com/file/d/14xplcekeNmxJo4JNVTVtA3Fp7Xb1OmJV/view?usp=sharing 법령 검색 평가세트 제작하기 - 공정거래위원회 보도자료를 기반으로 공정거래위원회는 보도자료를 통해 (특히 '약..

NLP study 2025.06.09 1

[한국어 법률 및 약관 검색 특화를 위한 klaw-Contriever의 연구] 회고(1)

상당히 오랜 기간동안 검색모델의 개발과 연구에 몰두했었고, 최근 한국정보과학회 주관 한국컴퓨터종합학술대회(KCC2025)에 논문을 개제할 기회가 생겨, 그동안의 연구과정을 정리하고자 연구기록 및 어려웠던 점들을 회고하고자 한다. 또한, 연구 과정에서의 어려움들을 정리하면서 부끄럽지만 성장의 밑거름이 될 수 있도록... 하고 싶기도 하고. - 25.10.03 업데이트: 논문 개제본을 추가합니다.https://drive.google.com/file/d/14xplcekeNmxJo4JNVTVtA3Fp7Xb1OmJV/view?usp=sharing 목차문제상황 - 연구배경 - 연구 과정에서의 난관 1, 난관 2, 난관 3, 난관 4 .... 이런 배경에서 이런 연구를 진행했는데, 이런 어려움이 있었다고 주절주절. ..

NLP study 2025.06.08 0

Code Executor: E2B Sandbox & Local Executor

강화학습 오픈소스 코드들을 살펴보다가, 아래와 같은 이상한 코드를 발견한 적 있다.코드를 비동기함수로 동작시키는데, 무슨 코드를 어디로 보내는 것인지 싶었다.async def run_script(sbx: AsyncSandbox, script: str, language: str) -> float: execution = await sbx.run_code(script, language=language) try: return float(execution.text) except (TypeError, ValueError): return 0.0 except Exception as e: print(f"Error from E2B executor run_scrip..

NLP study 2025.05.18 0

[논문리딩] ANCE : Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval

* 현재 내용을 보충 및 수정 중인 포스트입니다. 논문의 저자 Lee Xiong, Chenyan Xiong, Ye Li, Kwok-Fung Tang, Jialin Liu, Paul Bennett, Junaid Ahmed, Arnold Overwijk, Microsoft, 2021, ICLR 논문의 하이라이트 및 핵심 1. Dense Retrieval(DR)이 종종 Sparse Retrieval에 비해 성능이 낮게 나오는 이유를 밝혀냈다. local uninformative negative samples들이 어떠한 영향을 주기 때문이다. 2.ANCE(Approximate nearest neighbor Negative Contrastive Learning)을 도입해서 BERT-base IR 과정에서 100배..

NLP study 2023.08.22 0

[NLP 이론] R-drop과 KL-divergence, 그의 활용

R-drop 이란? 먼저 Dropout이란, regularization 기법의 일종으로, 모델의 complexity가 주어진 데이터 및 태스크에 비해 너무 클 경우 과적합(overfitting) 하게 되는 것을 방지하고자 고안된 regularization 기법이다. Dropout은 Fully connected layer에서 몇 개의 unit들을 동작하지 않도록(weight=0) 설정하여 일부만 weight를 전달하도록 학습하게 되는데, 모델의 복잡도를 떨어뜨리면서도 test 시에는 모든 unit들이 동작하게 되어 앙상블과 유사한 효과를 가져올 수 있다(일반화 성능 향상을 기대할 수 있다.) 적은 parameter들로 하여금 feature를 학습하고 정보를 소유할 수 있도록 '규제'함으로써 overfitt..

NLP study 2023.04.29 1

Daily Life

more

현재 상황에서 느끼는 어려움은 당신의 장점 때문일 수 있겠습니다.

물론 당신의 장점때문이 아닌 단점때문일 수 있습니다. 복합적인 문제겠지요. 종종 마음에 울림을 주거나 생각할 거리들을 던져주는 쇼츠를 발견할 때가 있습니다. 이렇게 괜찮은 쇼츠를 마주하게 되어 생각을 정리하고 나아가 나 자신에 대해 조금 더 알게 되는 시간을 가질 수 있어서 운이 좋은 것 같습니다. 김경일 교수님의 토크쇼가 있었던 모양입니다. 언제인지는 모르겠으나, 첨부링크된 책은 2년이 넘었네요. 토크쇼도 오래 되었겠습니다.제가 여운을 느꼈던 쇼츠는 다음 링크입니다.https://www.youtube.com/shorts/zpd9vtizqb4 "당신이 지금 처한 어려움은 반드시 당신이 가지고 있는 역량 때문이다" 라는 말이 생각보다 깊게 다가와서, 제가 처한 어려움에도 적용해볼 수 있을까 ..

생각 정리 2026.08.26 0

우리 인간들의 삶은 마치 강화학습(RL)과 비슷하다.

인생은 어쩌면 강화학습 같은 걸지도 모른다는 생각을 했다. N년짜리 정부 과제를 무사히 완료하는 것은 reward=1인 것이고, N년이 다 지나야 제공되는 리워드. 피드백이 너무 없고, 길고, 잘 되고있는지 알 수 없는 아주 긴 reasoning path를 지나가는 것 같다는 생각이 들었다. 여기서 개인별로 GRPO를 수행하고자 짧게 짧게 뭐라도 수행해보면서 부딪히고 reward를 얻어보려고 할 수 있고, 내가 그러고 있는 듯 하다. 그냥 저냥 잘 흘러가는 것 같이 부딪히지 않고 피하는 것은 reward를 제공받지 못하는, feedback이 없는 그런 시간들이 지속될 수록, 최종적으로 실패할 가능성이 높아지는 건 자명해보인다. 그럼에도, 해당 문제풀이(과제 해결) 과정에서 최종 reward=1이 제공..

생각 정리 2026.03.25 1

(회고) 2025년도 회고

나의 2025년도를 간단히 요약해보자면... 1. 법률 분야의 질의, 계약, 약관 조항에 대한 법률문서 검색 모델의 고도화 작업 수행 (1~4월)2. B2G 프로젝트(3년과제)의 데이터/모델링 작업 수행 (3월~ 계속진행) 정도로 나눠볼 수 있겠다.특히 1번, 모델 고도화 작업을 수행한 뒤로 회사 내/외부 인원들의 관심이 많아져 두 번째 업무에 많은 시간과 에너지를 투입하게 되었다. 두서없고 길게 작성한 것 같다. TL;DR을 정리해야 하겠다. 1. 법률 분야의 질의, 계약, 약관 조항에 대한 법률문서 검색 모델의 고도화 작업 수행 우선 거의 1/4분기에는 임베딩 모델 고도화를 위해 데이터 합성, 정제, 학습 로직 및 loss 함수 설계를 토대로 성능 향상에 몰두했다.검색모델의 훈련과정과 데이터 설계 과..

생각 정리 2026.01.31 0

(독후감) 경험의 멸종 - 크리스틴 로젠

2025년도에는 정말 책을 거의 안 읽었다는 게 실감이 난다. 독후감을 쓴 책도, 쓸 책도 없었다는게 스스로 안타깝다는 생각이 들었다. 이 책은 우연한 계기로 미디어에서 접하게 되었고, 간단한 목차와 설명을 읽었을 때 상당히 흥미로운 인문학적 내용들이 기술되어있는 것 같아 읽게 되었다. 생각보다 경험의 멸종이라는 이름은 자극적이고 시선을 끄는데, 어디서 들어본 적은 없지만 한 번쯤은 내가 생각해본 주제이기는 해서 익숙한 개념이었다. 앞으로 생길 무엇인가에 비례해서 앞으로 서서히 사라질 무언가들은 항상 존재할 터인데, 그것이 인간이 진화해오면서 상당히 중요시 여기는 '경험' 이라면 당신은 어떻게 받아들일 수 있을까? 그 전에, 당신은 당신의 여러 경험들이 이미 다양한 방식으로 대체되어 오고 있었음을 인지한..

생각 정리 2026.01.11 0

보여지는 것에 대한 고찰, 그리고 현 대통령의 예능촬영에 대한 생각

어떻게 보여지는가에 대해 생각해볼 수 있는 시간. 이미지 또한 신경쓸 수 밖에 없는 공직자. 하지만 딱히 공직자가 아니어도, 우리 한국 사회에서는 남들에게 내가 어떻게 비춰지는 지를 상당히 많이 신경쓰고 있고, 또 그러한 경향을 어느정도 주입 당하고 있다는 것을 어렵지 않게 느낄 수 있다. "남들처럼 평범하게" 살고 싶어하는 많은 사람들. 심지어 남들처럼만이라도 사는 것을 하나의 목표로 하고 있는 사람들을 매스컴에서 심심찮게 볼 수 있다. 21세기 물질 사회에서는 내가 무엇을 이루었는가, 어떠한 결과물을 만들어 냈는가, 앞으로 어떠한 기여를 할 수 있는가를 우리는 항상 정형화하고 수치화할 수 있어야 한다.(최소한 우리 사회가 내 눈에는 그러해 보인다) 많은 시간을 쏟아 만든 내 결과물의 영향력과 기여도..

이슈와 생각 2025.10.11 1