[14선] 정렬과 번역을 동시에 학습하는 신경망 기계 번역 (NEURAL MACHINE TRANSLATION BY JOINTLY LEARNING TO ALIGN AND TRANSLATE)
·
일리야의 논문 30선
https://arxiv.org/pdf/1409.0473정렬과 번역을 동시에 학습하는 신경망 기계 번역 (NEURAL MACHINE TRANSLATION BY JOINTLY LEARNING TO ALIGN AND TRANSLATE)저자:Dzmitry Bahdanau (Jacobs University Bremen, Germany)KyungHyun Cho, Yoshua Bengio (Université de Montréal)초록 (ABSTRACT)신경망 기계 번역(Neural machine translation)은 최근 제안된 기계 번역의 새로운 접근 방식입니다. 기존의 통계적 기계 번역과 달리, 신경망 기계 번역은 번역 성능을 극대화하기 위해 결합적으로 조정(jointly tuned)될 수 있는 단일 신경..
[13선] 어텐션만 있으면 충분하다(Attention Is All You Need)
·
일리야의 논문 30선
https://arxiv.org/pdf/1706.03762Attention Is All You Need (어텐션만 있으면 충분하다)저자: Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan N. Gomez, Łukasz Kaiser, Illia Polosukhin초록 (Abstract)현재 우세한 시퀀스 변환(sequence transduction) 모델들은 인코더와 디코더를 포함하는 복잡한 순환 신경망(RNN)이나 합성곱 신경망(CNN)에 기반을 두고 있습니다. 가장 성능이 좋은 모델들은 인코더와 디코더를 어텐션(attention) 메커니즘으로 연결합니다. 우리는 순환과 합성곱을 완전히 배제하고 오직 어텐션 메커니..
[12선] 양자 화학을 위한 신경 메시지 전달 (Neural Message Passing for Quantum Chemistry)
·
일리야의 논문 30선
https://arxiv.org/pdf/1704.01212양자 화학을 위한 신경 메시지 전달 (Neural Message Passing for Quantum Chemistry)저자: Justin Gilmer, Samuel S. Schoenholz, Patrick F. Riley, Oriol Vinyals, George E. Dahl (Google Brain, Google DeepMind)초록 (Abstract)분자에 대한 지도 학습(Supervised learning)은 화학, 신약 개발, 재료 과학 분야에서 유용하게 쓰일 수 있는 엄청난 잠재력을 가지고 있습니다. 다행히도 분자의 대칭성에 대해 불변성(invariant)을 가지는 전도유망하고 밀접하게 관련된 신경망 모델들이 이미 문헌에 기술되어 있습니다..
[11선] 확장 합성곱을 이용한 다중 스케일 문맥 통합 (Multi-Scale Context Aggregation by Dilated Convolutions)
·
일리야의 논문 30선
확장 합성곱을 이용한 다중 스케일 문맥 통합 (Multi-Scale Context Aggregation by Dilated Convolutions)저자: Fisher Yu (프린스턴 대학교), Vladlen Koltun (인텔 랩)학술대회: ICLR 2016초록 (Abstract)최첨단 시맨틱 세그멘테이션(semantic segmentation) 모델들은 원래 이미지 분류를 위해 설계된 컨볼루션 네트워크(CNN)를 변형하여 사용합니다. 그러나 시맨틱 세그멘테이션과 같은 밀집 예측(dense prediction) 문제는 이미지 분류와 구조적으로 다릅니다. 본 연구에서는 밀집 예측을 위해 특별히 설계된 새로운 컨볼루션 네트워크 모듈을 개발했습니다. 이 모듈은 '확장 합성곱(dilated convolution..
[10선] 이미지 인식을 위한 깊은 잔차 학습 (Deep Residual Learning for Image Recognition)
·
일리야의 논문 30선
https://arxiv.org/pdf/1512.03385이미지 인식을 위한 깊은 잔차 학습 (Deep Residual Learning for Image Recognition)저자: Kaiming He, Xiangyu Zhang, Shaoqing Ren, Jian Sun (Microsoft Research)초록 (Abstract)신경망이 깊어질수록 훈련하기가 더 어려워집니다. 우리는 이전보다 훨씬 더 깊은 네트워크의 훈련을 용이하게 하기 위한 잔차 학습(residual learning) 프레임워크를 제시합니다. 우리는 레이어를 레이어 입력에 대한 참조가 없는 함수를 학습하는 대신, 잔차 함수를 학습하도록 명시적으로 재구성합니다. 이러한 잔차 네트워크가 최적화하기 더 쉬우며, 상당히 늘어난 깊이에서도 정확..
[9선] GPipe: 마이크로 배치 파이프라인 병렬화를 이용한 쉬운 확장성 (GPipe: Easy Scaling with Micro-Batch Pipeline Parallelism)
·
일리야의 논문 30선
https://arxiv.org/abs/1811.06965GPipe: 마이크로 배치 파이프라인 병렬화를 이용한 쉬운 확장성저자: Yanping Huang, Youlong Cheng, Ankur Bapna, Orhan Firat, Mia Xu Chen, Dehao Chen, HyoukJoong Lee, Jiquan Ngiam, Quoc V. Le, Yonghui Wu, Zhifeng Chen (Google)요약 (Abstract)딥 뉴럴 네트워크(DNN)의 용량을 확장하는 것은 여러 기계 학습 작업에서 모델 품질을 향상시키는 효과적인 방법으로 알려져 있습니다. 많은 경우, 단일 가속기(Accelerator)의 메모리 한계를 넘어 모델 용량을 늘리기 위해서는 특별한 알고리즘이나 인프라 개발이 필요했습니다. ..
[8선] 집합을 위한 시퀀스 투 시퀀스 (Order Matters: Sequence to Sequence for Sets)
·
일리야의 논문 30선
https://arxiv.org/pdf/1511.06391순서가 중요하다: 집합을 위한 시퀀스 투 시퀀스 (Order Matters: Sequence to Sequence for Sets)저자: Oriol Vinyals, Samy Bengio, Manjunath Kudlur (Google Brain)초록 (ABSTRACT)순환 신경망(RNN)의 부활 덕분에 시퀀스(Sequence, 순서가 있는 나열)는 지도 학습에서 일류 시민(first class citizens)이 되었습니다. 관측치 시퀀스로부터 또는 관측치 시퀀스로 매핑하는 많은 복잡한 작업은 이제 시퀀스의 결합 확률을 효율적으로 표현하기 위해 연쇄 법칙(chain rule)을 사용하는 시퀀스 투 시퀀스(seq2seq) 프레임워크로 공식화될 수 있습..
[7선] 심층 합성곱 신경망을 이용한 ImageNet 분류 (ImageNet Classification with Deep ConvolutionalNeural Networks)
·
일리야의 논문 30선
https://proceedings.neurips.cc/paper_files/paper/2012/file/c399862d3b9d6b76c8436e924a68c45b-Paper.pdf심층 합성곱 신경망을 이용한 ImageNet 분류Alex Krizhevsky, Ilya Sutskever, Geoffrey E. Hinton(토론토 대학교)초록 (Abstract)우리는 ImageNet LSVRC-2010 대회의 120만 개 고해상도 이미지를 1,000개의 서로 다른 클래스로 분류하기 위해 크고 깊은 합성곱 신경망(Convolutional Neural Network)을 훈련시켰습니다. 테스트 데이터에서 우리는 기존의 최첨단 기술보다 훨씬 뛰어난 37.5%의 top-1 에러율과 17.0%의 top-5 에러율을 달..
깃헙트랜드인 MiroFish는 무엇인가?
·
개발 관련
MiroFish 아키텍처 딥다이브이 문서는 MiroFish가 코드 수준에서 실제로 어떻게 동작하는지 설명합니다.이 문서는 마케팅용 개요가 아닙니다. frontend/와 backend/의 현재 구현을 기준으로, 런타임 흐름, 영속성, 오케스트레이션, 그리고 MiroFish 자체가 담당하는 부분과 외부 엔진에 의존하는 경계를 중심으로 시스템을 해설합니다.1. MiroFish는 무엇인가MiroFish는 크게 세 가지 축 위에 세워진 제품 계층의 오케스트레이터로 이해하는 것이 가장 정확합니다.원시 문서를 도메인 특화 ontology와 시뮬레이션 설정으로 바꾸는 LLM 기반 변환 파이프라인추출된 엔티티, 관계, 그리고 이후 시뮬레이션 이벤트를 저장하는 Zep 기반 그래프 메모리 계층Twitter 유사 환경과 Re..
[6선] 포인터 네트워크 (Pointer Networks)
·
일리야의 논문 30선
https://arxiv.org/abs/1506.03134v2저자:Oriol Vinyals (Google Brain)Meire Fortunato (UC Berkeley 수학과)Navdeep Jaitly (Google Brain)(* 동일 기여)초록 (Abstract)우리는 입력 시퀀스의 위치에 대응하는 이산적 토큰(discrete tokens)을 요소로 하는 출력 시퀀스의 조건부 확률을 학습하기 위한 새로운 신경망 구조를 소개합니다. 이러한 문제는 기존의 시퀀스-투-시퀀스(sequence-to-sequence) [1]나 신경 튜링 머신(Neural Turing Machines) [2]과 같은 접근 방식으로는 간단히 해결할 수 없습니다. 왜냐하면 출력의 각 단계에서 타겟 클래스의 수가 가변적인 입력의 길이..