본문 바로가기

전체 글

(20)
[Spinning Up 해석] Part 3 : Intro to Policy Optimization [Reference] OpenAI Spinning Up - Introduction to RL - Part 3 : Intro to Policy Optimization Part 3에서는 정책 최적화 알고리즘의 수학적 기초를 살펴보고, 샘플 코드와 연결해본다. 정책 그레디언트(policy gradients) 이론의 다음 세 가지 주요 결과를 다룬다.정책 파라미터에 대한 정책 성능의 그레디언트를 설명하는 가장 간단한 방정식,해당 표현식에서 쓸모없는 항을 삭제할 수 있는 규칙,그리고 해당 표현식에 유용한 항을 추가할 수 있는 규칙.마지막으로, 이 세 가지를 결합해 정책 그래디언트에 대한 advantage-based 표현식을 설명한다. 이는 우리가 구현할 Vanilla Policy Gradient 에서 사용할 ..
[Spinning Up 해석] Part 2 : Kinds of RL Algorithms [Reference] OpenAI Spinning Up - Introduction to RL - Part 2 : Kinds of RL Algorithms RL 알고리즘의 분류 (A Taxonomy of RL Algorithms) 위 표는 완전한 것은 아니지만, 아래의 목적을 위해 설계되었다.다양한 RL 알고리즘의 기초 디자인 선택을 파악알고리즘 간의 trade-off 보여주기대표적인 현대 알고리즘을 이러한 맥락에서 위치시키기 Model-Free vs. Model-Based RLRL 알고리즘에서 핵심 질문💡 에이전트가 환경 모델을 가지는가 (또는 학습하는가)?환경 모델 (enviroment model) : 상태 전이와 보상을 예측하는 함수환경 모델을 알면 여러 옵션들 중 어떤 것을 선택할지 명시적으로 결..
[Spinning Up 해석] Part 1 : Key Concepts in RL [Reference] OpenAI Spinning Up - Introduction to RL - Part 1 : Key Concepts in RL 종종 참고할 수 있을 것 같아서 번역 및 정리를 해보려고 합니다.잘 이해 안되는 부분은 보충 설명도 조금씩 추가했습니다. Last update : 26.03.23 핵심 개념 및 용어 강화학습(RL)의 주인공은 에이전트(agent)와 환경(environment)이다. 환경은 에이전트가 살고 상호작용하는 world이다. 매 상호작용 스텝에서, 에이전트는 world의 상태(state)를 (부분적으로) 관측하고 취할 행동(action)을 결정한다. 환경은 그 행동에 반응해 보상(reward)와 다음 상태를 반환한다. 때때로 환경은 혼자 변화하기도 한다. 앞으로 다음..
JPS(Jump Point Search) 알고리즘 Reference[1] Online Graph Pruning for Pathfinding on Grid Maps (2011 Proceedings of the AAAI conference on artificial intelligence)[2] Improving Jump Point Search (2014 Proceedings of the International Conference on Automated Planning and Scheduling)  Related Work그리드 맵에서 경로 탐색 문제를 풀 때, 대칭 경로가 많아 탐색 공간이 커지는 문제가 있다. 기존 해결책들로는Dead-end heuristic(2006), Swamps(2010) : 그리드 맵을 인접한 지역의 series로 분해하고, 이를 ..
[논문 리뷰] PoinTr(CVPR 2021) PoinTr: Diverse Point Cloud Completion with Geometry-Aware Transformers 트랜스포머 엔코더-디코더 구조 사용하여 포인트 클라우드를 완성하는 네트워크 Motivation 1. Bottleneck problem기존 point cloud 완성 연구들은 엔코딩 단계의 max-pooling 연산에서 fine-grained 정보를 잃고 디코딩 단계에서 복구가 불가능한 bottleneck 문제가 있다. (PointNet 등에서 포인트 클라우드에서 포인트를 랜덤하게 뽑아서 그런듯) 2. Transformer 네트워크완전한 포인트 클라우드를 구성하는 작업은 unstructured, unordered 성질을 가진 포인트 클라우드와 반대된다.→ local parts의 ..
포인트 클라우드 평가 지표(Evaluation Metric) - Chamfer distance, F-score, etc. Point cloud evaluation Code두 포인트 클라우드의 유사도를 평가하는 지표를 구현해둔 깃허브입니다.구현된 지표는 다음과 같습니다.Precision/Recall/F-score point-to-pointPrecision/Recall/F-score point-to-planeRMSE point-to-pointRMSE point-to-planeChamfer Distance point-to-pointChamfer Distance point-to-planeHausdorff-95%https://github.com/owl-d/PointCloud-Evaluation GitHub - owl-d/PointCloud-Evaluation: point cloud evaluation with cpppoint clo..
[논문 리뷰] Pred-NBV (IROS 2023) Pred-NBV: Prediction-guided Next-Best-View Planning for 3D Object Reconstruction   NBV planning 는 센서의 다음 포즈를 결정한다.기존 방법들은 기하학적 정보를 사용하였다.Pred-NBV는 인공신경망으로 3D 재구성한 것을 기반으로 정보 획득 계산 1. Contribution PoinTr-C : 3D 재구성 네트워크커리큘럼 학습 사용부분 포인트 클라우드가 실제 중심에 있지 않아도 됨기본이 되는 모델인 PoinTr보다 최소 23.06% 좋은 성능NBV 프레임워크예측 기반 정보 획득을 최대화하고 로봇이 움직여야 하는 거리를 최소화geometry에 대해 사전 지식 없이 객체 재구성 수행좋은 성능💡 커리큘럼 학습(Curriculum Le..
[논문 리뷰] Gaussian Splatting: 3D Reconstruction and Novel View Synthesis, a Review Gaussian Splatting: 3D Reconstruction and Novel View Synthesis, a ReviewAuthor : ANURAG DALAL , (Graduate Student, IEEE), DANIEL HAGEN ROBBERSMYR , (Member, IEEE) 3D reconstruction 방법traditional algorithm : photogrammetry, MVS(Multi View Stereo)modern approach : NeRF(Neural Radiance Field), Gaussian Splatting 3D 데이터 representation1. traditional approaches : point cloud, mesh, voxelmesh는 point cl..