x-jeff blog

Make progress every day.

【论文阅读】Robust calculation of the midsagittal plane in CT scans using the Kullback–Leibler’s measure

Midsagittal plane,CT,Symmetry,Stroke

本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.Introduction 大脑半球间裂(the Interhemispheric Fissure,IF),也称大脑纵裂(the longitudinal cerebral fissure),是人脑中重要的解剖标志之一。通常使用正中矢状面(the MidSagittal Plane,MSP)来近似表示半球间裂。MSP将大...

【论文阅读】Extraction of the midsagittal plane from morphological neuroimages using the Kullback–Leibler’s measure

Midsagittal plane,Interhemispheric fissure,Kullback–Leibler’s measure,Talairach transformation

本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.Introduction 表1列出了之前MSP(MidSagittal Plane)提取的一些方法: 本文提出使用KL度量直接从三维体数据中提取MSP。该算法平均耗时约为5秒,且可应用于CT和MRI数据。 2.Method 2.1.Definitions 这部分主要讲了KL度量,这里不再详述。 假设有两个...

【深度强化学习】【2】Proximal Policy Optimization

off-policy,TRPO,PPO,PPO2

本文为参考李宏毅老师的”Deep Reinforcement Learning, 2018”课程所作的个人笔记。 课程YouTube地址:Deep Reinforcement Learning, 2018。 本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.on-policy vs off-policy 关于on-policy和off-policy的...

【深度强化学习】【1】Policy Gradient

Policy Gradient

本文为参考李宏毅老师的”Deep Reinforcement Learning, 2018”课程所作的个人笔记。 课程YouTube地址:Deep Reinforcement Learning, 2018。 本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.Policy Gradient 下图是RL的简要流程说明: 关于RL的一些基础知识不在此...

【机器学习基础】第七十八课:[强化学习]模仿学习

直接模仿学习,逆强化学习

【机器学习基础】系列博客为参考周志华老师的《机器学习》一书,自己所做的读书笔记。 本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.模仿学习 在强化学习的经典任务设置中,机器所能获得的反馈信息仅有多步决策后的累积奖赏,但在现实任务中,往往能得到人类专家的决策过程范例,例如在种瓜任务上能得到农业专家的种植过程范例。从这样的范例中学习,称为“模仿学习”(imitation...

【机器学习基础】第七十七课:[强化学习]值函数近似

线性值函数近似Sarsa算法

【机器学习基础】系列博客为参考周志华老师的《机器学习》一书,自己所做的读书笔记。 本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.值函数近似 前面我们一直假定强化学习任务是在有限状态空间上进行,每个状态可用一个编号来指代;值函数则是关于有限状态的“表格值函数”(tabular value function),即值函数能表示为一个数组,输入$i$对应的函数值就是数组元...

【机器学习基础】第七十六课:[强化学习]免模型学习

蒙特卡罗强化学习,同策略,异策略,时序差分学习,Sarsa算法,Q-learning算法

【机器学习基础】系列博客为参考周志华老师的《机器学习》一书,自己所做的读书笔记。 本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.免模型学习 在现实的强化学习任务中,环境的转移概率、奖赏函数往往很难得知,甚至很难知道环境中一共有多少状态。若学习算法不依赖于环境建模,则称为“免模型学习”(model-free learning),这比有模型学习要困难得多。 2.蒙特...

【机器学习基础】第七十五课:[强化学习]有模型学习

有模型学习

【机器学习基础】系列博客为参考周志华老师的《机器学习》一书,自己所做的读书笔记。 本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.有模型学习 考虑多步强化学习任务,暂且先假定任务对应的马尔可夫决策过程四元组$E=<X,A,P,R>$均为已知,这样的情形称为“模型已知”,即机器已对环境进行了建模,能在机器内部模拟出与环境相同或近似的状况。在已知模型的环境中...

【机器学习基础】第七十四课:[强化学习]K-摇臂赌博机

强化学习

【机器学习基础】系列博客为参考周志华老师的《机器学习》一书,自己所做的读书笔记。 本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.探索与利用 与一般监督学习不同,强化学习任务的最终奖赏是在多步动作之后才能观察到,这里我们不妨先考虑比较简单的情形:最大化单步奖赏,即仅考虑一步操作。需注意的是,即便在这样的简化情形下,强化学习仍与监督学习有显著不同,因为机器需通过尝试来...

【机器学习基础】第七十三课:[强化学习]任务与奖赏

强化学习

【机器学习基础】系列博客为参考周志华老师的《机器学习》一书,自己所做的读书笔记。 本文为原创文章,未经本人允许,禁止转载。转载请注明出处。 1.任务与奖赏 图16.1给出了强化学习的一个简单图示。强化学习任务通常用马尔可夫决策过程(Markov Decision Process,简称MDP)来描述:机器处于环境$E$中,状态空间为$X$,其中每个状态$x \in X$是机器感...