lec 11 truncated censored data

Truncated data : 某些对象在某些选择效应中没有被考虑到 比如亮度过于低的信号没有被 CCD 记录到

Censored data : 某些对象我们知道它存在, 但只能给出它的上限或者下限 比如在光学波段不能记录 X - ray 源的信号

一个例子: arXiv: 1502.02201 测量了不同天文爆发现象中微波亮度和 X-ray 亮度之间的关系, 得到了一个线性关系 这些现象涵盖了不同尺度, 不同时间的关系可能来自同一起源 这对吗?

Selection effects and biases

没有观测到并不意味着不存在

一个没有被探测到信号一般是低于了我们的分辨极限

这些探测信号也能揭露一些信息: 没有探测到也是一个信息 这些事实也能带给我们一些信息

大多数观测量都和距离有关, 例如

一个表观量 X^\hat{X} 和本征量 XX 一般服从关系

X^=f(X,D)\hat{X}=f(X,D)

Malmquist bias 从测量极限中得到的选择效应的偏差

一个 toy universe 的例子: 对于平直的半径为 1 的宇宙, 均匀分布着点源, 每个点源分配了一个光度 LL 光度的分布满足 p(L)L3Lmin=1p(L)\propto L^{-3} \quad L_{\min}=1 , 而通量 F=L/4πD2F = L/4\pi D^2 . 在设置了一个探测极限 Fmin=10F_{min}=10 后 得到的通量分布可以看到, 对于 大 LLDD 的区域的密度较低 在加入了观测极限后, 这大大减少了数据小大 DDLL 区域上的分布, 而恰恰是数据在这些区域分布的最多, 则在联合密度分布上甚至看起来是一个线性关系了,具体地 联合密度分布可以如下得到

dN(L,D)=ρ(L)dLdV(D)L3D2dLdD\mathrm{d}N(L,D)=\rho(L)\mathrm{d}L\mathrm{d}V(D)\propto L^{-3}D^2\mathrm{d}L\mathrm{d}D

做了标度变换之后

p(logL,logD)=dN(L,D)dlogDdlogLL2D3p(\log L,\log D)=\frac{\mathrm{d}N(L,D)}{\mathrm{d}\log D\mathrm{d}\log L}\propto L^{-2}D^3

而探测极限给出了图上区域的一个分割 Llim(D)D2L_{\lim}(D)\propto D^2 导致联合分布图上的结构变化, 这可能使我们得到错误的结论 同样, 亮度的分布函数也可以得到, 方法是通过条件概率考虑测量极限, 在给定光度 LL 下考察 FF 的 CDF

dN(>FL)=ρ(L)dLVmax(>Dmax)\mathrm{d}N(>F\mid L)=\rho(L)\mathrm{d}L\cdot V_{\max}(>D_{\max})

注意这里的意思是在给定光度 LL 下, 通亮大于 FF 的粒子数, 这些粒子都分布在一个最大的球壳内, 在球壳外的粒子的通亮都小于观测极限, 至于球壳内粒子的分布实际上是光度 LL 的函数

DmaxLFD_{\max}\propto \sqrt{\frac{L}{F}}

从而

dN(>FL)ρ(L)dLDmax3=L3/2F3/2ρ(L)dL\mathrm{d}N(>F\mid L)\propto\rho(L)\mathrm{d}LD_{\max}^3=L^{3/2}F^{-3/2}\rho(L)\mathrm{d}L

积分得到 CDF 再求导得到 PDF

p(F)F5/2p(logF)F3/2p(F)\propto F^{-5/2}\quad p(\log F)\propto F^{-3/2}

即通量分布为

p(logF^)F^3/2p(\log \hat{F})\propto \hat{F}^{-3/2}

并且可以发现, 结果和光度的分布没有关系, 这实际上是光度的>分布是一个几何效应, 即 universal flux distribution

探测极限的选择效应不会对通量分布带来偏差 而对于光度分布, 在考虑了观测极限后,

p(L^)dL^=p(L)dL×Vmax(L)p(\hat{L})\mathrm{d}\hat{L} = p(L)\mathrm{d}L \times V_{\max}(L)

这里

DmaxLFlimD_{\max}\propto \sqrt{\frac{L}{F_{\lim}}}

因为存在观测极限, 所以观测到的通量分布并非在空间中均匀, 于是

p(L^)L^3/2p(logL^)L^1/2p(\hat{L})\propto \hat{L}^{-3/2}\quad p(\log \hat{L})\propto \hat{L}^{-1/2}

这是一个 malmquist bias

现在考虑两个波段的光度, 即再次进行一次采样

现在考虑两个用分布采样两个光度分布

结果是看起来居然有线性关系?

结果是因为两者都和一个变量产生了相关性, 即表观量都和距离 DD 有相关性

Summary

  1. 这是一个重要的问题
  2. 来源于观测极限和体积的几何效应
  3. 这导致了表观光度和距离的相关性

另一类选择效应来自于观测误差

表观量中总含有误差成分 比如观测恒星的亮度 即使是对称的误差分布也会导致不对称的偏差

Eddington bias 在探测极限附近, 也会高估观测结果

一个表观的通量通常有一个观测误差

考虑到在观测极限边界的那些值, 观测到的点由于误差不被观测到, 而观测得到的点由于误差可能被观测到, 使得误差对两种情形在表观通量观测上的影响不再对称 得到了一个非对称的分布 考虑表观的通量分布

p(F^)F^5/2p(\hat{F})\propto\hat{F}^{-5/2}

加入高斯的误差项

F^=F^+N(0,52)\hat{F}'=\hat{F}+\mathcal{N}(0,5^2)

带误差的通量分布函数为

p(F^)p(F)ε(F^F)dFp(\hat{F}')\propto\int p(F)\varepsilon(\hat{F}'\mid F)\mathrm{d}F

如果考虑观测极限的积分限 结果是在探测极限附近看到暗的源变多了

在带有 Truncated data 下的估计

前面的光度容易收到很多效应的影响 一般的解决方法是: 建模这些效应然后做统计推断

也有在一些特殊假设下的简单估计

一种笨办法是 Volume - limited subsamples 一种方法是选择一个没有被截断效应影响的分布区域 这可以给出一个无偏估计

缺点是

V max method

想法是认为每个探测对象都具有代表性, 它能给出一个最大探测极限体积 这依赖于宇宙各向同性均匀密度的假设, 则应该认为这样的源均匀分布在这个最大探测体积之内, 则 ui=Vi/Vmax,iu_i = V_i/V_{\max,i} 是一个均匀分布的变量 估计的光度函数来源于权 1/Vmax,i1/V_{\max,i} 得到分布

N^(L)=1ΔLLΔL/2LiL+ΔL/21Vmax,i\hat{N}(L) = \frac{1}{\Delta L} \sum_{L-\Delta L/2\leq L_i\leq L+\Delta L/2 }\frac{1}{V_{\max,i}}

这依赖于均匀分布的假设, 对其他分布, 效果相当差

C- method

假设是光度和距离是独立的, 并且通量的截断是尖锐的

Summary 在一个有探测极限下估计分布的方法

Survival analysis with censored data

Toy universe 目标: 修正光学波段和 X - ray 波段的关联

观测 最初的数据是光学波段的样本, 将光学波段的样本再做一次 X - ray 波段的观测

故有 X 波段有两部分样本

我们知道结果: 光学和射电波段的光度不应该有相关性 而我们只有 detected 的data , 因为 X - ray 波段的探测具有人为性

模拟的结果是如果只考虑 detected data 的话, 则表示两个波段的光度有巨大的相关性

这个例子说明我们应该上统计课(

对 Detected 的样本做统计推断, 比如用一个线性模型但带一个 noise

一个替代的模型是没有相关性

得到似然

先验

结果是

当考虑 cencored data 的时候

结果是

甚至证据

结果是这些 censored 的数据让这种相关性丢失了

Summary