The training method is very similar to Importance Weighted Autoencoders: https://arxiv.org/abs/1509.00519
In what way is it similar?
Yeah. This work is over claiming the novelty quite a bit.
In what way is it similar?