Computational linguistics

When two models are evaluated on identical tokenized test data under the same scoring convention, what does lower perplexity generally indicate?